Tools - SourceToAI
Das Kontext-Problem beim Einsatz von Sprachmodellen
Moderne Sprachmodelle (wie Claude, ChatGPT oder lokale Coding-Assistenten) können Software-Architekten und Entwickler bei Code-Reviews, Refactorings und API-Designs unterstützen – vorausgesetzt, sie erhalten den relevanten Systemkontext.
Bei realen .NET-Projekten stößt die manuelle Bereitstellung von Code jedoch schnell an praktische Grenzen:
- Token-Verschwendung & Kontext-Limits: Hunderte unbereinigte Quellcodedateien sprengen das Kontextbudget und verursachen unnötige Kosten oder Aufmerksamkeitsverluste.
- Starre Upload-Grenzen: Web-KIs begrenzen Datei-Uploads häufig (z. B. auf maximal 10 Dokumente pro Prompt). Ein großes Projekt manuell in handhabbare Stücke zu zerlegen, ist zeitaufwendig und fehleranfällig.
- Black-Box-Bibliotheken: In gewachsenen Unternehmensumgebungen liegen Kernkomponenten oder Schnittstellen oft nur als kompilierte Binärdateien (
.dlloder.exe) ohne zugängliches Quellcode-Repository vor.
SourceToAI löst diese Hürden vollständig offline. Das Tool transformiert lokale C#-Solutions und kompilierte .NET-Assemblies in strukturierte, token-effiziente Markdown-Feeds, die präzise auf die Anforderungen von LLMs zugeschnitten sind.
1. Multi-View-Export: Kontext nach Maß
Nicht jede Analyseaufgabe benötigt den vollständigen Quellcode bis ins letzte Implementierungsdetail. SourceToAI generiert aus derselben Codebasis parallel vier spezialisierte Sichten („Views“):
signatures-only(Token-Sparmodus): Extrahiert ausschließlich Typ-, Interface- und Methodensignaturen ohne Methodenrümpfe. Dies spart bis zu 80–90 % des Token-Budgets und liefert der KI den perfekten Überblick für Architekturanalysen und Schnittstellendesign.public-only(API-Fokus): Beschränkt sich auf die öffentlich sichtbare Schnittstelle eines Projekts – ideal für Integrationsprüfungen und Dokumentationserstellung.dto-only(Datenmodell-Fokus): Isoliert reine Datentransferobjekte, Entities und Record-Definitionen.complete(Vollständige Codebasis): Der vollständige Quellcode inklusive relevanter Begleitdokumente und strukturierter Konfigurationen (.json,.sql,.razor, Markdown-Docs).
2. Adaptives Namespace-Clustering: Intelligentes Splitting
Um große Enterprise-Projekte für Web-LLMs handhabbar zu machen, zerlegt SourceToAI den Code nicht willkürlich nach Zeilenzahlen, sondern orientiert sich an der fachlichen Struktur:
- Namespace-Baumanalyse: Das Tool analysiert die C#-Namespace-Hierarchie und fusioniert kleinere, logisch zusammengehörige Namensräume bottom-up zu konsistenten Markdown-Dateien.
- Garantierte Upload-Limits: Über konfigurierbare Grenzwerte für Dateianzahl (
--max-file-count) und Ziel-Dateigröße (--max-file-size) wird sichergestellt, dass die resultierenden Feeds exakt in die Upload-Beschränkungen der Zielplattform passen. - Saubere Asset-Trennung: Begleitende Ressourcen (SQL-Skripte, HTML, Konfigurationsdateien) werden in strukturierte Asset-Feeds ausgelagert, während die Dateinamen im Explorer lückenlos sortiert bleiben.
3. Integrierte Assembly-Dekompilierung (ILSpy-Engine)
SourceToAI schließt die Lücke zu Closed-Source- und Drittanbieter-Komponenten:
- Direkte Binäranalyse: Liest
.dll- und.exe-Dateien per Dateipfad oder direkt aus dem Windows Global Assembly Cache (GAC). - Automatisierte Dekompilierung: Über die bewährte ILSpy-Engine (
ICSharpCode.Decompiler) werden Binärdateien lokal in sauberen C#-Quellcode dekompiliert und nahtlos in die Multi-View-Exporte eingespeist. - Mischbetrieb: Eigene Quellcode-Repositories und externe Binärbibliotheken können in einem einzigen Durchlauf gemeinsam verarbeitet und in Relation gesetzt werden.
4. Datensicherheit & Lokaler Schutz
- 100 % Offline: Sämtliche Analysen, Dekompilierungen und Exporte finden rein lokal auf dem Entwicklungsrechner statt. Kein geistiges Eigentum und kein Quellcode verlässt die eigene Infrastruktur.
- Überschreibschutz (
.sta-marker): Ein integrierter Sicherheitsmarker verhindert, dass Zielordner versehentlich überschrieben oder fremde Verzeichnisinhalte beschädigt werden.
Fazit
SourceToAI schlägt die Brücke zwischen mächtigen Sprachmodellen und realen .NET-Codebasen. Es liefert KI-Agenten und Web-Chats präzise den Kontext, den sie für fundierte Architektur- und Entwicklungsaufgaben benötigen – ohne Token-Ballast und ohne Sicherheitsrisiko.
Vollständig Open Source unter MIT-Lizenz auf GitHub.