Auffindbarkeit
Recall@k misst, wie viele annotierte relevante Dokumente in den ersten k Treffern enthalten sind. Segmentierung, Suche und Reranking werden einzeln variiert.
Forschung / AI Engineering
Wie entstehen AI-Anwendungen, deren Antworten überprüfbar und deren Grenzen messbar sind? Der Schwerpunkt verbindet Sprachmodelle, Wissenszugriff und systematische Evaluation.
01 / MODEL
Sprachmodelle verarbeiten Tokens im Kontext. Attention gewichtet, welche Positionen für eine Repräsentation relevant sind.
Q, K und V entstehen durch gelernte Projektionen der Eingaberepräsentationen. Skalierten Ähnlichkeitswerten folgt eine Normalisierung; die Gewichte bestimmen die Mischung der Values.
Grundlage: Attention Is All You NeedDie Formel zeigt einen Attention-Kopf. Ein vollständiger Transformer ergänzt unter anderem mehrere Köpfe, Positionsinformation, Feedforward-Schichten und Residualverbindungen. Attention-Gewichte allein sind keine verlässliche Erklärung einer Modellentscheidung.
Einordnung: Attention is not ExplanationCAUSAL SELF-ATTENTION
Jede Zeile steht für eine Query-Position, jede Spalte für eine Key-Position. Die Gewichte über zugängliche Positionen ergeben zusammen eins. Dunklere Felder zeigen höhere Gewichte.
Eine kausale Maske sperrt zukünftige Positionen. Bei der Generierung kann ein Token nur die eigene und vorherige Positionen berücksichtigen.
| Q ↓ / K → | Ein | System | zieht | um |
|---|---|---|---|---|
| Ein | 1,00 | — | — | — |
| System | 0,27 | 0,73 | — | — |
| zieht | 0,10 | 0,30 | 0,60 | — |
| um | 0,10 | 0,20 | 0,25 | 0,45 |
02 / RETRIEVAL
Retrieval-Augmented Generation (RAG) ergänzt die Generierung durch auffindbare externe Informationen. Der Index kann unabhängig vom Sprachmodell aktualisiert werden.
RAG · Referenzarchitektur
02Die Forschungsfragen beginnen vor dem Prompt: Welche Segmentierung erhält den Zusammenhang? Wann hilft eine Kombination aus semantischer und lexikalischer Suche? Verbessert ein Reranker die Auswahl tatsächlich relevanter Quellen?
Ein relevanter Treffer garantiert noch keine belegte Antwort. Deshalb müssen Retrieval, Quellenzuordnung und Generierung getrennt geprüft werden. Für Anfragen ohne ausreichende Evidenz gehört eine erkennbare Enthaltung zum Systemverhalten.
03 / EVALUATION
Die geplanten Untersuchungen vergleichen kontrollierte Varianten auf einem versionierten Testkorpus. Einzelne überzeugende Antworten ersetzen keine Auswertung.
Recall@k misst, wie viele annotierte relevante Dokumente in den ersten k Treffern enthalten sind. Segmentierung, Suche und Reranking werden einzeln variiert.
Antwortaussagen werden mit den Quellen abgeglichen. Auch widersprüchliche Dokumente, fehlende Belege und unbeantwortbare Fragen gehören in den Testkorpus.
Antwortzeiten, Ressourcenbedarf und Fehlerfälle werden gemeinsam betrachtet. Berechtigungsfilter und der Umgang mit Anweisungen in Dokumenten sind Teil der Systemprüfung.
Forschung & Praxis
GremienPilot ist das bestehende Open-Source-Projekt mit dem HPI: Audio wird transkribiert, Redebeiträge werden zugeordnet und Protokollentwürfe vor dem Export geprüft.
RAG-Systeme und die systematische Evaluation von Sprachmodellen bilden den weiteren Forschungsausblick. Die gezeigte RAG-Architektur ist ein Referenzmodell; hier werden noch keine Ergebnisse einer abgeschlossenen RAG-Studie ausgewiesen.