Die Datenpipeline entscheidet mit
Vor der Suche stehen Extraktion, Bereinigung, Strukturierung und Berechtigungsübernahme. Fehler in diesen Schritten erscheinen später als schlechte oder widersprüchliche Antworten.
Eine belastbare Pipeline macht sichtbar, wann Inhalte zuletzt verarbeitet wurden, welche Version gilt und warum ein Dokument nicht indexiert werden konnte.
Retrieval braucht einen überprüfbaren Maßstab
Hybrid Search, semantisches Ranking und Query Rewriting sind Werkzeuge. Ihre Wirkung sollte an realen Fragen und erwarteten Quellen gemessen werden.
- Testfragen aus tatsächlichen Arbeitsabläufen
- Erwartete Dokumente und zulässige Alternativen
- Messung von Trefferqualität, Antworttreue und Latenz
- Getrennte Auswertung nach Inhaltstyp und Nutzerrolle
Berechtigungen sind Teil der Relevanz
Ein fachlich passender Treffer ist unbrauchbar, wenn der Nutzer ihn nicht sehen darf. Identität und Zugriffsregeln müssen deshalb bis in den Suchindex und die Antwortgenerierung durchgängig bleiben.