MILIEVAL
Evaluation & Observability: hat diese Änderung etwas verbessert oder verschlechtert?
„Sieht gut aus“ ist kein Grund, produktiv zu gehen. MiliEval stellt aus echten Tickets, Fragen und Dokumenten ein Evaluationsset mit Referenzantworten zusammen, führt es bei jeder Prompt-Änderung, jedem Modellwechsel und jedem neuen Tool erneut aus und listet Beispiel für Beispiel auf, was besser und was schlechter geworden ist. Nach dem Start werden laufende Sitzungen stichprobenweise geprüft, und die Probleme, die der Produktivbetrieb zutage fördert, fließen zurück in das Evaluationsset, damit die Baseline mit dem Geschäft Schritt hält.
- Evaluationssets aus Fachbeispielen Aufgebaut aus echten Tickets und Fragen, mit den gängigen Formulierungen und den bekannten Grenzfällen
- Automatische Bewertung plus menschliche Prüfung Zuerst bewerten Regeln und Modelle; bei Abweichungen entscheidet ein Prüfer, dessen Antwort zur Referenz wird
- Regression von Version zu Version Zwei beliebige Versionen lassen sich Beispiel für Beispiel vergleichen, Verschlechterungen werden separat ausgewiesen statt im Mittelwert unterzugehen
- Live-Tracing und Alarme Stichproben laufender Sitzungen werden geprüft, und ein Alarm wird ausgelöst, sobald Trefferquote, Latenz oder Kosten die Schwelle überschreiten
Evaluationsset-Verwaltung
Regelbasierte Bewertung
Modellbasierte Bewertung
Menschliche Prüfung
Regressions-Dashboard
Schwellenwert-Alarme
Erste Abnahmekriterien gemeinsam festlegen