Evaluation & Managed Operations
Ein Modell, das am Launch-Tag korrekt arbeitet, kann 90 Tage später still versagen. Wir merken es zuerst, nicht Ihr Kunde.
KI-Systeme scheitern anders
Sie stürzen nicht ab. Sie werden langsam schlechter. Es gibt keinen Alarm, nur langsam sinkende Qualität, die irgendwann jemand im Geschäftsergebnis sieht.
Die Datengrundlage verschiebt sich, ein Modellanbieter aktualisiert im Hintergrund, ein geändertes Prompt-Template verschlechtert die Ausgabe in einem Randfall, den niemand testet.
Dagegen hilft nur Messung. Systematisch, automatisiert, kontinuierlich.
Evaluation
Fünf Messungen, die stillen Qualitätsverfall sichtbar machen
Qualitätsprüfung
Automatisierte Bewertung auf Korrektheit, Belegbarkeit (sind die Aussagen durch die hinterlegten Quellen gedeckt), Konsistenz und fachliche Zielerreichung.
Halluzinationserkennung
Ausgaben werden gegen die Quelldaten geprüft. Nicht belegbare Aussagen werden markiert oder blockiert.
Regressionstests
Jede Änderung an Modell, Konfiguration oder Anweisungen läuft gegen einen festen Testsatz, bevor sie produktiv geht.
Red Teaming
Gezielte Angriffe auf das System: Prompt Injection, Umgehung der Guardrails, Datenabfluss über Werkzeuge.
Kostenaudit
Wo entstehen Kosten, welcher Anwendungsfall trägt sich, welcher nicht.
Managed Operations
Drei Servicestufen mit definierten Reaktionszeiten
| Monitor | Operate | Evolve | |
|---|---|---|---|
| Monitoring & Alerting | |||
| Reaktionszeit P1 | 8 h | 4 h | 2 h |
| Incident Response | Meldung | Behebung | Behebung |
| Prüfung auf Qualitätsverfall | monatlich | wöchentlich | laufend |
| Kostenreporting | |||
| Vollständiger Prüflauf | quartalsweise | monatlich | laufend |
| Weiterentwicklung | Kontingent |
Ehrlich gesagt: Wir sind ein kleines, erfahrenes Team, keine Nachtschicht-Fabrik. Deshalb übernehmen wir nur Systeme, deren Betrieb wir wirklich tragen können. Eskalation, Vertretung und Übergabe legen wir vor dem ersten Tag schriftlich fest, damit kein Reaktionszeit-Versprechen an einer einzelnen Person hängt.
Projektbeispiel
Vier Stunden statt elf Wochen bis zur Erkennung
Qualitätsverfall nach 90 Tagen
Ein Kunde betrieb einen Support-Agenten, der zunächst zuverlässig arbeitete. Nach knapp drei Monaten häuften sich Beschwerden, ohne dass ein Fehler im Log auftauchte. Die Ursache: Der Modellanbieter hatte im Hintergrund aktualisiert, und ein Randfall in den Anweisungen, den niemand getestet hatte, führte zu erfundenen Preisangaben. Wir haben eine Qualitätsprüfung aufgesetzt, die täglich gegen einen festen Testsatz prüft und misst, ob die Aussagen durch die hinterlegten Quellen gedeckt sind, sowie Regressionstests, die vor jeder Änderung laufen. Der nächste stille Modellwechsel wurde nach vier Stunden erkannt, nicht nach elf Wochen.
Stiller Modellwechsel in Stunden statt Wochen erkannt
Antwortqualität laufend gemessen und belegt
Keine erfundenen Angaben mehr im Betrieb
Sieben weitere Bausteine bis zum Produktivsystem
AI Readiness Assessment
Inventar, Schwachstellenanalyse und Roadmap bis Produktion. In 10 Arbeitstagen.
Mehr erfahrenPrivate AI & On-Premises
KI im eigenen Haus betreiben: lokale Modelle, eigene Hardware, volle Datenhoheit.
Mehr erfahrenAI Security & Compliance
Härtung, ISO-orientierte Nachweise und Datenschutz für den KI-Betrieb.
Mehr erfahrenProduction Hardening
Den vorhandenen Piloten betriebstauglich machen: Fehlerbehandlung, Randfälle, Human-in-the-Loop.
Mehr erfahrenAgent Governance & Guardrails
Berechtigungen, Tool-Zugriff, Freigabe-Workflows und lückenlose Audit-Logs.
Mehr erfahrenAI Infrastructure & Deployment
Cloud, Datenpipelines, Versionsverwaltung und Deployment mit Rollback.
Mehr erfahrenEnterprise System Integration
Agenten an ERP, CRM und Legacy anbinden. Mit Rechtemodell und Rollback.
Mehr erfahrenSystem in Produktion?
Wir übernehmen Monitoring, Evaluation und Incident Response, damit stiller Qualitätsverfall auffällt, bevor Ihr Kunde ihn sieht.