Kurz gesagt
Warum bleiben KI-Projekte vor dem Livegang stecken?
Die meisten KI-Projekte bleiben stecken, weil nicht die Modellqualität fehlt, sondern drei Dinge: ein messbares Kriterium dafür, was als Erfolg gilt, eine Kostenrechnung pro Vorgang und eine Fachabteilung, die das System verantwortet. Ein ungemessenes Modell kann keine Verbesserung belegen, ein System mit unbekannten Kosten bekommt keine Budgetfreigabe, und ein Dienst ohne Verantwortlichen wird beim ersten Ausfall abgeschaltet.
Die meisten Unternehmens-KI-Piloten, die wir in den vergangenen zwei Jahren geprüft haben, waren technisch erfolgreich. Die Modelle funktionierten, die Demos beeindruckten, die Führung war begeistert. In Produktion gegangen sind sie trotzdem nie.
Welche drei Dinge fehlen gescheiterten Piloten?
Gescheiterten Piloten fehlten fast immer dieselben drei Dinge: ein messbares Abnahmekriterium, ein Kostenmodell pro Transaktion und ein operativer Verantwortlicher.
- Ein Modell ohne Evaluationsdatensatz kann nicht belegen, dass es besser geworden ist.
- Ein System mit unbekannten Kosten bekommt keine Budgetfreigabe.
- Ein Dienst ohne Verantwortlichen wird beim ersten Ausfall abgeschaltet.
Warum ist der Evaluationsdatensatz der Vertrag des Projekts?
Das erste Artefakt, das wir in einem KI-Projekt schreiben, ist kein Code — es ist der Evaluationsdatensatz. Zwei- bis fünfhundert Beispiele aus realer Nutzung, mit erwarteten Ergebnissen. Er wird zum Kompass während der Entwicklung und zur Regressionssuite im Betrieb.
“Ein Modell, das Sie nicht messen, können Sie nicht verbessern; und ein Modell, dessen Verbesserung Sie nicht belegen können, können Sie nicht ausliefern.”
Wie modelliert man KI-Kosten am ersten Tag?
Kosten pro Token, Cache-Trefferquote, Retry-Policy und Kontextlänge verstärken sich gegenseitig. Dasselbe Produkt kann sich in den Stückkosten je nach diesen vier Entscheidungen um das Zehnfache unterscheiden. Diese Rechnung vor der Produktion aufzumachen ist weit günstiger als danach.
Warum erfolgt der Rollout in Stufen?
Verdichten Sie den Übergang nicht auf einen einzigen Moment. Wochen im Schattenbetrieb (das System entscheidet, aber nichts wird angewendet), dann im halbautonomen Modus (ein Mensch genehmigt), dann Autonomie — das sammelt Vertrauen und Trainingsdaten zugleich.
| Artefakt | Im Piloten | In Produktion |
|---|---|---|
| Evaluationsdatensatz | Eine Handvoll Beispiel-Prompts | 200–500 reale Beispiele mit erwarteten Ergebnissen |
| Kosten | Nicht gemessen | Pro Transaktion, inklusive Cache und Retries |
| Verantwortung | Das Projektteam | Ein benannter operativer Verantwortlicher |
| Im Fehlerfall | Die Demo wird wiederholt | Ein deterministischer Rückfallpfad |
| Monitoring | Keines | Qualitäts-, Latenz-, Kosten- und Drift-Alarme |
Quellen
- 01Regulation (EU) 2024/1689 — Artificial Intelligence ActAvrupa Birliği Resmî Gazetesi · 2024
- 02AI Risk Management Framework (AI RMF 1.0)NIST · 2023
- 03ISO/IEC 42001:2023 — Yapay zekâ yönetim sistemiISO/IEC · 2023
- 04GEO: Generative Engine OptimizationPrinceton University · ACM SIGKDD · 2024