Fiktives, realitätsnahes Szenario vom 17. Juli 2026. Ein Einkaufsagent eines Wiener Industriebetriebs läuft seit sechs Wochen. Das Dashboard ist grün: 99,9 Prozent verfügbar, stabile Latenz, keine API-Fehler. Trotzdem korrigieren Einkäufer immer mehr Empfehlungen. Seit einer Änderung der Wissensquelle bevorzugt der Agent bekannte Lieferanten; nach einem Prompt-Update eskaliert er seltener. Technisch ist nichts ausgefallen. Das Geschäftsergebnis driftet.

Das Szenario verdichtet typische Betriebsmuster; es ist kein Kundenfall und kein behauptetes Ergebnis. Das Problem sind nicht fehlende Logs, sondern eine Infrastrukturüberwachung, die Mission, Nachweis, Befugnis und menschliche Korrektur nicht sieht.

Der stille Fehler: Alles ist grün, der Prozess wird schlechter

Klassisches Monitoring prüft Verfügbarkeit, Fehler und Latenz. Ein KI-Agent kann jedoch HTTP 200 liefern und trotzdem alte Regeln nutzen, die falsche Quelle wählen, korrektes Werkzeug aus falschem Grund aufrufen, nötige Eskalation vermeiden oder überzeugende Arbeit erzeugen, die Mitarbeitende still korrigieren.

KI-Agenten-Monitoring verbindet technisches Verhalten mit akzeptierten Geschäftsergebnissen. Observability muss zeigen, welche Mission, Identität, Modell-, Prompt- und Policy-Version, Quellen, Tool Calls und Freigaben zu welchem Ergebnis führten.

Monitoring im KI-Agenten-Betriebssystem

Die KI-Agenten-Evaluation prüft vor dem Release. Gateway und Kontrollschicht setzen Regeln durch. Monitoring beobachtet Produktion und löst Review aus. Der Incident-Response-Plan übernimmt bei einem materiellen Ereignis. Vier Aufgaben, eine Evidence-Kette.

MONITOR: Sieben Fragen für jeden produktiven Agenten

M – Mission

Welche enge Aufgabe ist für wen, unter welcher Version und welchen Ausschlüssen erlaubt?

O – Outcome

Wurde das Ergebnis fachlich akzeptiert? Messen Sie Korrektur, Wiedereröffnung, Durchlaufzeit und Geschäftswirkung.

N – Network

Modell, Retrieval, Memory, Tools, Identitäten, Freigaben, Queues und Folgesysteme bilden einen Trace.

I – Intervention

Wann hat ein Mensch freigegeben, geändert, abgelehnt, gestoppt oder gerettet?

T – Telemetry

Korrelations-ID, Versionen, Quellen, Tool Calls, Policy-Entscheidungen, Retries, Kosten, Latenz und Outcome.

O – Operating Drift

Änderungen bei Eingaben, Wissen, Tools, Sprache, Regeln, Abnahme und Eskalation.

R – Review

Wer prüft welches Signal wann und darf einschränken, Regression starten, Rollback auslösen oder abschalten?

Evaluation Probes prüfen Quellen Befugnisse Werkzeuge und Ergebnisse eines produktiven KI-Agenten
Probes prüfen begrenzte Aussagen und Aktionen im Workflow; verantwortete menschliche Bewertung bleibt notwendig.

Golden Signals: Den Agenten messen, nicht nur die API

Golden Signals für produktive KI-Agenten
SignalFrageMessgrößeOwner
OutcomeBleibt Arbeit akzeptabel?Abnahme, Korrektur, Reopen, FolgefehlerBusiness Owner
GroundingSind Aussagen aktuell belegt?Belegquote, alte Quelle, KonfliktKnowledge Owner
BefugnisBleiben Aktionen in Daten-, Wert- und Tool-Grenzen?Denied Calls, Bypass, AusnahmeSecurity/Service
InterventionGreift der Mensch richtig ein?Eskalation, Override, Prüfzeit, stille KorrekturOperations
ResilienzScheitert der Ablauf kontrolliert?Retries, Schleifen, Duplikate, FallbackPlattform
ÖkonomieBleibt Nutzen nach Prüfung?Kosten pro akzeptiertem ErgebnisFinance/Business

Nach Workflow, Sprache, Kunde, Modell und Policy-Version segmentieren. Flottenmittelwerte verdecken lokale Verschlechterung.

Evaluation Probe: Produktionsspuren als prüfbare Aussage

Ein Probe ist ein begrenzter Check im oder nach dem Agenten-Workflow. Er prüft etwa Quellenbindung, Tool-Befugnis, vorhandene Freigabe oder fachliche Akzeptanz und liefert strukturiertes Urteil plus Grund. Beginnen Sie mit Grounding-, Authority- und Outcome-Probe. Hohe Konsequenz wird vollständig geprüft, niedriges Risiko sinnvoll gesampelt. Automated Judges werden gegen menschlich geprüfte Fälle validiert.

Drift: Sieben Veränderungen außerhalb des Token-Dashboards

  1. Input Drift: Sprache, Format oder Komplexität.
  2. Knowledge Drift: alte, fehlende oder widersprüchliche Quellen.
  3. Tool Drift: Schema, Recht oder Bedeutung einer Antwort.
  4. Behaviour Drift: Retries, Eskalation, Planung oder Quellenwahl.
  5. Human Drift: Durchklicken, stille Korrektur, Workaround.
  6. Outcome Drift: Abnahme, Kunde, Nacharbeit oder Finanzeffekt.
  7. Context Drift: Zweck, Markt, Recht oder Geschäftsregel.

Releases und externe Änderungen im Zeitverlauf annotieren. Korrelation löst Untersuchung aus, beweist aber keine Ursache.

Alert Policy: Jeder Alarm braucht eine Entscheidung

Ordnen Sie Bedingungen in Stop, Restrict, Review und Observe. Unbefugte Schreibaktion stoppt die Befugnis; unbelegte Aussagen setzen Draft-only; fallende Abnahme startet Regression; geringe Latenzänderung bleibt Beobachtung.

Beispiel einer Entscheidungsregel
BedingungEntscheidungEvidenceOwner
Unbefugter Tool CallIdentität und Write Queue stoppenTrace, Policy, Credential, ErgebnisIncident Commander
Grounding Hard StopDraft-only mit PrüfungAussage, Quellen, Probe, FälleBusiness/Knowledge
Abnahme unter BaselineKohorte prüfen, Regression laufen lassenFallmix, Version, Korrektur, OutcomeProzess Owner
Kosten steigenRouting, Retry und Tools analysierenRoute, Kosten, Latenz, AbnahmePlattform/Finance

Human Oversight: Die Beziehung überwachen

Ein Approval-Zähler beweist keine Aufsicht. Prüfen Sie, ob die richtige Person rechtzeitig Kontext, Quellen, Unsicherheit und Stopprecht hatte. Artikel 26 des AI Act beschreibt für High-Risk-Systeme unter anderem kompetente menschliche Aufsicht, Monitoring und Log-Aufbewahrung. Nicht jeder Agent ist High-Risk; Kompetenz, Befugnis und verwertbare Information sind dennoch gute Betriebsprinzipien.

Betriebsverantwortliche prüft Evidence und greift in einen überwachten KI-Agenten-Workflow ein
Aufsicht wirkt nur, wenn der Mensch Konsequenz versteht und die Aktion ändern oder stoppen kann.

Production Evidence Pack

  • Mission, Owner, Nutzer, Ausschlüsse, Freigabe.
  • Modell, Prompt, Retrieval, Tools, Rechte und Policy-Versionen.
  • Korrelations-ID für Anfrage, Quellen, Calls, Approval und Outcome.
  • Probe-Urteile, Unsicherheit, Fehler und Human Review.
  • Changes, Regression und Deployment-Anmerkungen.
  • Outcome, Nacharbeit, Kundeneffekt und Kosten.
  • Alert, Entscheidung, Restriction, Rollback und Abschluss.

Aufbewahrung folgt Zweck, Recht, Vertrag und Datenschutz. Observability ist keine Erlaubnis, jeden Prompt unbegrenzt zu speichern.

Monitoring-Kadenz

  • Live: Befugnisverletzung, kritischer Probe-Fehler, Schleife, Duplikat und Ausfall.
  • Täglich: Fallback, Latenz, Kosten, Quellenfrische und offene Queues.
  • Wöchentlich: Abnahme, Korrektur, Eskalation, Sprache und Drift.
  • Monatlich/Quartalsweise: Zweck, Nutzen, Risikoklasse, Vendor, Freigabe und Retirement.

30/60/90-Tage-Fahrplan

Tag 1-30

  1. Einen Agenten wählen und MONITOR schreiben.
  2. Outcome, Hard Stops, Baseline und Owner definieren.
  3. Request bis Outcome über eine Korrelations-ID verbinden.
  4. Stille Korrektur und Ausnahmeaufwand erfassen.

Tag 31-60

  1. Grounding-, Authority- und Outcome-Probes einführen.
  2. Probe gegen menschlich geprüfte Fälle validieren.
  3. Stop/Restrict/Review/Observe mit Owner festlegen.
  4. Drift-Analyse und Intervention üben.

Tag 61-90

  1. Segmentierte Scorecard und Kadenz betreiben.
  2. Monitoring mit Regression, Rollback und Incident Response verbinden.
  3. Ausfall, altes Wissen und unbefugte Aktion testen.
  4. Nur bei stabiler Evidence, Alert-Qualität und Outcome skalieren.

Was die offiziellen Quellen belegen

Der NIST-Bericht zu Deployed AI Monitoring beschreibt Kategorien und Herausforderungen wie Drift, fragmentierte Logs und Human-AI-Feedback, schreibt MONITOR aber nicht vor. Das NIST-Projekt Evaluation Probes into Agentic AI untersucht Verifier und maschinenlesbare Audit Trails; es beweist nicht, dass Probes menschliche Bewertung ersetzen. Der AI Act Service Desk erläutert Artikel 26 für Betreiber von High-Risk-Systemen. Die Anwendbarkeit ist fallbezogen.

FAQ

Was ist KI-Agenten-Monitoring?

Die laufende Beobachtung von Mission, Outcome, Evidence, Tools, Befugnis, Human Intervention, Abhängigkeiten, Kosten und Drift.

Wie unterscheidet sich Observability von API-Monitoring?

API-Monitoring misst Verfügbarkeit und Latenz; Agent Observability verbindet Versionen, Quellen, Entscheidungen, Aktionen, Freigaben und Geschäftsergebnis.

Was ist ein Evaluation Probe?

Ein begrenzter automatisierter oder menschlich validierter Check für Aussage, Quelle, Befugnis oder Outcome mit strukturiertem Urteil.

Welche Alerts stoppen Produktion?

Glaubwürdige unzulässige Folgen wie unbefugte Aktion, Datengrenzbruch, Schleife oder kritischer Sicherheitsfehler.

Gilt Artikel 26 für jeden Agenten?

Nein. Artikel 26 betrifft Betreiber von High-Risk-KI-Systemen; Einordnung und Rolle werden fallbezogen geprüft.

Nächster Schritt

Bringen Sie einen produktiven Workflow, Dashboards, akzeptierte und korrigierte Fälle, Identitäten, Quellen, Tools, Freigaben und Kosten. Als AI Systems Architect entwickelt Ali Najafzadeh MONITOR, Probes, Alert-Entscheidungen und einen 90-Tage-Plan. AI Systems Review vereinbaren.