Agent-Evaluierung planen

Agent-Evaluierung planen: Testfälle, Läufe und Metriken für einen KI-Agenten festlegen, Kosten, pass@k und Fehlerspanne der Erfolgsquote berechnen.

Metriken
–

 

Umfang und Statistik
KennzahlWertBedeutung
Evaluierungsplan (Markdown)

Die Kosten je Lauf sind ein Beispielwert; tragen Sie Ihre gemessenen Kosten ein. Alles läuft in Ihrem Browser.

Agenten messbar machen

Eine Agent-Evaluierung prüft, ob ein KI-Agent seine Aufgaben zuverlässig, sicher und zu vertretbaren Kosten erledigt. Wer einen KI-Agent testen will, braucht mehr als ein paar Probeläufe: Agenten antworten nicht immer gleich, rufen Werkzeuge in wechselnder Reihenfolge auf und scheitern oft erst an Grenzfällen. Der Planer erstellt einen Evaluierungsplan mit Aufgabentypen, Testfällen, Metriken und Abnahmekriterium und rechnet aus, wie viele Läufe und Kosten das bedeutet.

Die Testfälle teilt der Plan in Normalfälle (60 %), Grenzfälle (20 %), Störungen wie fehlerhafte Tool-Antworten (10 %) und Angriffe wie Prompt Injection (10 %). Weil ein Agent bei gleicher Eingabe unterschiedlich handeln kann, läuft jeder Testfall mehrmals. Daraus ergeben sich zwei Kennzahlen: pass@k ist die Wahrscheinlichkeit, dass mindestens einer von k Läufen gelingt, also 1 − (1 − p)^k; pass^k ist die Wahrscheinlichkeit, dass alle k Läufe gelingen, also p^k. Für Agenten im Kundenkontakt ist pass^k meist die ehrlichere Zahl, denn jeder Kunde erlebt nur einen Lauf. Außerdem zeigt der Plan die statistische Fehlerspanne der gemessenen Erfolgsquote: Bei 100 Testfällen und 85 % Erfolg liegt das 95-%-Intervall grob bei ±7 Prozentpunkten. Für die Bewertung einzelner Antworten nach Kriterien hilft das Bewertungsraster.

Grenzen: Die Fehlerspanne nutzt die Normalnäherung und behandelt Testfälle als unabhängig; bei wenigen Fällen oder Quoten nahe 0 oder 100 % ist sie ungenau. Die Formeln für pass@k und pass^k setzen voraus, dass die Läufe unabhängig sind und jeder dieselbe Erfolgsquote hat.

Anleitung: Agent-Evaluierung in 4 Schritten

  1. Tragen Sie die Aufgabentypen des Agenten ein, je Zeile einen.
  2. Legen Sie Testfälle je Aufgabentyp, Läufe je Testfall, erwartete Erfolgsquote und Zielwert fest.
  3. Wählen Sie die Metriken und die Art der Bewertung.
  4. Lesen Sie Umfang, Kosten, pass@k und Fehlerspanne ab und kopieren Sie den Evaluierungsplan.

Typische Anwendungsfälle

  • Abnahme eines Agenten vor dem Produktivstart mit vorher festgelegtem Zielwert.
  • Vergleich zweier Modelle oder Prompt-Versionen mit demselben Testsatz.
  • Regressionstest nach jedem Modellwechsel, um Qualitätsverluste früh zu erkennen.
  • Budgetplanung: Was kostet eine vollständige Testrunde mit mehreren Läufen?
Fragen

Häufige Fragen

Was ist der Unterschied zwischen pass@k und pass^k?

pass@k misst, ob mindestens einer von k Versuchen gelingt; das passt, wenn man Ergebnisse auswählen kann. pass^k misst, ob alle k Versuche gelingen; das zeigt, wie verlässlich ein Agent bei wiederholter Nutzung ist.

Wie viele Testfälle brauche ich?

Das hängt von der gewünschten Genauigkeit ab. Für eine Fehlerspanne von etwa ±5 Prozentpunkten bei 85 % Erfolg sind rund 200 Testfälle nötig. Das Werkzeug zeigt die Zahl für Ihre Werte an.

Darf ein Sprachmodell die Antworten bewerten?

Ja, als Hilfe für große Testmengen, aber mit klaren Kriterien und einer menschlichen Stichprobe, um die Bewertung selbst zu prüfen. Wo das Ergebnis eindeutig ist, etwa ein angelegter Datensatz, ist eine automatische Prüfung zuverlässiger.

Werden meine Eingaben gespeichert?

Nein. Der Plan entsteht vollständig in Ihrem Browser.

Woher bekomme ich Testfälle für einen Agenten?

Am besten aus echten, anonymisierten Fällen der Vergangenheit, ergänzt um gezielt gebaute Grenzfälle und Angriffe. Fehler aus dem Betrieb kommen als neue Testfälle dazu, damit sie nicht wiederkehren.

Wie oft sollte ich die Evaluierung wiederholen?

Mindestens bei jeder Änderung an Modell, Systemanweisung, Werkzeugen oder Wissensquellen. Zusätzlich lohnt ein regelmäßiger Lauf, etwa monatlich, weil sich Modelle hinter einer gleichbleibenden Bezeichnung ändern können.

Ratgeber

Zum Weiterlesen

Alle Artikel
  1. Was sind Tokens? Einfach erklärtTokens sind die Rechen- und Abrechnungseinheit von Sprachmodellen. Was ein Token ist, wie viele ein deutscher Text hat und warum das Geld kostet.
  2. Kontextfenster erklärt: Wie viel Text ein Modell auf einmal verarbeitetDas Kontextfenster begrenzt, wie viel ein KI-Modell gleichzeitig lesen und schreiben kann. Was die Zahl bedeutet, wo die Grenzen liegen und wie man damit umgeht.
  3. Warum deutsche Texte mehr Tokens brauchen als englischeDeutsche Texte brauchen meist 20 bis 50 Prozent mehr Tokens als englische. Woran das liegt, was es kostet und was man dagegen tun kann.
Weitere Werkzeuge

Das könnte auch helfen

Alle 558 Werkzeuge