Agent-Evaluation — Task-Success-Rate, Eval-Harness, Benchmarks
Wie man KI-Agenten bewertet: Eval-Harness, Task-Success-Rate, Benchmarks wie GAIA und Tau-Bench, LLM-as-a-Judge — und die Abgrenzung zur reinen Modell-Qualität.
Martin Rau
Bewertung von LLM-Qualität — Evals, Benchmarks, Judges.
Wie man KI-Agenten bewertet: Eval-Harness, Task-Success-Rate, Benchmarks wie GAIA und Tau-Bench, LLM-as-a-Judge — und die Abgrenzung zur reinen Modell-Qualität.
Wie misst man, ob ein LLM-System gut funktioniert? Drei Ebenen von Public Benchmarks bis CI-Eval, Stolperfallen wie Goodhart, Judge-Bias und Eval-Aging.