Agent-Evaluation — Task-Success-Rate, Eval-Harness, Benchmarks
Wie man KI-Agenten bewertet: Eval-Harness, Task-Success-Rate, Benchmarks wie GAIA und Tau-Bench, LLM-as-a-Judge — und die Abgrenzung zur reinen Modell-Qualität.
Autonome KI-Systeme, die Aufgaben mehrschrittig bearbeiten.
Wie man KI-Agenten bewertet: Eval-Harness, Task-Success-Rate, Benchmarks wie GAIA und Tau-Bench, LLM-as-a-Judge — und die Abgrenzung zur reinen Modell-Qualität.
Kurzzeit- vs. Langzeitgedächtnis bei KI-Agenten: Kontextfenster, externe Memory-Stores und Vektor-DBs — wie Agenten Kontext über Sessions halten.
Wie ein LLM Werkzeuge aufruft: Tool-Definition als Schema, Modell wählt Funktion und Argumente, Ergebnis zurück ins Gespräch — der Grundbaustein jedes Agenten.
Wie Guardrails Agenten absichern: Input/Output-Filter, Policy-Checks, Tool-Grenzen und Schutz vor Prompt-Injection im Verhältnis zu Security und HITL.
Wie KI-Agenten funktionieren: vom einfachen Tool-Call über MCP, Strukturierte Outputs und LangGraph bis zur Frage, wann Multi-Agent-Setups sinnvoll sind.