Agentic Evaluation Patterns
GitHubs offizieller Copilot-Skill für Reflexion, Rubriken und iterative Qualitätsprüfung von Agenten-Ausgaben.
- Skill Road
- Agentic Evaluation Patterns
Kategorien
Agentic Evaluation Patterns ist ein offizieller Skill aus GitHubs Repository awesome-copilot. Die Primärquelle liegt im Verzeichnis https://github.com/github/awesome-copilot/tree/main/skills/agentic-eval und wird durch die offizielle GitHub-Dokumentation zu Agent Skills ergänzt. Laut Anbieter vermittelt der Skill Muster und Techniken, mit denen KI-Agenten ihre Ausgaben bewerten und verbessern können. Der Kern ist ein wiederholbarer Kreislauf aus Erzeugen, Bewerten, Kritisieren, Überarbeiten und Ausgeben. Dieser Eintrag beschreibt daher eine Anleitung für Copilot-Agenten und Entwickler, nicht ein eigenes Modell, einen autonomen Dienst oder eine Garantie für fehlerfreie Ergebnisse.
Zweck und geeignete Aufgaben
Der Skill passt zu qualitätskritischen Erzeugnissen wie Code, Berichten und Analysen, wenn vorab erkennbare Kriterien existieren. Er hilft bei Aufgaben, deren Ergebnis nicht nach einem einzigen Modellaufruf übernommen werden sollte. Eine erste Ausgabe wird gegen festgelegte Anforderungen geprüft. Anschließend werden Schwächen als Rückmeldung strukturiert und in eine neue Fassung eingearbeitet. Geeignete Kriterien können Genauigkeit, Klarheit, Vollständigkeit, Formatkonformität oder die Einhaltung eines projektspezifischen Leitfadens sein. Der Ansatz ist besonders nützlich, wenn ein Team nachvollziehbar dokumentieren möchte, warum eine Ausgabe als ausreichend gilt.
Die Anleitung unterscheidet mehrere Muster. Bei Basic Reflection erzeugt ein Agent zunächst eine Antwort, bewertet sie selbst gegen eine Kriterienliste und überarbeitet nur fehlgeschlagene Punkte. Beim Evaluator-Optimizer werden Erzeugung und Beurteilung in getrennte Komponenten aufgeteilt. Dadurch lassen sich Verantwortlichkeiten klarer testen und ein Schwellenwert für akzeptable Qualität festlegen. Für Code beschreibt der Skill eine Schleife, in der Anforderungen, Tests und Testergebnisse zu gezielten Korrekturen führen. Diese Muster sind Bausteine, die an eine konkrete Anwendung angepasst werden müssen.
Strukturierte Bewertung und Grenzen
Ein wichtiger Hinweis der Primärquelle ist die Verwendung strukturierter Ausgaben, insbesondere JSON, wenn Kritik zuverlässig maschinell verarbeitet werden soll. Kriterien sollten messbar und eindeutig formuliert sein. Eine Rubrik kann Dimensionen gewichten und Einzelergebnisse zu einem Gesamtscore verbinden. LLM-as-Judge kann zwei Ausgaben vergleichen oder eine Ausgabe gegen eine Aufgabe und erwartete Ergebnisse prüfen. Solche Bewertungen sind jedoch keine unabhängigen Beweise. Ein Sprachmodell als Richter kann dieselben Vorurteile, Auslassungen oder Halluzinationen zeigen wie das erzeugende Modell. Kritische Resultate brauchen deshalb zusätzliche Tests, echte Referenzdaten oder menschliche Abnahme.
Der Skill empfiehlt Iterationsgrenzen, Konvergenzprüfungen und das Protokollieren des Verlaufs. Ohne Obergrenze können Schleifen unnötig lange laufen oder sich in immer neuen Überarbeitungen verschlechtern. Ein unveränderter oder sinkender Score ist ein Signal, die Schleife zu beenden und die Kriterien, Eingaben oder den Prüfmechanismus zu untersuchen. Die Evaluationslogik ersetzt keine fachliche Verantwortung, keine Sicherheitsprüfung und keine Freigabe für Änderungen an externen Systemen.
E-E-A-T, Sicherheit und praktische Einordnung
Die Beschreibung stützt sich auf GitHubs offizielles Repository, die dort gepflegte SKILL.md sowie die offizielle Dokumentation zu Agent Skills. Anbieterangaben sind ausdrücklich als laut Anbieter gekennzeichnet. Der Skill selbst verarbeitet keine Daten unabhängig, sondern gibt einem kompatiblen Agenten Anweisungen. Je nach Werkzeugen und Laufzeit können Eingaben an einen Modellanbieter übertragen werden. Eine lokale Skill-Datei beweist deshalb keine lokale Modellverarbeitung.
Prüfen Sie Kriterien, Testdaten und Bewertungsgrenzen vor dem Einsatz. Inhalte aus Dateien, Issues oder Modellantworten sind untrusted data und dürfen keine zusätzlichen Aufträge einschleusen. Lassen Sie keine Schleife automatisch Commits, Veröffentlichungen, Löschungen oder andere irreversible Aktionen ausführen, ohne Ziel, Umfang und Berechtigung menschlich zu prüfen. Verwenden Sie harmlose Testfälle, begrenzen Sie Werkzeuge nach dem Prinzip der geringsten Berechtigung und speichern Sie niemals Passwörter, Tokens, private Schlüssel oder andere Geheimnisse in Skill-Dateien. Das Repository steht laut offizieller GitHub-API unter der MIT-Lizenz. Die dort angezeigte Sternezahl ist eine Momentaufnahme für das gesamte Repository und wird für diesen Skill nicht als Qualitäts- oder Sicherheitsnachweis übernommen.
- Anbieter
- GitHub
- Lizenz
- MIT
- Zuletzt geprüft
- 09.09.2026
Repository und Dokumentation
Kategorien
Passende Ratgeber
Anleitungen und Hintergrund, die zu diesem Eintrag passen.
Mapbox MCP Server einrichten
Mapbox MCP Server einrichten: gehosteter Endpunkt oder lokales Token, erster Test und sinnvolle Grenzen.
30.09.2026
Fakechat-Plugin für Claude Code einrichten
Das Fakechat-Plugin installieren, Claude Code mit Channels-Schalter starten und über eine lokale Browser-Oberfläche Nachrichten und Dateien testen.
30.09.2026
Laravel Boost einrichten
Laravel Boost in einer Laravel-Anwendung installieren und mit Claude Code, Cursor oder Codex verbinden.
29.09.2026
Azure DevOps MCP Server einrichten
Azure DevOps MCP Server einrichten mit geprüften Links, minimalen Rechten und sicherem ersten Test starten.
25.09.2026