Domänenspezifisch
Aufgebaut auf echten Geschäftsprozessen, Regulierungen und Fachregeln. Keine synthetischen Aufgaben.
Agentische Evaluationsumgebungen
Spezialisierte Umgebungen, die echte Wissensarbeit abbilden, keine generischen Coding-Aufgaben. Jede Umgebung bildet einen realen Geschäftsprozess nach: domänenspezifische GUIs, authentische Dokumente, regulatorische Regeln und Ground-Truth-Labels.
Anders als generische Coding-Benchmarks zielt ellaverse auf Wissensarbeit in regulierten Branchen: Leistungsprüfung in der Versicherung, Produktdaten-Compliance, juristische Dokumentenprüfung.
Aufgebaut auf echten Geschäftsprozessen, Regulierungen und Fachregeln. Keine synthetischen Aufgaben.
Vollständige GUIs, echte Dokumente, Datenbanken und Entscheidungs-Workflows. Keine Spielzeug-Setups.
Ground-Truth-Labels, Scoring-Rubriken und reproduzierbare Baselines für jede Umgebung.
Jede Umgebung enthält verifizierte Ground-Truth-Antworten: Genauigkeit lässt sich objektiv messen, Fortschritt über die Zeit verfolgen.
Gesundheitswesen · Deutschland
KI-Agenten prüfen Abrechnungen der deutschen privaten Krankenversicherung anhand der GOÄ-Regelungen, in einem GUI-basierten Sachbearbeitungs-Workspace.
Einzelhandel · Global
KI-Agenten agieren als Key Account Manager auf einem Handelspartner-Portal und prüfen markierte Produktlistungen aus vier Kategorien gegen Kategorie-Schemata, EU-Produktsicherheitsregeln und Lieferantendaten.
Versicherung · Europa
KI-Agenten bewerten Versicherungsanträge von KMU, prüfen Risikoprofile und erstellen Empfehlungen zu Zeichnung und Deckung.
Versicherung · Deutschland
KI-Agenten bearbeiten KFZ-Haftpflichtschäden, prüfen die Haftungsverteilung und berechnen Schadenzahlungen nach deutschen Versicherungsregeln.
Recht · Global
KI-Agenten prüfen Handelsverträge auf Klausel-Compliance, identifizieren Risikoklauseln und erstellen strukturierte Redline-Zusammenfassungen.
Die private Krankenversicherung (PKV) erstattet Versicherten direkt. Deshalb prüft ein Sachbearbeiter jede Rechnung Zeile für Zeile gegen die GOÄ: 1.634 Gebührenziffern mit Steigerungsfaktor-Grenzen und Ausschlussregeln. Diese Umgebung bildet genau diesen Arbeitsalltag nach: 27 Fälle mit 283 Rechnungszeilen gegen eine bekannte Ground-Truth, inklusive bewusst eingebauter Extraktionsfehler, die ein Agent erkennen muss.
Was hier getestet wird
Agenten arbeiten als Key Account Manager auf einem Handelspartner-Portal: 33 markierte Produktlistungen aus vier Kategorien müssen gegen Kategorie-Schemata, EU-Produktsicherheitsregeln (GPSR) und Lieferantendaten triagiert werden, während E-Mails vom Team-Lead und von Lieferanten mitten in der Session die Prioritäten ändern.
Was hier getestet wird
Benchmark-Läufe aus dem ellaverse-Evaluationsharness. Selbst Frontier-Modelle lassen bei realistischer Unternehmensarbeit viel Luft nach oben: Das beste Modell löst weniger als die Hälfte der PKV-Umgebung.
| Modell | Agent-Harness | Score |
|---|---|---|
| gpt-5.4 | codex | 48,1 % |
| claude-sonnet-4-6 | claude-code | 37,0 % |
| gpt-5.3-codex | codex | 37,0 % |
| claude-opus-4-6 | claude-code | 29,6 % |
| gemini-3.1-pro | gemini-cli | 24,8 % |
| gemini-3-flash | gemini-cli | 14,8 % |
In der Produktlistungs-QA erreicht claude-opus-4-6 85,2 % auf der mittleren Schwierigkeitsstufe; die einfache Variante lösen claude-opus-4-6 und gemini-3.1-pro mit 100 %.
Momentaufnahme aus ellaverse-Benchmark-Läufen, März 2026. Scoring: korrekte Aufgaben / Gesamtaufgaben (PKV); gewichtete Triage-, Attribut- und Abdeckungsgenauigkeit (Produktlistungen).
Wir führen Sie an Ihrem Use Case durch die Umgebungen, vom ersten Benchmark-Lauf bis zur maßgeschneiderten Umgebung für Ihre eigenen Prozesse.