ellaverse

Agentische Evaluationsumgebungen

Realitätsnahe Umgebungen für Enterprise-KI-Agenten.

Spezialisierte Umgebungen, die echte Wissensarbeit abbilden, keine generischen Coding-Aufgaben. Jede Umgebung bildet einen realen Geschäftsprozess nach: domänenspezifische GUIs, authentische Dokumente, regulatorische Regeln und Ground-Truth-Labels.

ellaverse PKV-Umgebung: Postkorb mit 27 offenen Fällen, sortiert nach SLA-Priorität

Benchmarks für die Arbeit, auf die es ankommt.

Anders als generische Coding-Benchmarks zielt ellaverse auf Wissensarbeit in regulierten Branchen: Leistungsprüfung in der Versicherung, Produktdaten-Compliance, juristische Dokumentenprüfung.

Domänenspezifisch

Aufgebaut auf echten Geschäftsprozessen, Regulierungen und Fachregeln. Keine synthetischen Aufgaben.

Produktionsnah

Vollständige GUIs, echte Dokumente, Datenbanken und Entscheidungs-Workflows. Keine Spielzeug-Setups.

Streng validiert

Ground-Truth-Labels, Scoring-Rubriken und reproduzierbare Baselines für jede Umgebung.

Der Umgebungskatalog.

Jede Umgebung enthält verifizierte Ground-Truth-Antworten: Genauigkeit lässt sich objektiv messen, Fortschritt über die Zeit verfolgen.

Live

PKV-Abrechnungsprüfung

Gesundheitswesen · Deutschland

KI-Agenten prüfen Abrechnungen der deutschen privaten Krankenversicherung anhand der GOÄ-Regelungen, in einem GUI-basierten Sachbearbeitungs-Workspace.

Versicherung GOÄ-Abrechnung Dokumentenverarbeitung GUI-basiert
27 Fälle
283 Entscheidungen
18 Fehlertypen
Live

Produktlistungs-QA im Handel

Einzelhandel · Global

KI-Agenten agieren als Key Account Manager auf einem Handelspartner-Portal und prüfen markierte Produktlistungen aus vier Kategorien gegen Kategorie-Schemata, EU-Produktsicherheitsregeln und Lieferantendaten.

E-Commerce Produktdatenqualität Multi-App E-Mail
33 Fälle
33 Entscheidungen
7 Fehlertypen
Demnächst verfügbar

Gewerbliches Underwriting

Versicherung · Europa

KI-Agenten bewerten Versicherungsanträge von KMU, prüfen Risikoprofile und erstellen Empfehlungen zu Zeichnung und Deckung.

Underwriting Risikobewertung KMU-Versicherung
Demnächst verfügbar

KFZ-Haftpflichtschäden

Versicherung · Deutschland

KI-Agenten bearbeiten KFZ-Haftpflichtschäden, prüfen die Haftungsverteilung und berechnen Schadenzahlungen nach deutschen Versicherungsregeln.

KFZ-Versicherung Haftungsprüfung Schadenkalkulation
Demnächst verfügbar

Juristische Dokumentenprüfung

Recht · Global

KI-Agenten prüfen Handelsverträge auf Klausel-Compliance, identifizieren Risikoklauseln und erstellen strukturierte Redline-Zusammenfassungen.

Vertragsprüfung Compliance Risikoanalyse

Die Live-Umgebungen im Detail.

PKV-Abrechnungsprüfung

Die private Krankenversicherung (PKV) erstattet Versicherten direkt. Deshalb prüft ein Sachbearbeiter jede Rechnung Zeile für Zeile gegen die GOÄ: 1.634 Gebührenziffern mit Steigerungsfaktor-Grenzen und Ausschlussregeln. Diese Umgebung bildet genau diesen Arbeitsalltag nach: 27 Fälle mit 283 Rechnungszeilen gegen eine bekannte Ground-Truth, inklusive bewusst eingebauter Extraktionsfehler, die ein Agent erkennen muss.

Was hier getestet wird

  • Eine domänenspezifische GUI bedienen: Postkorb, Falldetails, eingebetteter PDF-Viewer und Entscheidungsformulare.
  • Komplexe Abrechnungsregeln anwenden: Steigerungsfaktor-Grenzen, Ausschlussziffern und Begründungspflichten.
  • Quellen abgleichen: Die strukturierten Daten enthalten in 18 von 27 Fällen bewusste Extraktionsfehler, Ground-Truth ist die PDF-Rechnung.
  • Pro Rechnungszeile entscheiden: erstatten, auf einen konkreten Betrag kürzen oder ablehnen, mit den korrekten Beträgen.
PKV-Falldetail: PDF-Rechnung neben strukturierten Daten mit Regelverstoß-Markierungen

Produktlistungs-QA im Handel

Agenten arbeiten als Key Account Manager auf einem Handelspartner-Portal: 33 markierte Produktlistungen aus vier Kategorien müssen gegen Kategorie-Schemata, EU-Produktsicherheitsregeln (GPSR) und Lieferantendaten triagiert werden, während E-Mails vom Team-Lead und von Lieferanten mitten in der Session die Prioritäten ändern.

Was hier getestet wird

  • Einen Multi-App-Workspace bedienen: Partner-Portal plus E-Mail-Postfach, mit neuen Informationen mitten in der Aufgabe.
  • Kategoriespezifische Schemata anwenden: Pflichtfelder, Datentypen und zulässige Werte.
  • Unter Unsicherheit triagieren: Listung korrigieren, beim Lieferanten nachfragen, eskalieren oder deaktivieren.
  • Strukturierte Daten aus Freitext-Beschreibungen und Produktbildern extrahieren, über 7 verschiedene Fehlertypen.
Handelspartner-Portal: markierte Produktlistungen mit Datenqualitätswarnungen

So schneiden Frontier-Modelle heute ab.

Benchmark-Läufe aus dem ellaverse-Evaluationsharness. Selbst Frontier-Modelle lassen bei realistischer Unternehmensarbeit viel Luft nach oben: Das beste Modell löst weniger als die Hälfte der PKV-Umgebung.

PKV-Abrechnungsprüfung · bester Score pro Modell
Modell Agent-Harness Score
gpt-5.4 codex 48,1 %
claude-sonnet-4-6 claude-code 37,0 %
gpt-5.3-codex codex 37,0 %
claude-opus-4-6 claude-code 29,6 %
gemini-3.1-pro gemini-cli 24,8 %
gemini-3-flash gemini-cli 14,8 %

In der Produktlistungs-QA erreicht claude-opus-4-6 85,2 % auf der mittleren Schwierigkeitsstufe; die einfache Variante lösen claude-opus-4-6 und gemini-3.1-pro mit 100 %.

Momentaufnahme aus ellaverse-Benchmark-Läufen, März 2026. Scoring: korrekte Aufgaben / Gesamtaufgaben (PKV); gewichtete Triage-, Attribut- und Abdeckungsgenauigkeit (Produktlistungen).

Evaluieren Sie Ihre Agenten, bevor sie in Produktion gehen.

Wir führen Sie an Ihrem Use Case durch die Umgebungen, vom ersten Benchmark-Lauf bis zur maßgeschneiderten Umgebung für Ihre eigenen Prozesse.