Nivero LLM-Benchmark
Welche KI-Modelle beherrschen deutsche Geschäftsprozesse?
Belege extrahieren, Prozessautomatisierung, Prozessketten, Compliance und Geschäftsmails: Aufgaben, die in deutschen Unternehmen täglich anfallen, in einem Benchmark.
| # | Modell | Kategorien | Tokenverbrauch | Preis / Leistung | Gesamt | Effizienz |
|---|---|---|---|---|---|---|
| 1 |
|
88.5 96.3 91.4 97.5 95.8 100.0 | 94.1 | 27 | ||
| 2 |
|
85.6 94.7 100.0 94.2 95.8 100.0 | 93.8 | 46 | ||
| 3 |
|
88.5 91.3 92.1 95.8 95.8 98.7 | 92.6 | 22 | ||
| 4 |
|
87.4 92.3 92.1 95.8 95.8 98.7 | 92.6 | 21 | ||
| 5 |
|
92.5 82.5 99.3 93.3 95.8 89.6 | 91.2 | 71 | ||
| 6 |
|
87.9 88.3 93.6 90.0 95.8 97.4 | 90.9 | 22 | ||
| 7 |
|
87.9 88.5 95.0 93.3 94.8 84.6 | 90.3 | 40 | ||
| 8 |
|
75.9 98.8 100.0 90.0 93.8 87.2 | 90.3 | 19 | ||
| 9 |
|
76.4 96.7 92.9 90.8 94.8 97.4 | 90.1 | 32 | ||
| 10 |
|
91.4 96.4 86.4 68.3 94.8 100.0 | 89.6 | 74 | ||
| 11 |
|
89.1 86.8 99.3 93.3 95.8 71.8 | 89.6 | 124 | ||
| 12 |
|
87.4 87.6 95.0 96.7 96.9 74.4 | 89.6 | 134 | ||
| 13 |
|
72.4 94.7 97.1 85.8 93.8 100.0 | 88.6 | 52 | ||
| 14 |
|
78.7 92.8 98.6 80.0 90.6 84.6 | 87.2 | 19 | ||
| 15 |
|
67.8 90.1 92.1 84.2 94.8 100.0 | 85.4 | 44 | ||
| 16 |
|
63.8 82.7 100.0 94.2 95.8 97.4 | 85.1 | 26 | ||
| 17 |
|
82.2 93.1 84.3 60.8 93.8 97.4 | 84.7 | 81 | ||
| 18 |
|
56.9 93.9 91.4 87.5 99.0 100.0 | 84.4 | 14 | ||
| 19 |
|
71.8 96.0 87.1 69.2 90.6 93.6 | 83.8 | 41 | ||
| 20 |
|
50.6 98.8 95.0 80.0 94.8 100.0 | 83.1 | 43 | ||
| 21 |
|
60.3 96.8 90.7 76.7 93.8 85.9 | 82.4 | 21 | ||
| 22 |
|
56.9 88.7 91.4 84.2 100.0 94.9 | 82.2 | 13 | ||
| 23 |
|
60.9 84.4 94.3 95.0 94.8 74.4 | 81.6 | 105 | ||
| 24 |
|
56.9 89.7 91.4 85.8 96.9 85.9 | 81.5 | 13 | ||
| 25 |
|
57.5 84.5 99.3 86.7 92.7 73.1 | 80.0 | 15 | ||
| 26 |
|
70.7 87.3 86.4 57.5 86.5 92.3 | 79.0 | 90 | ||
| 27 |
|
72.4 66.7 97.9 63.3 95.8 100.0 | 78.5 | 86 | ||
| 28 |
|
35.6 92.7 95.0 85.8 94.8 97.4 | 78.4 | 18 | ||
| 29 |
|
42.5 87.5 91.4 95.0 95.8 80.8 | 78.1 | 24 | ||
| 30 |
|
73.0 76.4 76.4 50.0 91.7 92.3 | 74.7 | 73 | ||
| 31 |
|
71.3 59.6 97.1 54.2 90.6 98.7 | 74.3 | 80 | ||
| 32 |
|
58.6 62.4 98.6 54.2 92.7 93.6 | 71.8 | 88 | ||
| 33 |
|
42.0 63.3 89.3 82.5 93.8 97.4 | 71.2 | 17 | ||
| 34 |
|
41.4 84.5 82.9 57.5 97.9 88.5 | 71.2 | 79 | ||
| 35 |
|
84.5 41.5 83.6 60.8 83.3 96.2 | 71.1 | 83 | ||
| 36 |
|
15.5 87.7 99.3 78.3 97.9 87.2 | 71.0 | 23 | ||
| 37 |
|
56.3 82.5 81.4 40.0 92.7 80.8 | 70.3 | 73 | ||
| 38 |
|
24.7 92.3 78.6 55.0 89.6 100.0 | 68.2 | 60 | ||
| 39 |
|
33.3 62.3 90.7 87.5 92.7 47.4 | 64.6 | 28 | ||
| 40 |
|
42.5 53.6 80.7 49.2 88.5 85.9 | 61.0 | 67 | ||
| 41 |
|
12.1 70.4 84.3 61.7 93.8 71.8 | 59.1 | 19 | ||
| 42 |
|
23.6 53.5 77.9 59.2 90.6 69.2 | 55.8 | 17 | ||
| 43 |
|
11.5 55.6 74.3 48.3 88.5 79.5 | 52.0 | 64 | ||
| 44 |
|
16.7 32.4 88.6 66.7 91.7 71.8 | 51.9 | 17 | ||
| 45 |
|
13.2 46.3 87.9 62.5 91.7 44.9 | 51.1 | 17 | ||
| 46 |
|
14.9 15.2 47.9 24.2 72.9 50.0 | 30.6 | 36 |
Kein Modell entspricht diesen Kriterien.
Wie sich der Nivero-Benchmark zusammensetzt
Der Gesamtscore ist das Ergebnis aus den folgenden sechs Kategorien.
| Kategorie | Gewicht | Was gemessen wird |
|---|---|---|
| Belegextraktion | 25 % | Deutsche Rechnungen, Lieferscheine, Mahnungen, Schlussrechnungen in strukturierte Daten überführen. OCR-typisches Rauschen, verschachtelte Tabellen, vertauschte Spalten, gemischte Steuersätze. |
| Prozessautomatisierung | 25 % | Tools korrekt bedienen: Stammdaten suchen, Zahlungen anlegen, Klärfälle melden statt raten. Gemessen in zwei Teilen: kurze Ketten (15 %) und lange Agent-Läufe über Dutzende Schritte (10 %). Posteingang abarbeiten, Mahnläufe, Zahlläufe mit Budgetgrenze, Wiederaufsetzen nach Fehlern. Auch destruktive Werkzeuge stehen bereit und dürfen nie aufgerufen werden. |
| Verlässlichkeit | 15 % | Wir versuchen Halluzination zu provozieren: fehlende Angaben, ähnlich aussehende Köder-Werte, Zahlendreher in Summen, Fragen über zwei Belege hinweg. Wer erfindet, fällt durch. |
| Compliance | 15 % | Pflichtangaben nach § 14 UStG, Steuerschuldnerschaft nach § 13b, Steuersätze, Skonto-, Zins- und Kaskadenrechnung mit kaufmännischer Rundung. Bei berechneten Beträgen gilt eine Toleranz von einem Cent, wie sie auch in der Buchhaltungspraxis üblich ist. Abgelesene Werte müssen exakt stimmen. |
| Datenabgleich | 10 % | Briefköpfe und Positionen gegen Stammdaten auflösen. Umlaute, Deutsche Zeichen, Größenvarianten, Umzüge, und die Disziplin, bei fehlender Eindeutigkeit keinen Treffer zu melden. |
| Kommunikation | 10 % | Geschäftspost einordnen und beantworten: Sie- und Du-Form, alle Fakten korrekt, keine erfundenen Zusagen, keine Platzhalter wie [Name], versandfertig. |
LLM-as-a-Judge
Für rund 95 Prozent des Benchmarks und seiner Scores gibt es nur eine richtige Antwort. Dazu zählen zum Beispiel Wertvergleiche, Regelprüfungen, Protokollauswertung und mehr. Die restlichen 5 Prozent sind frei formulierte Korrespondenz, E-Mails, etc. und werden von 5 Richtern bewertet. Die Richter sind in dem Fall andere LLMs. Um möglichst viel Varianz reinzubringen aber trotzdem die Nivero-Benchmark-Qualität zu bieten, haben wir Ankersets definiert und geschaut, welche LLM-Familien sich als Judge eignen. Über 10 sind hierbei durchgefallen. Final bewerten Modelle von OpenAI, Anthropic, Google, Mistral und DeepSeek. Als Springer dient MiMo, von Xiaomi. D. h. wenn ein OpenAI Modell bewertet wird, fliegt OpenAI als Judge raus und wird durch MiMo ersetzt. So bewertet nie die eigene Modellfamilie eigene Modelle. Die Richter beantworten nur konkrete Ja-Nein-Aussagen und dadurch, dass es 5 Richter sind, entsteht nie ein Unentschieden, es gibt nur klare Resultate, die in den Score einfließen.
Häufige Fragen
Welche Daten werden für die Benchmarks genutzt?
Wir haben den Benchmark nicht mit echten Kundendaten durchgeführt, sondern vielmehr unsere Erfahrung der Kundendaten genutzt, um synthetische Belege und Daten zu erzeugen. Diese Daten beinhalten dieselben Fallstricke wie korrekte deutsche und europäische Geschäftsdokumente und -Belege, aber ohne dass hier Kundendaten genutzt werden.
Sind die Daten des Benchmarks öffentlich?
Nein, wir veröffentlichen nur die Methodik (siehe oben) aber nicht die genauen Dokumente, Texte und Prompts. Dies hat den Hintergrund, dass wir vermeiden wollen dass die Modell-Anbieter sogenanntes "Benchmaxxing" betreiben, wie es bei anderen synthetischen Benchmarks passiert.
Sagt mir der Benchmark, welches Modell Nivero einsetzt?
Nein. Er zeigt, was Modelle im generellen aktuell können. Deshalb haben wir diesen Benchmark auch in die vielen Kategorien aufgeteilt. Welche Modelle wir in welchem Prozessschritt kombinieren, entscheidet sich je Aufgabe, auch natürlich anhand unserer Erkenntnisse sowohl aus diesem Benchmark als auch der RL-Performance und weiteren umfangreichen Tests.
Warum sind die Regionen relevant?
Die Region bezeichnet die Herkunft des LLM-Herstellers, nicht den Standort des Rechenzentrums. Ein chinesisches Open-Weight-Modell kann auf einem Frankfurter Server betrieben werden und unterliegt dann anderen Rahmenbedingungen als eine API beim Hersteller. Für die Einordnung lohnt deshalb der Blick auf beide Filter zusammen: Open-Weight-Modelle lassen sich unabhängig von ihrer Herkunft selbst hosten, proprietäre Modelle laufen immer beim Anbieter.
Wie lese ich das Preis/Leistung in der Tabelle?
Aus zwei gemessenen Größen: dem tatsächlichen Token-Verbrauch des Modells über den kompletten Benchmark-Durchlauf (alle Aufgaben, drei Versuche, einschließlich Werkzeug-Dialogen und Denk-Schritten) und seinem Listenpreis je Million Tokens. Beides zusammen ergibt die Kosten eines Durchlaufs, also den Preis für dieselbe Arbeitsmenge bei jedem Modell. Geteilt durch den Gesamtscore entstehen die Kosten je Punkt.
Was misst die Spalte Effizienz?
Die Effizienz setzt den Gesamtscore ins Verhältnis zu den Tokens, die ein Modell für dieselbe Arbeitsmenge ausgibt, also Punkte je Million Ausgabe-Tokens. Höher ist besser. Wir zählen bewusst nur die Ausgabe, das also, was das Modell selbst erzeugt, inklusive Antwort und Denkschritten. Genau diese treibt in der Praxis die Antwortzeit und die laufenden Kosten je Anfrage. Anders als bei Preis/Leistung fließt hier kein Anbieterpreis ein. Ein Modell kann günstig abgerechnet werden und trotzdem viele Tokens verbrauchen, oder umgekehrt. Deshalb lohnt der Blick auf beide Spalten.
Die Effizienz fließt nicht in den Gesamtscore ein, sie ist eine eigene Sicht. Über die Spaltenüberschrift lässt sich die Tabelle danach sortieren, um Modelle zu finden, die nahezu die volle Leistung mit deutlich weniger Aufwand liefern. Ein knapp antwortendes, aber schwaches Modell kann hier weit oben stehen.
Was kann ich dem Benchmark nicht entnehmen?
Weltwissen, Kreativität oder Programmierfähigkeit. Dafür gibt es andere Benchmarks. Hier geht es um eine einzige Frage: Kann ein Modell deutsche Geschäftsprozesse so zuverlässig bearbeiten, dass man ihm Verantwortung übergeben kann?