Nivero LLM-Benchmark

Welche KI-Modelle beherrschen deutsche Geschäftsprozesse?

Belege extrahieren, Prozessautomatisierung, Prozessketten, Compliance und Geschäftsmails: Aufgaben, die in deutschen Unternehmen täglich anfallen, in einem Benchmark.

Gewichte
Thinking
Modalität
Region
# Modell Kategorien Tokenverbrauch Preis / Leistung Gesamt Effizienz
1 Gemini 3.6 Flash Parameter nicht veröffentlicht Vision 88.5 96.3 91.4 97.5 95.8 100.0 94.1 27
2 Kimi K3 2.8T / MoE Open Weight Vision 85.6 94.7 100.0 94.2 95.8 100.0 93.8 46
3 Gemini 3.6 Flash Thinking Parameter nicht veröffentlicht Vision 88.5 91.3 92.1 95.8 95.8 98.7 92.6 22
4 Gemini 3.5 Flash Thinking Parameter nicht veröffentlicht Vision 87.4 92.3 92.1 95.8 95.8 98.7 92.6 21
5 Claude Fable 5 Parameter nicht veröffentlicht Vision 92.5 82.5 99.3 93.3 95.8 89.6 91.2 71
6 Gemini 3.5 Flash-Lite Thinking Parameter nicht veröffentlicht Vision 87.9 88.3 93.6 90.0 95.8 97.4 90.9 22
7 Grok 4.5 ~1.5T / MoE Vision 87.9 88.5 95.0 93.3 94.8 84.6 90.3 40
8 Kimi K2.6 1T (32B aktiv) / MoE Open Weight Vision 75.9 98.8 100.0 90.0 93.8 87.2 90.3 19
9 Gemma 4 31B Thinking 30,7B / Dense Open Weight Vision 76.4 96.7 92.9 90.8 94.8 97.4 90.1 32
10 Claude Opus 4.8 Parameter nicht veröffentlicht Vision 91.4 96.4 86.4 68.3 94.8 100.0 89.6 74
11 GPT-5.6 Sol Parameter nicht veröffentlicht Vision 89.1 86.8 99.3 93.3 95.8 71.8 89.6 124
12 GPT-5.6 Terra Parameter nicht veröffentlicht Vision 87.4 87.6 95.0 96.7 96.9 74.4 89.6 134
13 Claude Sonnet 5 Parameter nicht veröffentlicht Vision 72.4 94.7 97.1 85.8 93.8 100.0 88.6 52
14 Hy3 Thinking 295B (21B aktiv) / MoE Open Weight 78.7 92.8 98.6 80.0 90.6 84.6 87.2 19
15 MiniMax M3 428B (23B aktiv) / MoE Open Weight Vision 67.8 90.1 92.1 84.2 94.8 100.0 85.4 44
16 Inkling 975B (41B aktiv) / MoE Open Weight Vision 63.8 82.7 100.0 94.2 95.8 97.4 85.1 26
17 MiMo V2.5 Pro 1,02T (42B aktiv) / MoE Open Weight Vision 82.2 93.1 84.3 60.8 93.8 97.4 84.7 81
18 Qwen3.6 27B 27B / Dense Open Weight Vision 56.9 93.9 91.4 87.5 99.0 100.0 84.4 14
19 DeepSeek V4 Flash 284B (13B aktiv) / MoE Open Weight 71.8 96.0 87.1 69.2 90.6 93.6 83.8 41
20 GLM 5.2 753B (40B aktiv) / MoE Open Weight 50.6 98.8 95.0 80.0 94.8 100.0 83.1 43
21 LongCat 2.0 1.6T (48B aktiv) / MoE Open Weight 60.3 96.8 90.7 76.7 93.8 85.9 82.4 21
22 Qwen3.6 35B A3B 35B (3B aktiv) / MoE Open Weight Vision 56.9 88.7 91.4 84.2 100.0 94.9 82.2 13
23 GPT-5.6 Luna Parameter nicht veröffentlicht Vision 60.9 84.4 94.3 95.0 94.8 74.4 81.6 105
24 Qwen3.7 Flash Parameter nicht veröffentlicht Vision 56.9 89.7 91.4 85.8 96.9 85.9 81.5 13
25 Mistral Medium 3.5 Thinking 128B / Dense Open Weight Vision 57.5 84.5 99.3 86.7 92.7 73.1 80.0 15
26 Hy3 295B (21B aktiv) / MoE Open Weight 70.7 87.3 86.4 57.5 86.5 92.3 79.0 90
27 Gemma 4 31B 30,7B / Dense Open Weight Vision 72.4 66.7 97.9 63.3 95.8 100.0 78.5 86
28 Step 3.7 Flash 196B (11B aktiv) / MoE Vision 35.6 92.7 95.0 85.8 94.8 97.4 78.4 18
29 Inkling Small 276B (12B aktiv) / MoE Open Weight Vision 42.5 87.5 91.4 95.0 95.8 80.8 78.1 24
30 MiMo V2.5 310B (15B aktiv) / MoE Open Weight Vision 73.0 76.4 76.4 50.0 91.7 92.3 74.7 73
31 DeepSeek V4 Pro 1,6T (49B aktiv) / MoE Open Weight 71.3 59.6 97.1 54.2 90.6 98.7 74.3 80
32 Mistral Medium 3.5 128B / Dense Open Weight Vision 58.6 62.4 98.6 54.2 92.7 93.6 71.8 88
33 Gemma 4 26B A4B Thinking 25,2B (3,8B aktiv) / MoE Open Weight Vision 42.0 63.3 89.3 82.5 93.8 97.4 71.2 17
34 Nemotron 3 Ultra 550B (55B aktiv) / MoE Open Weight 41.4 84.5 82.9 57.5 97.9 88.5 71.2 79
35 Gemini 3.5 Flash-Lite Parameter nicht veröffentlicht Vision 84.5 41.5 83.6 60.8 83.3 96.2 71.1 83
36 Ling 3.0 Flash 124B (5.1B aktiv) / MoE Open Weight 15.5 87.7 99.3 78.3 97.9 87.2 71.0 23
37 Nemotron 3 Super 120B (12B aktiv) / MoE Open Weight 56.3 82.5 81.4 40.0 92.7 80.8 70.3 73
38 Claude Haiku 4.5 Parameter nicht veröffentlicht Vision 24.7 92.3 78.6 55.0 89.6 100.0 68.2 60
39 GPT-OSS 120B 120B (5.1B aktiv) / MoE Open Weight 33.3 62.3 90.7 87.5 92.7 47.4 64.6 28
40 Gemma 4 26B A4B 25,2B (3,8B aktiv) / MoE Open Weight Vision 42.5 53.6 80.7 49.2 88.5 85.9 61.0 67
41 Mistral Small 4 Thinking 119B (6B aktiv) / MoE Open Weight Vision 12.1 70.4 84.3 61.7 93.8 71.8 59.1 19
42 Laguna S 2.1 118B (8B aktiv) / MoE Open Weight 23.6 53.5 77.9 59.2 90.6 69.2 55.8 17
43 Mistral Small 4 119B (6B aktiv) / MoE Open Weight Vision 11.5 55.6 74.3 48.3 88.5 79.5 52.0 64
44 GPT-OSS 20B 20B (3.6B aktiv) / MoE Open Weight 16.7 32.4 88.6 66.7 91.7 71.8 51.9 17
45 Laguna XS 2.1 33B (3B aktiv) / MoE Open Weight 13.2 46.3 87.9 62.5 91.7 44.9 51.1 17
46 Nemotron 3 Nano 30B (3B aktiv) / MoE Open Weight 14.9 15.2 47.9 24.2 72.9 50.0 30.6 36

Wie sich der Nivero-Benchmark zusammensetzt

Der Gesamtscore ist das Ergebnis aus den folgenden sechs Kategorien.

KategorieGewichtWas gemessen wird
Belegextraktion25 %Deutsche Rechnungen, Lieferscheine, Mahnungen, Schlussrechnungen in strukturierte Daten überführen. OCR-typisches Rauschen, verschachtelte Tabellen, vertauschte Spalten, gemischte Steuersätze.
Prozessautomatisierung25 %Tools korrekt bedienen: Stammdaten suchen, Zahlungen anlegen, Klärfälle melden statt raten. Gemessen in zwei Teilen: kurze Ketten (15 %) und lange Agent-Läufe über Dutzende Schritte (10 %). Posteingang abarbeiten, Mahnläufe, Zahlläufe mit Budgetgrenze, Wiederaufsetzen nach Fehlern. Auch destruktive Werkzeuge stehen bereit und dürfen nie aufgerufen werden.
Verlässlichkeit15 %Wir versuchen Halluzination zu provozieren: fehlende Angaben, ähnlich aussehende Köder-Werte, Zahlendreher in Summen, Fragen über zwei Belege hinweg. Wer erfindet, fällt durch.
Compliance15 %Pflichtangaben nach § 14 UStG, Steuerschuldnerschaft nach § 13b, Steuersätze, Skonto-, Zins- und Kaskadenrechnung mit kaufmännischer Rundung. Bei berechneten Beträgen gilt eine Toleranz von einem Cent, wie sie auch in der Buchhaltungspraxis üblich ist. Abgelesene Werte müssen exakt stimmen.
Datenabgleich10 %Briefköpfe und Positionen gegen Stammdaten auflösen. Umlaute, Deutsche Zeichen, Größenvarianten, Umzüge, und die Disziplin, bei fehlender Eindeutigkeit keinen Treffer zu melden.
Kommunikation10 %Geschäftspost einordnen und beantworten: Sie- und Du-Form, alle Fakten korrekt, keine erfundenen Zusagen, keine Platzhalter wie [Name], versandfertig.

LLM-as-a-Judge

Für rund 95 Prozent des Benchmarks und seiner Scores gibt es nur eine richtige Antwort. Dazu zählen zum Beispiel Wertvergleiche, Regelprüfungen, Protokollauswertung und mehr. Die restlichen 5 Prozent sind frei formulierte Korrespondenz, E-Mails, etc. und werden von 5 Richtern bewertet. Die Richter sind in dem Fall andere LLMs. Um möglichst viel Varianz reinzubringen aber trotzdem die Nivero-Benchmark-Qualität zu bieten, haben wir Ankersets definiert und geschaut, welche LLM-Familien sich als Judge eignen. Über 10 sind hierbei durchgefallen. Final bewerten Modelle von OpenAI, Anthropic, Google, Mistral und DeepSeek. Als Springer dient MiMo, von Xiaomi. D. h. wenn ein OpenAI Modell bewertet wird, fliegt OpenAI als Judge raus und wird durch MiMo ersetzt. So bewertet nie die eigene Modellfamilie eigene Modelle. Die Richter beantworten nur konkrete Ja-Nein-Aussagen und dadurch, dass es 5 Richter sind, entsteht nie ein Unentschieden, es gibt nur klare Resultate, die in den Score einfließen.

Häufige Fragen

Welche Daten werden für die Benchmarks genutzt?

Wir haben den Benchmark nicht mit echten Kundendaten durchgeführt, sondern vielmehr unsere Erfahrung der Kundendaten genutzt, um synthetische Belege und Daten zu erzeugen. Diese Daten beinhalten dieselben Fallstricke wie korrekte deutsche und europäische Geschäftsdokumente und -Belege, aber ohne dass hier Kundendaten genutzt werden.

Sind die Daten des Benchmarks öffentlich?

Nein, wir veröffentlichen nur die Methodik (siehe oben) aber nicht die genauen Dokumente, Texte und Prompts. Dies hat den Hintergrund, dass wir vermeiden wollen dass die Modell-Anbieter sogenanntes "Benchmaxxing" betreiben, wie es bei anderen synthetischen Benchmarks passiert.

Sagt mir der Benchmark, welches Modell Nivero einsetzt?

Nein. Er zeigt, was Modelle im generellen aktuell können. Deshalb haben wir diesen Benchmark auch in die vielen Kategorien aufgeteilt. Welche Modelle wir in welchem Prozessschritt kombinieren, entscheidet sich je Aufgabe, auch natürlich anhand unserer Erkenntnisse sowohl aus diesem Benchmark als auch der RL-Performance und weiteren umfangreichen Tests.

Warum sind die Regionen relevant?

Die Region bezeichnet die Herkunft des LLM-Herstellers, nicht den Standort des Rechenzentrums. Ein chinesisches Open-Weight-Modell kann auf einem Frankfurter Server betrieben werden und unterliegt dann anderen Rahmenbedingungen als eine API beim Hersteller. Für die Einordnung lohnt deshalb der Blick auf beide Filter zusammen: Open-Weight-Modelle lassen sich unabhängig von ihrer Herkunft selbst hosten, proprietäre Modelle laufen immer beim Anbieter.

Wie lese ich das Preis/Leistung in der Tabelle?

Aus zwei gemessenen Größen: dem tatsächlichen Token-Verbrauch des Modells über den kompletten Benchmark-Durchlauf (alle Aufgaben, drei Versuche, einschließlich Werkzeug-Dialogen und Denk-Schritten) und seinem Listenpreis je Million Tokens. Beides zusammen ergibt die Kosten eines Durchlaufs, also den Preis für dieselbe Arbeitsmenge bei jedem Modell. Geteilt durch den Gesamtscore entstehen die Kosten je Punkt.

Was misst die Spalte Effizienz?

Die Effizienz setzt den Gesamtscore ins Verhältnis zu den Tokens, die ein Modell für dieselbe Arbeitsmenge ausgibt, also Punkte je Million Ausgabe-Tokens. Höher ist besser. Wir zählen bewusst nur die Ausgabe, das also, was das Modell selbst erzeugt, inklusive Antwort und Denkschritten. Genau diese treibt in der Praxis die Antwortzeit und die laufenden Kosten je Anfrage. Anders als bei Preis/Leistung fließt hier kein Anbieterpreis ein. Ein Modell kann günstig abgerechnet werden und trotzdem viele Tokens verbrauchen, oder umgekehrt. Deshalb lohnt der Blick auf beide Spalten.

Die Effizienz fließt nicht in den Gesamtscore ein, sie ist eine eigene Sicht. Über die Spaltenüberschrift lässt sich die Tabelle danach sortieren, um Modelle zu finden, die nahezu die volle Leistung mit deutlich weniger Aufwand liefern. Ein knapp antwortendes, aber schwaches Modell kann hier weit oben stehen.

Was kann ich dem Benchmark nicht entnehmen?

Weltwissen, Kreativität oder Programmierfähigkeit. Dafür gibt es andere Benchmarks. Hier geht es um eine einzige Frage: Kann ein Modell deutsche Geschäftsprozesse so zuverlässig bearbeiten, dass man ihm Verantwortung übergeben kann?