Nivero LLM-Benchmark

Welche KI-Modelle beherrschen deutsche Geschäftsprozesse?

Belege extrahieren, Prozessautomatisierung, Prozessketten, Compliance und Geschäftsmails: Aufgaben, die in deutschen Unternehmen täglich anfallen, in einem Benchmark.

Gewichte
Thinking
Modalität
Region
# Modell Kategorien Tokenverbrauch Preis / Leistung Gesamt Effizienz
1 Muse Spark 1.2 (low) Parameter nicht veröffentlicht 91.4 98.8 98.6 97.5 92.7 97.4 96.0 44
2 Gemini 3.7 Flash Parameter nicht veröffentlicht Vision 87.4 99.2 100.0 95.0 95.8 100.0 95.5 51
3 Gemini 3.8 Flash (medium) Parameter nicht veröffentlicht Vision 86.2 99.6 100.0 94.2 95.8 100.0 95.2 49
4 Muse Spark 1.3 (max) Thinking Parameter nicht veröffentlicht 91.4 98.0 99.3 95.0 94.8 89.7 94.9 25
5 Gemini 3.7 Flash Thinking Parameter nicht veröffentlicht Vision 87.9 98.4 96.4 95.0 95.8 100.0 94.9 30
6 Muse Spark 1.2 (max) Thinking Parameter nicht veröffentlicht 92.0 97.6 98.6 95.8 86.5 96.2 94.8 22
7 Muse Spark 1.2 (high) Parameter nicht veröffentlicht 91.4 99.2 99.3 99.2 88.5 83.3 94.6 24
8 Muse Spark 1.3 (low) Parameter nicht veröffentlicht 89.7 97.6 97.9 96.7 94.8 91.0 94.6 52
9 Muse Spark 1.3 (high) Parameter nicht veröffentlicht 92.5 94.7 98.6 95.8 92.7 89.7 94.2 30
10 Gemini 3.6 Flash Parameter nicht veröffentlicht Vision 88.5 96.3 91.4 97.5 95.8 100.0 94.1 27
11 Kimi K3 2.8T / MoE Open Weight Vision 85.6 94.7 100.0 94.2 95.8 100.0 93.8 46
12 Gemini 3.6 Flash Thinking Parameter nicht veröffentlicht Vision 88.5 91.3 92.1 95.8 95.8 98.7 92.6 22
13 Gemini 3.5 Flash Thinking Parameter nicht veröffentlicht Vision 87.4 92.3 92.1 95.8 95.8 98.7 92.6 21
14 DeepSeek V4.1 Flash (medium) 552B (8-16B aktiv) / MoE Open Weight Vision 83.3 97.2 96.4 90.8 94.8 96.2 92.3 43
15 Claude Fable 5 Parameter nicht veröffentlicht Vision 92.5 82.5 99.3 93.3 95.8 89.6 91.2 71
16 Gemini 3.5 Flash-Lite Thinking Parameter nicht veröffentlicht Vision 87.9 88.3 93.6 90.0 95.8 97.4 90.9 22
17 Grok 4.5 ~1.5T / MoE Vision 87.9 88.5 95.0 93.3 94.8 84.6 90.3 40
18 Kimi K2.6 1T (32B aktiv) / MoE Open Weight Vision 75.9 98.8 100.0 90.0 93.8 87.2 90.3 19
19 Gemma 4 31B Thinking 30,7B / Dense Open Weight Vision 76.4 96.7 92.9 90.8 94.8 97.4 90.1 32
20 Claude Opus 4.8 Parameter nicht veröffentlicht Vision 91.4 96.4 86.4 68.3 94.8 100.0 89.6 74
21 GPT-5.6 Sol Parameter nicht veröffentlicht Vision 89.1 86.8 99.3 93.3 95.8 71.8 89.6 124
22 GPT-5.6 Terra Parameter nicht veröffentlicht Vision 87.4 87.6 95.0 96.7 96.9 74.4 89.6 134
23 Qwen3.8 2.4T A95B 2,4T (95B aktiv) / MoE Open Weight 73.0 95.1 98.6 95.0 94.8 84.6 89.0 21
24 Claude Sonnet 5 Parameter nicht veröffentlicht Vision 72.4 94.7 97.1 85.8 93.8 100.0 88.6 52
25 DeepSeek V4 Pro 0813 1,6T (49B aktiv) / MoE Open Weight 73.6 96.8 97.1 90.8 94.8 78.2 88.1 24
26 GLM 5.3 Flash (high) 320B (18B aktiv) / MoE Open Weight Vision 75.3 90.1 90.7 86.7 95.8 98.7 87.4 76
27 DeepSeek V4 Flash 0731 284B (13B aktiv) / MoE Open Weight 62.1 99.2 92.1 94.2 94.8 94.9 87.2 26
28 Hy3 Thinking 295B (21B aktiv) / MoE Open Weight 78.7 92.8 98.6 80.0 90.6 84.6 87.2 19
29 Muse Glimmer 30B 30B / Dense Open Weight Vision 81.0 80.7 95.7 88.3 93.8 94.9 86.9 22
30 GLM 5.3 Flash (max) Thinking 320B (18B aktiv) / MoE Open Weight Vision 73.0 83.5 95.0 88.3 95.8 100.0 86.2 37
31 Qwen3.8 Flash 125B (6B aktiv) / MoE Open Weight Vision 77.6 79.3 95.0 94.2 95.8 83.3 85.5 18
32 MiniMax M3 428B (23B aktiv) / MoE Open Weight Vision 67.8 90.1 92.1 84.2 94.8 100.0 85.4 44
33 Inkling 975B (41B aktiv) / MoE Open Weight Vision 63.8 82.7 100.0 94.2 95.8 97.4 85.1 26
34 GLM 5.3 Flash (low) 320B (18B aktiv) / MoE Open Weight Vision 77.0 83.9 91.4 77.5 95.8 97.4 84.9 101
35 MiMo V2.5 Pro 1,02T (42B aktiv) / MoE Open Weight Vision 82.2 93.1 84.3 60.8 93.8 97.4 84.7 81
36 Qwen3.6 27B 27B / Dense Open Weight Vision 56.9 93.9 91.4 87.5 99.0 100.0 84.4 14
37 Qwen3.8 27B 27B / Dense Open Weight Vision 67.8 92.3 95.0 84.2 95.8 75.6 84.0 12
38 DeepSeek V4 Flash 284B (13B aktiv) / MoE Open Weight 71.8 96.0 87.1 69.2 90.6 93.6 83.8 41
39 GLM 5.2 753B (40B aktiv) / MoE Open Weight 50.6 98.8 95.0 80.0 94.8 100.0 83.1 43
40 LongCat 2.0 1.6T (48B aktiv) / MoE Open Weight 60.3 96.8 90.7 76.7 93.8 85.9 82.4 21
41 Qwen3.6 35B A3B 35B (3B aktiv) / MoE Open Weight Vision 56.9 88.7 91.4 84.2 100.0 94.9 82.2 13
42 GPT-5.6 Luna Parameter nicht veröffentlicht Vision 60.9 84.4 94.3 95.0 94.8 74.4 81.6 105
43 Qwen3.7 Flash Parameter nicht veröffentlicht Vision 56.9 89.7 91.4 85.8 96.9 85.9 81.5 13
44 Mistral Medium 3.5 Thinking 128B / Dense Open Weight Vision 57.5 84.5 99.3 86.7 92.7 73.1 80.0 15
45 Hy3 295B (21B aktiv) / MoE Open Weight 70.7 87.3 86.4 57.5 86.5 92.3 79.0 90
46 Gemma 4 31B 30,7B / Dense Open Weight Vision 72.4 66.7 97.9 63.3 95.8 100.0 78.5 86
47 Step 3.7 Flash 196B (11B aktiv) / MoE Vision 35.6 92.7 95.0 85.8 94.8 97.4 78.4 18
48 Inkling Small 276B (12B aktiv) / MoE Open Weight Vision 42.5 87.5 91.4 95.0 95.8 80.8 78.1 24
49 GLM 5.3 (Thinking high) 753B (40B aktiv) / MoE 42.5 86.8 90.0 85.0 94.8 94.9 77.5 75
50 MiMo V2.5 310B (15B aktiv) / MoE Open Weight Vision 73.0 76.4 76.4 50.0 91.7 92.3 74.7 73
51 DeepSeek V4 Pro 1,6T (49B aktiv) / MoE Open Weight 71.3 59.6 97.1 54.2 90.6 98.7 74.3 80
52 Mistral Medium 3.5 128B / Dense Open Weight Vision 58.6 62.4 98.6 54.2 92.7 93.6 71.8 88
53 Gemma 4 26B A4B Thinking 25,2B (3,8B aktiv) / MoE Open Weight Vision 42.0 63.3 89.3 82.5 93.8 97.4 71.2 17
54 Nemotron 3 Ultra 550B (55B aktiv) / MoE Open Weight 41.4 84.5 82.9 57.5 97.9 88.5 71.2 79
55 Gemini 3.5 Flash-Lite Parameter nicht veröffentlicht Vision 84.5 41.5 83.6 60.8 83.3 96.2 71.1 83
56 Ling 3.0 Flash 124B (5.1B aktiv) / MoE Open Weight 15.5 87.7 99.3 78.3 97.9 87.2 71.0 23
57 Nemotron 3 Super 120B (12B aktiv) / MoE Open Weight 56.3 82.5 81.4 40.0 92.7 80.8 70.3 73
58 Solar Pro 4 (max) Thinking Parameter nicht veröffentlicht 33.9 74.8 92.9 75.8 94.8 78.2 69.8 10
59 Claude Haiku 4.5 Parameter nicht veröffentlicht Vision 24.7 92.3 78.6 55.0 89.6 100.0 68.2 60
60 Granite 4.2 30B 30B / Dense Open Weight 27.0 72.0 94.3 69.2 88.5 67.9 64.9 7
61 GPT-OSS 120B 120B (5.1B aktiv) / MoE Open Weight 33.3 62.3 90.7 87.5 92.7 47.4 64.6 28
62 Gemma 4 26B A4B 25,2B (3,8B aktiv) / MoE Open Weight Vision 42.5 53.6 80.7 49.2 88.5 85.9 61.0 67
63 Nemotron 3.5 Lightning 30B (3B aktiv) / MoE Open Weight 12.1 74.4 90.7 74.2 92.7 52.6 60.9 6
64 Solar Pro 4 (off) Parameter nicht veröffentlicht 37.4 66.8 80.7 31.7 90.6 85.9 60.5 63
65 Mistral Small 4 Thinking 119B (6B aktiv) / MoE Open Weight Vision 12.1 70.4 84.3 61.7 93.8 71.8 59.1 19
66 Laguna S 2.1 118B (8B aktiv) / MoE Open Weight 23.6 53.5 77.9 59.2 90.6 69.2 55.8 17
67 Mistral Small 4 119B (6B aktiv) / MoE Open Weight Vision 11.5 55.6 74.3 48.3 88.5 79.5 52.0 64
68 GPT-OSS 20B 20B (3.6B aktiv) / MoE Open Weight 16.7 32.4 88.6 66.7 91.7 71.8 51.9 17
69 Laguna XS 2.1 33B (3B aktiv) / MoE Open Weight 13.2 46.3 87.9 62.5 91.7 44.9 51.1 17
70 Nemotron 3 Nano 30B (3B aktiv) / MoE Open Weight 14.9 15.2 47.9 24.2 72.9 50.0 30.6 36

Wie sich der Nivero-Benchmark zusammensetzt

Der Gesamtscore ist das Ergebnis aus den folgenden sechs Kategorien.

KategorieGewichtWas gemessen wird
Belegextraktion25 %Deutsche Rechnungen, Lieferscheine, Mahnungen, Schlussrechnungen in strukturierte Daten überführen. OCR-typisches Rauschen, verschachtelte Tabellen, vertauschte Spalten, gemischte Steuersätze.
Prozessautomatisierung25 %Tools korrekt bedienen: Stammdaten suchen, Zahlungen anlegen, Klärfälle melden statt raten. Gemessen in zwei Teilen: kurze Ketten (15 %) und lange Agent-Läufe über Dutzende Schritte (10 %). Posteingang abarbeiten, Mahnläufe, Zahlläufe mit Budgetgrenze, Wiederaufsetzen nach Fehlern. Auch destruktive Werkzeuge stehen bereit und dürfen nie aufgerufen werden.
Verlässlichkeit15 %Wir versuchen Halluzination zu provozieren: fehlende Angaben, ähnlich aussehende Köder-Werte, Zahlendreher in Summen, Fragen über zwei Belege hinweg. Wer erfindet, fällt durch.
Compliance15 %Pflichtangaben nach § 14 UStG, Steuerschuldnerschaft nach § 13b, Steuersätze, Skonto-, Zins- und Kaskadenrechnung mit kaufmännischer Rundung. Bei berechneten Beträgen gilt eine Toleranz von einem Cent, wie sie auch in der Buchhaltungspraxis üblich ist. Abgelesene Werte müssen exakt stimmen.
Datenabgleich10 %Briefköpfe und Positionen gegen Stammdaten auflösen. Umlaute, Deutsche Zeichen, Größenvarianten, Umzüge, und die Disziplin, bei fehlender Eindeutigkeit keinen Treffer zu melden.
Kommunikation10 %Geschäftspost einordnen und beantworten: Sie- und Du-Form, alle Fakten korrekt, keine erfundenen Zusagen, keine Platzhalter wie [Name], versandfertig.

LLM-as-a-Judge

Für rund 95 Prozent des Benchmarks und seiner Scores gibt es nur eine richtige Antwort. Dazu zählen zum Beispiel Wertvergleiche, Regelprüfungen, Protokollauswertung und mehr. Die restlichen 5 Prozent sind frei formulierte Korrespondenz, E-Mails, etc. und werden von 5 Richtern bewertet. Die Richter sind in dem Fall andere LLMs. Um möglichst viel Varianz reinzubringen aber trotzdem die Nivero-Benchmark-Qualität zu bieten, haben wir Ankersets definiert und geschaut, welche LLM-Familien sich als Judge eignen. Über 10 sind hierbei durchgefallen. Final bewerten Modelle von OpenAI, Anthropic, Google, Mistral und DeepSeek. Als Springer dient MiMo, von Xiaomi. D. h. wenn ein OpenAI Modell bewertet wird, fliegt OpenAI als Judge raus und wird durch MiMo ersetzt. So bewertet nie die eigene Modellfamilie eigene Modelle. Die Richter beantworten nur konkrete Ja-Nein-Aussagen und dadurch, dass es 5 Richter sind, entsteht nie ein Unentschieden, es gibt nur klare Resultate, die in den Score einfließen.

Häufige Fragen

Welche Daten werden für die Benchmarks genutzt?

Wir haben den Benchmark nicht mit echten Kundendaten durchgeführt, sondern vielmehr unsere Erfahrung der Kundendaten genutzt, um synthetische Belege und Daten zu erzeugen. Diese Daten beinhalten dieselben Fallstricke wie korrekte deutsche und europäische Geschäftsdokumente und -Belege, aber ohne dass hier Kundendaten genutzt werden.

Sind die Daten des Benchmarks öffentlich?

Nein, wir veröffentlichen nur die Methodik (siehe oben) aber nicht die genauen Dokumente, Texte und Prompts. Dies hat den Hintergrund, dass wir vermeiden wollen dass die Modell-Anbieter sogenanntes "Benchmaxxing" betreiben, wie es bei anderen synthetischen Benchmarks passiert.

Sagt mir der Benchmark, welches Modell Nivero einsetzt?

Nein. Er zeigt, was Modelle im generellen aktuell können. Deshalb haben wir diesen Benchmark auch in die vielen Kategorien aufgeteilt. Welche Modelle wir in welchem Prozessschritt kombinieren, entscheidet sich je Aufgabe, auch natürlich anhand unserer Erkenntnisse sowohl aus diesem Benchmark als auch der RL-Performance und weiteren umfangreichen Tests.

Warum sind die Regionen relevant?

Die Region bezeichnet die Herkunft des LLM-Herstellers, nicht den Standort des Rechenzentrums. Ein chinesisches Open-Weight-Modell kann auf einem Frankfurter Server betrieben werden und unterliegt dann anderen Rahmenbedingungen als eine API beim Hersteller. Für die Einordnung lohnt deshalb der Blick auf beide Filter zusammen: Open-Weight-Modelle lassen sich unabhängig von ihrer Herkunft selbst hosten, proprietäre Modelle laufen immer beim Anbieter.

Wie lese ich das Preis/Leistung in der Tabelle?

Aus zwei gemessenen Größen: dem tatsächlichen Token-Verbrauch des Modells über den kompletten Benchmark-Durchlauf (alle Aufgaben, drei Versuche, einschließlich Werkzeug-Dialogen und Denk-Schritten) und seinem Listenpreis je Million Tokens. Beides zusammen ergibt die Kosten eines Durchlaufs, also den Preis für dieselbe Arbeitsmenge bei jedem Modell. Geteilt durch den Gesamtscore entstehen die Kosten je Punkt.

Was misst die Spalte Effizienz?

Die Effizienz setzt den Gesamtscore ins Verhältnis zu den Tokens, die ein Modell für dieselbe Arbeitsmenge ausgibt, also Punkte je Million Ausgabe-Tokens. Höher ist besser. Wir zählen bewusst nur die Ausgabe, das also, was das Modell selbst erzeugt, inklusive Antwort und Denkschritten. Genau diese treibt in der Praxis die Antwortzeit und die laufenden Kosten je Anfrage. Anders als bei Preis/Leistung fließt hier kein Anbieterpreis ein. Ein Modell kann günstig abgerechnet werden und trotzdem viele Tokens verbrauchen, oder umgekehrt. Deshalb lohnt der Blick auf beide Spalten.

Die Effizienz fließt nicht in den Gesamtscore ein, sie ist eine eigene Sicht. Über die Spaltenüberschrift lässt sich die Tabelle danach sortieren, um Modelle zu finden, die nahezu die volle Leistung mit deutlich weniger Aufwand liefern. Ein knapp antwortendes, aber schwaches Modell kann hier weit oben stehen.

Warum ist mehr Denkbudget nicht automatisch besser?

Einige Modelle stehen mehrfach in der Tabelle, mit der Denkstufe in Klammern oder als Thinking-Variante. Der Vergleich zeigt beide Richtungen. Schwächere und mittlere Modelle gewinnen mit Denkbudget oft deutlich, in unseren Messungen bis zu zwanzig Punkte, vor allem in rechenlastigen Kategorien. Sehr starke Modelle lösen dieselben Aufgaben aber schon ohne langes Nachdenken. Zusätzliche Denkschritte fügen dann keine Fähigkeit mehr hinzu, sie schaffen vor allem Gelegenheiten, eine richtige erste Antwort noch einmal zu verwerfen.

Dazu kommt unsere Wertung: Eine Aufgabe zählt nur, wenn das Modell sie dreimal hintereinander richtig löst. Lange Denkketten erhöhen die Streuung zwischen den Versuchen, und genau diese Ausreißer kosten Aufgaben. Für den Geschäftsalltag ist das die passende Messlatte, dort zählt die verlässlich richtige Antwort, nicht die gelegentlich brillante. Die Unterschiede zwischen den Denkstufen entstehen dabei überwiegend in den deterministisch geprüften Kategorien, also durch falsche Beträge, Felder oder Zuordnungen, nicht durch Geschmacksurteile der Bewertung.

Was kann ich dem Benchmark nicht entnehmen?

Weltwissen, Kreativität oder Programmierfähigkeit. Dafür gibt es andere Benchmarks. Hier geht es um eine einzige Frage: Kann ein Modell deutsche Geschäftsprozesse so zuverlässig bearbeiten, dass man ihm Verantwortung übergeben kann?