Europas schnellste LLM-Inferenz
Überzeugen Sie sich selbst.
Echte Benchmark-Ergebnisse aus unserer EU-Infrastruktur. Unabhängig verifizierte Technologie. Open-Source-Benchmarks, die Sie selbst ausführen können.
Tokens pro Sekunde, gemessen
Diese Werte stammen aus unserer Produktions-API mit unseren Servern in der EU. Kein Marketingversprechen - echte Messungen, die Sie selbst reproduzieren können.
Zuletzt gemessen: July 2026
gpt-oss-120b
10K Eingabe / 1K Ausgabe, Einzelanfrage
Bis zu 772 tok/s bei kürzeren Prompts
MiniMax M2.7 Ultraspeed
10K Eingabe / 1K Ausgabe, Einzelanfrage
Bis zu 444 tok/s bei kürzeren Prompts
Gemma 4 31B
10K Eingabe / 1K Ausgabe, Einzelanfrage
Natives multimodales Verständnis für Bilder und Text
Serverseitige Messwerte (p50). Gemessen mit unserem Open-Source-Benchmark-Tool. Ihre clientseitigen Ergebnisse variieren je nach Netzwerkstandort und -bedingungen.
Vertiefung in unserem Glossar
Schnellste LLM-Inference, nach Workload
Welche Kennzahl über Ihre Geschwindigkeit entscheidet, hängt davon ab, was Sie bauen. Dieselben Messungen, dreifach geschnitten.
Chat und Voice
Time to First Token
388ms
gpt-oss-120b - p50
Dialog- und Voice-Anwendungen werden daran gemessen, wie schnell das erste Wort erscheint - nicht daran, wie schnell der Rest folgt.
Time to First TokenAgenten und Coding
Output-Throughput
713tok/s
gpt-oss-120b - p50
Agenten-Loops und Coding-Assistenten warten auf die vollständige Antwort, deshalb bestimmen Tokens pro Sekunde das Tempo. Für Frontier-Reasoning über lange Läufe erreicht MiniMax M2.7 Ultraspeed 428 tok/s bei einem 192K-Kontextfenster.
Output-ThroughputBatch und RAG
End-to-End-Latenz
1.789s
gpt-oss-120b - p50
Für Pipelines zählt der gesamte Umlauf bis zur vollständigen Antwort. Gemma 4 31B verarbeitet Bild und Text in derselben Anfrage - für Dokumenten- und Vision-Workloads.
End-to-End-LatenzSchnell ist nur die halbe Miete. Jede Zahl oben wurde auf Hardware gemessen, die uns in München gehört - was EU-souverän konkret bedeutet.
EU-gehostete Inferenz-Infrastruktur
Alle Benchmarks werden auf Infercoms Produktionsinfrastruktur in Deutschland gemessen. Ihre Daten verlassen nie die europäische Gerichtsbarkeit.
Standort
München, Deutschland
Hardware
SambaNova SN40L Dataflow-Architektur
Zertifizierung
ISO 27001 zertifiziert
Eigentum
Infercom-eigene Hardware
Ihre Anfragen landen auf Infrastruktur, die uns gehört - keine gemietete Cloud-Kapazität von Hyperscalern.
Datenresidenz
100% EU - Kein CLOUD Act
Daten verlassen nie die europäische Gerichtsbarkeit. Kein US CLOUD Act, keine Drittlandtransfers.
Was wir messen
Drei Kennzahlen, die für den produktiven KI-Inferenz-Betrieb entscheidend sind
Zeit bis zum ersten Token (TTFT)
Wie schnell das Modell nach Ihrer Anfrage mit der Antwort beginnt. Entscheidend für interaktive Anwendungen und Chat-Interfaces.
Ausgabe-Durchsatz
Generierte Token pro Sekunde nach dem ersten Token. Bestimmt, wie schnell eine vollständige Antwort beim Nutzer ankommt.
End-to-End-Latenz
Gesamtzeit von der Anfrage bis zur vollständigen Antwort. Umfasst TTFT plus die gesamte Generierungszeit. Die maßgebliche Kennzahl für Batch-Workloads.
Eigenen Benchmark starten
Unser Benchmark-Tool ist vollständig Open Source. Führen Sie es mit Ihrem API-Key gegen unsere API aus oder klonen Sie das Repository und starten Sie es lokal. Gleicher Code, gleiche Methodik - Ihre eigenen Ergebnisse.
Synthetische Performance
Feste Eingabe- und Ausgabe-Token-Anzahl für kontrollierte Vergleiche zwischen Modellen
Simulation realer Workloads
Variable Anfragerate zur Simulation realer Produktionslastmuster
Eigener Datensatz
Eigene Prompts hochladen und Performance auf dem eigenen Workload messen
Interaktiver Chat
Kennzahlen pro Antwort in einem Live-Chat-Interface - TTFT und Durchsatz für jede Antwort einsehen
Unabhängige Verifizierung
Infercom basiert auf SambaNovs Dataflow-Architektur - derselben Technologie, die von Analysten, Forschern und Technologiejournalisten unabhängig gemessen wurde.
Artificial Analysis
Artificial Analysis - SambaNova Benchmarks
Unabhängige, kontinuierlich aktualisierte Benchmarks zu Geschwindigkeit, Latenz und Qualität über alle großen Inferenz-Anbieter hinweg. Der Branchenstandard.
Mehr lesenVentureBeat
SambaNova durchbricht die 1.000-Token/Sek.-Schallmauer
Wie SambaNovs Dataflow-Architektur Weltrekord-Durchsatz erreicht - dieselbe Technologie, die Infercom antreibt.
Mehr lesenTechRadar
DeepSeek R1 671B mit 95 % weniger Chips
Das weltweit größte Reasoning-Modell auf nur 16 SambaNova-Chips statt 320 GPUs - mit schnelleren Ergebnissen.
Mehr lesenSambaNova
Geschwindigkeitsrekord bei Llama 3.1 405B
Von Artificial Analysis unabhängig verifiziert: 4x schneller als der nächste Anbieter beim größten Llama-Modell.
Mehr lesenSambaNova
Intelligence per Joule
Warum Token pro Sekunde nicht die ganze Geschichte erzählt - Energieeffizienz pro Intelligenzeinheit ist die entscheidende Kennzahl im großen Maßstab.
Mehr lesenStanford Hazy Research
Intelligence Per Watt: Forschungsergebnisse
Akademische Methodik zur Messung von KI-Effizienz, die SambaNovs Energieangaben unabhängig bestätigt.
Mehr lesenHöchste Performance bei geringem Energieverbrauch
Bis zu 5x energieeffizienter als GPU-basierte Inferenz. Geschwindigkeit muss nicht auf Kosten der Umwelt gehen.
10 kW
Pro Rack
vs. 40–50 kW+ für vergleichbare GPU-Infrastruktur. Deutliche Reduzierung von Stromverbrauch und Kühlanforderungen.
Luftgekühlt
Keine Flüssigkühlung
Standardluftkühlung vereinfacht den Betrieb, eliminiert Wasserverbrauch und reduziert betriebliche Komplexität und Kosten.
Bis zu 5x
Effizienter
Mehr Intelligenz pro verbrauchtem Joule. Validiert durch die Methodik von Stanford Hazy Research.
Ihre Integration optimieren
Holen Sie mit unseren Developer-Ressourcen das Maximum aus Ihrer Infercom-Integration heraus.
Performance-Leitfaden
Connection Pooling, Streaming, Techniken zur Latenzreduzierung
Benchmark-Tool
Benchmarks gegen unsere API mit eigenen Workloads ausführen
AI Starter Kit
Open-Source-Beispiele, Benchmarks und Integrations-Templates
Preise
Transparente Token-basierte Preisgestaltung - zahlen Sie nur für die Nutzung
LLM-Inference-Geschwindigkeit: Häufige Fragen
Infercom betreibt Open-Weight-Modelle wie gpt-oss-120b auf SambaNova-Dataflow-Hardware in München. Unser höchster gemessener Output liegt bei 713 Tokens pro Sekunde, mit Spitzen bis zu 772 tok/s bei kürzeren Prompts - bis zu 10x schneller als GPU-basierte Alternativen. Jede Zahl ist ein serverseitiger p50-Wert aus unserer Produktions-API, keine Herstellerschätzung, und Sie können sie mit unserem Open-Source-Benchmark-Tool reproduzieren.
Benchmark selbst ausführengpt-oss-120b führt beim Output-Throughput mit 713 tok/s und hat mit 388 ms auch unsere niedrigste Time to First Token - damit ist es die Standardwahl für Chat, Voice und Agenten-Loops mit hohem Volumen. MiniMax M2.7 Ultraspeed ist unser 229B-Frontier-Reasoning-Modell mit 428 tok/s und einem 192K-Kontextfenster, für lange agentische Läufe und schwierige Coding-Aufgaben. Gemma 4 31B erreicht 199 tok/s und verarbeitet Bild und Text nativ. Chat und Voice hängen an der Time to First Token, Agenten und Coding am Throughput.
Modelle vergleichenJa. Jede Zahl ist ein serverseitiger p50-Wert bei 10K Input- und 1K Output-Tokens, Einzelanfrage, gemessen gegen unsere Produktions-API mit unserem Open-Source-Benchmark-Tool. Führen Sie es online mit Ihrem eigenen API-Key gegen unsere API aus, oder klonen Sie das Repository und lassen Sie es lokal mit Ihren eigenen Prompts laufen. Ihre clientseitigen Ergebnisse weichen je nach Netzwerkstandort und -bedingungen ab.
Quellcode des Benchmark-Tools ansehenDataflow-Hardware hält ihre Compute-Pipeline schon bei kleinen Batch-Größen ausgelastet. Die Geschwindigkeit pro Anfrage hängt deshalb nicht davon ab, viele Anfragen zu bündeln, wie es beim GPU-Serving der Fall ist. Batching erhöht weiterhin den Gesamtdurchsatz des Systems, ist aber nicht die Ursache der oben genannten Werte pro Anfrage. Die hier veröffentlichten Zahlen sind p50-Werte für Einzelanfragen. Wenn das Verhalten unter Nebenläufigkeit für Ihren Workload zählt, bietet das Benchmark-Tool einen Real-Workload-Modus, der variable Anfrageraten gegen unsere API abspielt.
So funktioniert die Dataflow-ArchitekturDie Dataflow-Architektur, auf der Infercom läuft, wird von Artificial Analysis laufend gebenchmarkt und wurde von VentureBeat und TechRadar behandelt; die zugrunde liegende Methodik zur Energieeffizienz wurde von Stanford Hazy Research validiert. Diese Quellen betreffen die Technologie - die Zahlen pro Modell auf dieser Seite sind unsere eigenen Messungen auf unserer eigenen Münchner Infrastruktur. Genau deshalb veröffentlichen wir das Benchmark-Tool, damit Sie sie prüfen können.
Unabhängige Benchmarks ansehenEine GPU bewegt Modellgewichte und Aktivierungen ständig zwischen Compute und Speicher hin und her und wartet beim Token-für-Token-Decoding einen Großteil der Zeit auf diesen Speicherverkehr. Eine Dataflow-Architektur bildet das Modell auf dem Chip ab und lässt die Daten hindurchströmen, sodass deutlich mehr Silizium pro Token nützliche Arbeit leistet. Daher kommt der Geschwindigkeitsvorteil von bis zu 10x gegenüber GPU-basierter Inference - zusammen mit einer bis zu 5x besseren Energieeffizienz.
Dataflow vs. GPU-Architektur erklärt