Performance

Europas schnellste LLM-Inferenz

Überzeugen Sie sich selbst.

Echte Benchmark-Ergebnisse aus unserer EU-Infrastruktur. Unabhängig verifizierte Technologie. Open-Source-Benchmarks, die Sie selbst ausführen können.

Gemessen auf Infercom EU-Infrastruktur

Diese Werte stammen aus unserer Produktions-API mit unseren Servern in der EU. Kein Marketingversprechen - echte Messungen, die Sie selbst reproduzieren können.

Zuletzt gemessen: July 2026

EU-souveränHöchster Durchsatz

gpt-oss-120b

Ausgabe-Durchsatz
713tok/s
Zeit bis zum ersten Token
388ms
End-to-End-Latenz
1.789s

10K Eingabe / 1K Ausgabe, Einzelanfrage

Bis zu 772 tok/s bei kürzeren Prompts

EU-souveränBestes Reasoning

MiniMax M2.7 Ultraspeed

Ausgabe-Durchsatz
428tok/s
Zeit bis zum ersten Token
690ms
End-to-End-Latenz
3.023s

10K Eingabe / 1K Ausgabe, Einzelanfrage

Bis zu 444 tok/s bei kürzeren Prompts

EU-souveränNative Multimodal

Gemma 4 31B

Ausgabe-Durchsatz
199tok/s
Zeit bis zum ersten Token
1189ms
End-to-End-Latenz
6.206s

10K Eingabe / 1K Ausgabe, Einzelanfrage

Natives multimodales Verständnis für Bilder und Text

Serverseitige Messwerte (p50). Gemessen mit unserem Open-Source-Benchmark-Tool. Ihre clientseitigen Ergebnisse variieren je nach Netzwerkstandort und -bedingungen.

EU-gehostete Inferenz-Infrastruktur

Alle Benchmarks werden auf Infercoms Produktionsinfrastruktur in Deutschland gemessen. Ihre Daten verlassen nie die europäische Gerichtsbarkeit.

Standort

München, Deutschland

Hardware

SambaNova SN40L Dataflow-Architektur

Zertifizierung

ISO 27001 zertifiziert

Eigentum

Infercom-eigene Hardware

Ihre Anfragen landen auf Infrastruktur, die uns gehört - keine gemietete Cloud-Kapazität von Hyperscalern.

Datenresidenz

100% EU - Kein CLOUD Act

Daten verlassen nie die europäische Gerichtsbarkeit. Kein US CLOUD Act, keine Drittlandtransfers.

Was wir messen

Drei Kennzahlen, die für den produktiven KI-Inferenz-Betrieb entscheidend sind

Zeit bis zum ersten Token (TTFT)

Wie schnell das Modell nach Ihrer Anfrage mit der Antwort beginnt. Entscheidend für interaktive Anwendungen und Chat-Interfaces.

Ausgabe-Durchsatz

Generierte Token pro Sekunde nach dem ersten Token. Bestimmt, wie schnell eine vollständige Antwort beim Nutzer ankommt.

End-to-End-Latenz

Gesamtzeit von der Anfrage bis zur vollständigen Antwort. Umfasst TTFT plus die gesamte Generierungszeit. Die maßgebliche Kennzahl für Batch-Workloads.

Open Source

Eigenen Benchmark starten

Unser Benchmark-Tool ist vollständig Open Source. Führen Sie es mit Ihrem API-Key gegen unsere API aus oder klonen Sie das Repository und starten Sie es lokal. Gleicher Code, gleiche Methodik - Ihre eigenen Ergebnisse.

Why is it this fast? The architecture behind our speed →

Synthetische Performance

Feste Eingabe- und Ausgabe-Token-Anzahl für kontrollierte Vergleiche zwischen Modellen

Simulation realer Workloads

Variable Anfragerate zur Simulation realer Produktionslastmuster

Eigener Datensatz

Eigene Prompts hochladen und Performance auf dem eigenen Workload messen

Interaktiver Chat

Kennzahlen pro Antwort in einem Live-Chat-Interface - TTFT und Durchsatz für jede Antwort einsehen

Höchste Performance bei geringem Energieverbrauch

Bis zu 5x energieeffizienter als GPU-basierte Inferenz. Geschwindigkeit muss nicht auf Kosten der Umwelt gehen.

10 kW

Pro Rack

vs. 40–50 kW+ für vergleichbare GPU-Infrastruktur. Deutliche Reduzierung von Stromverbrauch und Kühlanforderungen.

Luftgekühlt

Keine Flüssigkühlung

Standardluftkühlung vereinfacht den Betrieb, eliminiert Wasserverbrauch und reduziert betriebliche Komplexität und Kosten.

Bis zu 5x

Effizienter

Mehr Intelligenz pro verbrauchtem Joule. Validiert durch die Methodik von Stanford Hazy Research.

Bereit, die Zukunft der AI in Europa zu gestalten?

Schließen Sie sich zukunftsorientierten Unternehmen an, die Souveräne KI mit Weltklasse-Performance einsetzen