Europas hurtigste LLM-inference
Tag ikke vores ord for det - verificer det selv.
Reelle benchmark-resultater fra vores EU-infrastruktur. Uafhængigt verificeret teknologi. Open source-benchmarks du selv kan køre.
Tokens per sekund, målt
Disse tal er fra vores produktions-API med servere i EU. Ikke leverandørmarketing - reelle målinger du kan reproducere.
Sidst målt: July 2026
gpt-oss-120b
10K input / 1K output, single request
Op til 772 tok/s på kortere prompts
MiniMax M2.7 Ultraspeed
10K input / 1K output, single request
Op til 444 tok/s ved kortere prompts
Gemma 4 31B
10K input / 1K output, single request
Indbygget multimodal forståelse af billeder og tekst
Server-side metrics (p50). Målt med vores open source benchmark-værktøj. Dine client-side resultater vil variere afhængigt af netværksplacering og -forhold.
Uddybning i vores ordliste
Hurtigste LLM-inferens, efter workload
Hvilket tal der afgør din hastighed, afhænger af, hvad du bygger. Samme målinger, skåret på tre måder.
Chat og voice
Time to First Token
388ms
gpt-oss-120b - p50
Dialog- og voice-grænseflader bedømmes på, hvor hurtigt det første ord dukker op - ikke på, hvor hurtigt resten følger.
Time to First TokenAgenter og kodning
Output-throughput
713tok/s
gpt-oss-120b - p50
Agent-loops og kodeassistenter venter på hele svaret, så tokens per sekund sætter tempoet. Til frontier-reasoning over lange kørsler måler MiniMax M2.7 Ultraspeed 428 tok/s med et 192K kontekstvindue.
Output-throughputBatch og RAG
End-to-end-latens
1.789s
gpt-oss-120b - p50
For pipelines tæller den samlede rundtur til et fuldt svar. Gemma 4 31B tager billede og tekst i samme forespørgsel - til dokument- og vision-workloads.
End-to-end-latensHurtigt er kun det halve. Hvert tal ovenfor er målt på hardware, vi selv ejer i München - se hvad EU-suverænt faktisk betyder.
EU-hostet inference-infrastruktur
Alle benchmarks målt på Infercoms produktionsinfrastruktur i Tyskland. Dine data forlader aldrig europæisk jurisdiktion.
Placering
München, Tyskland
Hardware
SambaNova SN40L Dataflow-arkitektur
Certificering
ISO 27001-certificeret
Ejerskab
Infercom-ejet hardware
Dine forespørgsler ender på infrastruktur, vi ejer - ikke lejet cloud-kapacitet fra hyperscalere.
Dataresidency
100% EU - Ingen CLOUD Act-eksponering
Data forlader aldrig europæisk jurisdiktion. Ingen US CLOUD Act-eksponering, ingen tredjelandsoverførsler.
Hvad vi måler
Tre metrics der betyder noget for AI-inference i produktion
Time to First Token (TTFT)
Hvor hurtigt modellen begynder at svare efter din forespørgsel. Afgørende for interaktive applikationer og chatgrænseflader.
Output Throughput
Tokens genereret per sekund efter det første token. Bestemmer, hvor hurtigt et komplet svar leveres til brugeren.
End-to-End Latency
Total tid fra forespørgsel til komplet svar. Inkluderer TTFT plus fuld genereringstid. Det tal der betyder noget for batch-workloads.
Kør din egen benchmark
Vores benchmark-værktøj er fuldt open source. Kør det mod vores API med din API-nøgle, eller klon repositoryet og kør det lokalt. Samme kode, samme metode, dine resultater.
Synthetic Performance
Faste input/output token-antal for kontrollerede sammenligninger på tværs af modeller
Real Workload Simulation
Variable request rates der efterligner produktionstrafikmønstre
Custom Dataset
Upload dine egne prompts og mål performance på dit faktiske workload
Interactive Chat
Metrics per svar i en live chatgrænseflade - se TTFT og throughput på hvert svar
Uafhængig verificering
Infercom kører på SambaNova's dataflow-arkitektur - den samme teknologi, der uafhængigt er benchmarket af analytikere, forskere og tekjournalister.
Artificial Analysis
Artificial Analysis - SambaNova Benchmarks
Uafhængige, løbende opdaterede speed-, latency- og kvalitetsbenchmarks på tværs af alle større inference-udbydere. Industristandarden.
Læs mereVentureBeat
SambaNova Breaks 1,000 Tokens/Sec Barrier
Hvordan SambaNova's dataflow-arkitektur opnåede verdensrekord i throughput - den samme teknologi, der driver Infercom.
Læs mereTechRadar
DeepSeek R1 671B with 95% Fewer Chips
Den største reasoning-model i verden kører på kun 16 SambaNova-chips mod 320 GPU'er - med hurtigere resultater.
Læs mereSambaNova
Speed Record on Llama 3.1 405B
Uafhængigt verificeret af Artificial Analysis: 4x hurtigere end den nærmeste udbyder på den største Llama-model.
Læs mereSambaNova
Intelligence per Joule
Hvorfor tokens per second ikke er hele historien - energieffektivitet per enhed intelligens er det metric, der betyder noget i skala.
Læs mereStanford Hazy Research
Intelligence Per Watt Research
Akademisk metode til måling af AI-effektivitet, der uafhængigt validerer SambaNova's energipåstande.
Læs merePerformance uden den store elregning
Op til 5x mere energieffektiv end GPU-baseret inference. Hastighed behøver ikke gå ud over planeten.
10 kW
Per rack
mod 40–50 kW+ for tilsvarende GPU-infrastruktur. Dramatisk reduktion i strømforbrug og kølingskrav.
Air Cooled
Ingen væskekøling
Standard luftkøling forenkler deployment, eliminerer vandforbrug og reducerer driftskompleksitet og omkostninger.
Op til 5x
Mere effektiv
Mere intelligens per joule energi forbrugt. Valideret af Stanford Hazy Research-metoden.
Optimer din integration
Få den bedste performance fra din Infercom-integration med vores developer-ressourcer.
LLM-inferenshastighed: ofte stillede spørgsmål
Infercom kører open-weight-modeller som gpt-oss-120b på SambaNova dataflow-hardware i München. Vores højeste målte output er 713 tokens per sekund, med spidser op til 772 tok/s på kortere prompts - op til 10x hurtigere end GPU-baserede alternativer. Hvert tal er en serverside-p50 fra vores produktions-API, ikke et leverandørestimat, og du kan reproducere det med vores open source-benchmarkværktøj.
Kør benchmarken selvgpt-oss-120b fører på output-throughput med 713 tok/s og har også vores laveste Time to First Token på 388 ms, hvilket gør den til standardvalget til chat, voice og agent-loops med stort volumen. MiniMax M2.7 Ultraspeed er vores 229B frontier-reasoning-model med 428 tok/s og et 192K kontekstvindue, til lange agentiske kørsler og svære kodeopgaver. Gemma 4 31B måler 199 tok/s og tager billede og tekst nativt. Chat og voice afhænger af Time to First Token, agenter og kodning af throughput.
Sammenlign modellerneJa. Hvert tal er en serverside-p50 ved 10K input- og 1K output-tokens, enkelt forespørgsel, målt mod vores produktions-API med vores open source-benchmarkværktøj. Kør det online mod vores API med din egen nøgle, eller klon repositoryet og kør det lokalt med dine egne prompts. Dine klientside-resultater vil afvige afhængigt af netværksplacering og forhold.
Se benchmarkværktøjets kildekodeDataflow-hardware holder sin compute-pipeline beskæftiget allerede ved små batch-størrelser, så hastigheden per forespørgsel afhænger ikke af at stable mange forespørgsler sammen, som GPU-serving gør. Batching øger stadig systemets samlede throughput, men det er ikke det, der giver tallene per forespørgsel ovenfor. Tallene her er p50 for enkelte forespørgsler. Hvis adfærd under samtidighed betyder noget for din workload, har benchmarkværktøjet en real-workload-tilstand, der afspiller variable forespørgselsrater mod vores API.
Sådan fungerer dataflow-arkitekturenDen dataflow-arkitektur, Infercom kører på, benchmarkes løbende af Artificial Analysis og er dækket af VentureBeat og TechRadar, mens den underliggende metode til energieffektivitet er valideret af Stanford Hazy Research. De kilder dækker teknologien - tallene per model på denne side er vores egne målinger på vores egen infrastruktur i München. Derfor udgiver vi benchmarkværktøjet, så du kan efterprøve dem.
Se de uafhængige benchmarksEn GPU flytter hele tiden modelvægte og aktiveringer mellem compute og hukommelse, og under token-for-token-afkodning bruger den en stor del af tiden på at vente på den hukommelsestrafik. En dataflow-arkitektur lægger modellen ud på chippen og lader data strømme igennem den, så langt mere silicium udfører nyttigt arbejde per token. Derfra kommer hastighedsfordelen på op til 10x i forhold til GPU-baseret inferens, sammen med op til 5x bedre energieffektivitet.
Dataflow vs. GPU-arkitektur forklaret