L'Inference LLM più Veloce d'Europa
Non fidarti solo delle nostre parole - verificalo tu stesso.
Risultati benchmark reali dalla nostra infrastruttura UE. Tecnologia verificata indipendentemente. Benchmark open-source che puoi eseguire tu stesso.
Token al secondo, misurati
Questi numeri provengono dalla nostra API di produzione con i nostri server nell'UE. Non marketing del vendor - misurazioni reali che puoi riprodurre.
Ultima misurazione: July 2026
gpt-oss-120b
10K input / 1K output, singola richiesta
Fino a 772 tok/s su prompt più brevi
MiniMax M2.7 Ultraspeed
10K input / 1K output, singola richiesta
Fino a 444 tok/s con prompt più brevi
Gemma 4 31B
10K input / 1K output, singola richiesta
Comprensione multimodale nativa per immagini e testo
Metriche server-side (p50). Misurate usando il nostro strumento benchmark open-source. I tuoi risultati client-side varieranno in base alla posizione di rete e alle condizioni.
Approfondimenti nel nostro glossario
L'inference LLM più veloce, per workload
Quale numero determina la tua velocità dipende da cosa stai costruendo. Le stesse misurazioni, lette in tre modi.
Chat e voice
Time to First Token
388ms
gpt-oss-120b - p50
Le interfacce conversazionali e vocali si giudicano da quanto in fretta compare la prima parola, non da quanto velocemente arriva il resto.
Time to First TokenAgenti e coding
Output throughput
713tok/s
gpt-oss-120b - p50
I loop degli agenti e gli assistenti di coding aspettano la risposta completa, quindi i token al secondo dettano il ritmo. Per il reasoning di frontiera su esecuzioni lunghe, MiniMax M2.7 Ultraspeed misura 428 tok/s con una finestra di contesto da 192K.
Output throughputBatch e RAG
Latenza end-to-end
1.789s
gpt-oss-120b - p50
Per le pipeline conta il giro completo fino alla risposta integrale. Gemma 4 31B accetta immagine e testo nella stessa richiesta, per workload documentali e di vision.
Latenza end-to-endLa velocità è solo metà del discorso. Ogni numero qui sopra è misurato su hardware di nostra proprietà a Monaco - scopri cosa significa davvero sovranità UE.
Infrastruttura di Inference Ospitata nell'UE
Tutti i benchmark misurati sull'infrastruttura di produzione Infercom in Germania. I tuoi dati non lasciano mai la giurisdizione europea.
Posizione
Monaco, Germania
Hardware
Architettura Dataflow SambaNova SN40L
Certificazione
Certificato ISO 27001
Proprietà
Hardware di Proprietà Infercom
Le tue richieste terminano su infrastruttura di nostra proprietà - non capacità cloud affittata da hyperscaler.
Residenza Dati
100% UE - Nessuna Esposizione CLOUD Act
I dati non lasciano mai la giurisdizione europea. Nessuna esposizione al CLOUD Act USA, nessun trasferimento verso paesi terzi.
Cosa Misuriamo
Tre metriche che contano per l'inference AI in produzione
Time to First Token (TTFT)
Quanto velocemente il modello inizia a rispondere dopo la tua richiesta. Critico per applicazioni interattive e interfacce chat.
Throughput in Output
Token generati al secondo dopo il primo token. Determina quanto velocemente viene consegnata una risposta completa all'utente.
Latenza End-to-End
Tempo totale dalla richiesta alla risposta completa. Include TTFT più tempo di generazione completo. Il numero che conta per carichi di lavoro batch.
Esegui il Tuo Benchmark
Il nostro benchmark è open source. Utilizzalo con la tua API key o clona il repository per i test in locale. Codice identico, stessa metodologia, risultati trasparenti.
Performance Sintetiche
Conteggi token input/output fissi per confronti controllati tra modelli
Simulazione Carico di Lavoro Reale
Rate di richiesta variabili che simulano pattern di traffico di produzione
Dataset Personalizzato
Carica i tuoi prompt e misura le prestazioni sul tuo carico di lavoro effettivo
Chat Interattiva
Metriche per risposta in un'interfaccia chat live - vedi TTFT e throughput su ogni risposta
Verifica Indipendente
Infercom funziona sull'architettura dataflow di SambaNova - la stessa tecnologia verificata indipendentemente da analisti, ricercatori e giornalisti tech.
Artificial Analysis
Artificial Analysis - Benchmark SambaNova
Benchmark indipendenti e continuamente aggiornati di velocità, latenza e qualità tra tutti i principali provider di inference. Lo standard del settore.
Leggi di piùVentureBeat
SambaNova Supera la Barriera dei 1.000 Token/Sec
Come l'architettura dataflow di SambaNova ha raggiunto throughput da record mondiale - la stessa tecnologia che alimenta Infercom.
Leggi di piùTechRadar
DeepSeek R1 671B con 95% di Chip in Meno
Eseguire il più grande modello di ragionamento del mondo su soli 16 chip SambaNova rispetto a 320 GPU - con risultati più veloci.
Leggi di piùSambaNova
Record di Velocità su Llama 3.1 405B
Verificato indipendentemente da Artificial Analysis: 4x più veloce del provider più vicino sul modello Llama più grande.
Leggi di piùSambaNova
Intelligenza per Joule
Perché i token al secondo non sono la storia completa - l'efficienza energetica per unità di intelligenza è la metrica che conta su scala.
Leggi di piùStanford Hazy Research
Ricerca Intelligence Per Watt
Metodologia accademica per misurare l'efficienza AI che valida indipendentemente le affermazioni energetiche di SambaNova.
Leggi di piùPrestazioni Senza la Bolletta Energetica
Fino a 5x più efficiente energeticamente rispetto all'inference basata su GPU. La velocità non deve avere un costo per il pianeta.
10 kW
Per Rack
rispetto a 40–50 kW+ per infrastruttura GPU equivalente. Riduzione drastica del consumo energetico e dei requisiti di raffreddamento.
Raffreddato ad Aria
No Raffreddamento a Liquido
Il raffreddamento ad aria standard semplifica il deployment, elimina l'uso di acqua e riduce complessità operativa e costi.
Fino a 5x
Più Efficiente
Più intelligenza per joule di energia consumata. Validato dalla metodologia Stanford Hazy Research.
Ottimizza la Tua Integrazione
Ottieni le migliori prestazioni dalla tua integrazione Infercom con le nostre risorse per sviluppatori.
Guida alle Prestazioni
Connection pooling, streaming, tecniche di riduzione latenza
Strumento Benchmark
Esegui benchmark contro la nostra API con i tuoi carichi di lavoro
AI Starter Kit
Esempi open-source, benchmark e template di integrazione
Prezzi
Prezzi trasparenti per token - paghi solo per ciò che usi
Velocità di inference LLM: domande frequenti
Infercom eroga modelli open-weight come gpt-oss-120b su hardware dataflow SambaNova a Monaco di Baviera. Il nostro output massimo misurato è di 713 token al secondo, con picchi fino a 772 tok/s su prompt più corti - fino a 10x più veloce delle alternative su GPU. Ogni valore è un p50 lato server della nostra API di produzione, non una stima del fornitore, e puoi riprodurlo con il nostro strumento di benchmark open source.
Esegui tu stesso il benchmarkgpt-oss-120b guida l'output throughput con 713 tok/s e ha anche il nostro Time to First Token più basso, 388 ms: è la scelta predefinita per chat, voice e loop di agenti ad alto volume. MiniMax M2.7 Ultraspeed è il nostro modello di reasoning di frontiera da 229B a 428 tok/s con una finestra di contesto da 192K, per esecuzioni agentiche lunghe e compiti di coding difficili. Gemma 4 31B misura 199 tok/s e accetta nativamente immagine e testo. Chat e voice dipendono dal Time to First Token, agenti e coding dal throughput.
Confronta i modelliSì. Ogni valore è un p50 lato server con 10K token di input e 1K di output, richiesta singola, misurato sulla nostra API di produzione con il nostro strumento di benchmark open source. Eseguilo online sulla nostra API con la tua chiave, oppure clona il repository ed eseguilo in locale con i tuoi prompt. I risultati lato client varieranno in base alla posizione e alle condizioni di rete.
Vedi il codice dello strumento di benchmarkL'hardware dataflow tiene occupata la propria pipeline di calcolo già con batch piccoli, quindi la velocità per richiesta non dipende dall'accumulare molte richieste insieme come avviene con le GPU. Il batching aumenta comunque il throughput complessivo del sistema, ma non è ciò che produce i valori per richiesta qui sopra. I numeri pubblicati sono p50 su richiesta singola. Se il comportamento in concorrenza conta per il tuo workload, lo strumento di benchmark ha una modalità real-workload che riproduce frequenze di richiesta variabili sulla nostra API.
Come funziona l'architettura dataflowL'architettura dataflow su cui gira Infercom è sottoposta a benchmark continui da Artificial Analysis ed è stata trattata da VentureBeat e TechRadar, mentre la metodologia sull'efficienza energetica è stata validata da Stanford Hazy Research. Queste fonti riguardano la tecnologia: i valori per modello di questa pagina sono nostre misurazioni sulla nostra infrastruttura di Monaco. Proprio per questo pubblichiamo lo strumento di benchmark, così puoi verificarli.
Vedi i benchmark indipendentiUna GPU sposta continuamente pesi del modello e attivazioni tra calcolo e memoria e, durante la decodifica token per token, passa gran parte del tempo ad attendere quel traffico di memoria. Un'architettura dataflow mappa il modello sul chip e vi fa scorrere attraverso i dati, così molto più silicio compie lavoro utile per ogni token. Da qui il vantaggio di velocità fino a 10x rispetto all'inference su GPU, insieme a un'efficienza energetica fino a 5 volte migliore.
Architettura dataflow vs. GPU, spiegata