Europas eneste offentlige SambaNova-udbyder

SambaNova-teknologi i Europa

Infercom er Europas første og eneste offentlige udbyder af SambaNova's dataflow-arkitektur. Specialbygget AI-inference, hostet i Tyskland, fuldt GDPR-kompatibel.

Op til 10x

Hurtigere inference

Op til 5x

Energieffektiv

100%

EU-hostet

Dataflow vs. GPU-arkitektur

Hvorfor specialbygget dataflow slår generelle GPU'er til AI-inference

SambaNova

Dataflow-arkitektur

Specialbygget til AI

Specialbygget til AI-workloads, der skaber tilpassede processing-pipelines for hele beregningsgrafer og minimerer databevægelse.

  • Hele modellen resident i hukommelsen
  • Data flyder gennem operationer uden mellemliggende writes
  • Operator fusion: hundredvis af operationer i en enkelt kernel
  • Softwaredefineret hardware optimerer for hvert workload

Traditionel GPU

Generelt design

Generelt design, der kræver kernel-for-kernel-eksekvering, skaber flaskehalse for AI-inference-workloads.

  • Kernel-for-kernel-eksekvering skaber overhead
  • Overdreven databevægelse mellem processor og hukommelse
  • Memory bandwidth-flaskehals begrænser performance
  • Underudnyttelse af compute-ressourcer

Dybdegående: Hvordan dataflow løser AI-inference-krisen

SambaNova-fordelen

GPU'er blev ikke bygget til AI. De blev designet til videospilgrafik, og arkitekturen viser det. SambaNova valgte en anden vej og designede chips, der er specialbygget til AI-inference fra bunden. Uafhængige benchmarks viser op til 10x hurtigere inference – den hurtigste tilgængelige LLM-inference-teknologi. Sådan fungerer det.

GPU'er bruger det meste af deres tid på at vente

Når en GPU genererer AI-svar, følger den en gentagen cyklus: hent data fra hukommelsen, beregn, skriv tilbage til hukommelsen, gentag. Turen til hukommelsen tager langt længere end selve beregningen. GPU'er bruger det meste af deres tid på at vente på data, ikke på at behandle dem.

Ingeniører kalder dette "memory-bound". Processoren venter, mens data flyttes frem og tilbage. For AI-inference, hvor hver token kræver denne hent-beregn-skriv-cyklus, hober forsinkelserne sig op. Et svar på 1.000 tokens betyder 1.000 hukommelsesture.

GPU-producenter har forsøgt hurtigere hukommelse og større caches. Kerneproblemet forbliver: data bliver ved med at hoppe mellem processor og hukommelse.

Dataflow streamer data gennem chippen i stedet for at flytte det

SambaNovass Reconfigurable Dataflow Units (RDU'er) fungerer anderledes. I stedet for at hente og gemme data gentagne gange, fordeler de operationer rumligt over chippen og streamer data kontinuerligt igennem. Data bevæger sig i én retning gennem beregningen, som dele på et samlebånd, i stedet for at blive læsset og aflæsset ved hvert trin.

Hele AI-modellen forbliver resident i hukommelsen. Data flyder gennem operationer uden mellemliggende writes. Operationer, der ville kræve separate trin på en GPU, bliver fusioneret sammen. SambaNova kalder dette "execution streaming kontinuerligt over processoren". Det er det modsatte af kernel-for-kernel GPU-eksekvering.

Mindre ventetid. Mere throughput.

Learn how dataflow architecture delivers speed

Et tre-lags hukommelsessystem lader ét rack køre 600B+ parameter-modeller

SambaNova bruger et tre-lags hukommelseshierarki, der balancerer hastighed og kapacitet. På det hurtigste niveau sidder 520 megabytes SRAM direkte på hver chip, der håndterer de hotteste data og muliggør operationsfusion uden hukommelsesture. Nedenunder holder 64 gigabytes high-bandwidth memory (HBM) modelvægte og aktive data. I modsætning til traditionelle caches er dette lag softwarestyret – systemet bestemmer præcis, hvad der ligger her, i stedet for at stole på automatiske eviction-politikker.

Det tredje lag giver op til 1,5 terabytes DDR-hukommelse pr. chip til prompt-caching og hosting af flere modeller samtidigt. Hver chip kan adressere hukommelse på tværs af alle chips i racket, hvilket skaber en massiv delt hukommelsespulje som et fladt adresserum.

Et enkelt rack kan køre modeller med hundredvis af milliarder parametre. Konkurrenter med rene SRAM-arkitekturer har brug for tusindvis af chips for at opnå samme kapabilitet. Tre-lags-tilgangen bytter en smule topfart for bedre kapacitet og fleksibilitet.

Op til 10x hurtigere end GPU-inference, 5x bedre energieffektivitet

Uafhængige benchmarks fra Artificial Analysis bekræfter performanceforskellen: SambaNovas dataflow-arkitektur leverer op til 10x hurtigere inference end GPU-alternativer, med op til 5x bedre energieffektivitet. Et enkelt rack forbruger omkring 10 til 15 kilowatt mod 40 til 50 kilowatt eller mere for ækvivalent GPU-infrastruktur. Det kører på standard luftkøling uden eksotiske væskekølingssystemer eller specialbyggede datacentre.

For realtidsapplikationer viser dette sig i brugeroplevelsen. En AI-assistent, der svarer på 200 millisekunder i stedet for 2 sekunder, er et andet produkt. Du bruger det konstant i stedet for at vente på det. Hurtigere tokens betyder også flere reasoning-trin inden for samme tidsbudget, hvilket er vigtigt for agentiske workflows og komplekse flertrins-opgaver.

SambaNova-teknologi i Europa: Infercom er den første og eneste offentlige udbyder

Al denne performance er tilgængelig gennem SambaNovas cloud. Men den cloud kører i USA. For europæiske virksomheder med GDPR-compliance-krav, datasuverænitetsmandater eller en præference for at holde følsomme data inden for EU-jurisdiktion skaber det en barriere.

Infercom bringer SambaNova til Europa. Vi driver den første og eneste offentlige SambaNova-cloud i EU, hostet i München, Tyskland. Latency fra Frankfurt er under 10 millisekunder. Med hastigheder over 400 tokens pr. sekund på modeller som MiniMax M2.7 Ultraspeeder det den hurtigste LLM-API i Europa – med komplet EU-datasuverænitet. Dine prompts og svar forlader aldrig europæisk jord. Ingen CLOUD Act-eksponering. Ingen tredjelands-dataoverførsler. Fuldt GDPR-kompatibel.

Hvis du bygger AI-applikationer, der har brug for både hastighed og suverænitet, er dette infrastrukturen.

SN40L Reconfigurable Dataflow Unit

Bygget på TSMC's 5nm-proces med 1.040 compute-kerner pr. chip - 638 BF16 TFLOPS pr. chip, 10,2 PetaFLOPS pr. rack.

SambaNova SN40L Reconfigurable Dataflow Unit (RDU) chip

SambaNova SN40L RDU - dual-die CoWoS-pakke på TSMC 5nm

638

TFLOPS/Chip (BF16)

1.040

PCUs/Chip

10,2

PFLOPS/Rack

TSMC 5nm

Proces

Tre-lags memory-arkitektur pr. chip

520MB

SRAM

Ultrahurtig on-chip cache

64GB

HBM

Høj-bandwidth co-packaged hukommelse

Op til 1,5TB

DDR

Off-package DIMM-lagring

Rack-konfiguration (SN40L-16)

16

RDU-chips

Op til 25TB

Total hukommelse

~10kW

Typisk effekt

Luft

Kølet

Verdensrekord-performance

Performance målt i output-tokens pr. sekund. Benchmarks fra Infercom EU-infrastruktur i München, Tyskland.

404tokens/sek

Højtydende multimodal model, nu hostet på Infercoms EU-infrastruktur. Uafhængigt målt til 400+ tokens/sek af Artificial Analysis.

EU-suveræn

gpt-oss-120bHurtigste EU-model
772tokens/sek

OpenAI's open source 120B parameter-model. Exceptionel throughput til højvolumen suveræne workloads.

EU-suveræn

Bæredygtig AI-infrastruktur

Op til 5x bedre energieffektivitet end GPU-baseret inference

Lavere strømforbrug

Typisk 10kW pr. rack mod GPU-racks, der forbruger 40-50kW+ for tilsvarende workloads. Dataflow-arkitektur kræver færre chips, hvilket giver dramatiske strømbesparelser.

Mindre footprint

Dramatisk reduceret fysisk plads, forenklet køling og lavere samlede infrastrukturomkostninger.

Luftkølet design

Ingen flydende køleinfrastruktur påkrævet. Standard luftkøling forenkler deployment, reducerer vedligeholdelseskompleksitet og sænker driftsomkostninger.

"Ikke alle tokens er skabt lige. Den reelle værdi ligger ikke i at måle genererede tokens, men i kvaliteten af intelligens leveret pr. enhed af energi forbrugt."

SambaNova - "Intelligence per Joule"

Avancerede modelkapabiliteter

Massiv modelunderstøttelse

Kør store modeller med hundredvis af milliarder parametre på et enkelt rack. Understøttelse af Composition of Experts (CoE) med 100+ ekspertmodeller hostet simultant.

100vis mia. param.CoE-support100+ modeller

Lange kontekstvinduer

Håndtér op til 192K token kontekstvinduer (MiniMax M2.7) og 128K på de fleste andre modeller. Massiv hukommelseskapacitet muliggør dokumentanalyse, kodegenerering og reasoning-opgaver.

Op til 192K tokensEnkelt nodeIngen trunkering

Millisekund-modelskift

Flere modeller resident i hukommelsen simultant med millisekund-skiftelatency - størrelsesordener hurtigere end GPU-systemer. Perfekt til agentic AI og multi-model workflows.

ms skiftMulti-modelAgentic AI

Europæisk infrastruktur

Hostet i et Tier III+-certificeret datacenter i München, Tyskland — 100% EU-jurisdiktion

Row of SambaNova racks powering Infercom's EU infrastructure

SambaNova rack-infrastruktur - luftkølet, 10kW pr. rack

German Flag

Hostet i München

Alle data og processing forbliver inden for tyske grænser under EU-jurisdiktion.

Ingen US-jurisdiktion

Beskyttelse mod CLOUD Act, PATRIOT Act og udenlandsk efterretningsadgang.

AI Act-klar

Infrastruktur forberedt til EU AI Act-krav og compliance.

Tier III+-certificeret

99,982% oppetidsgaranti med redundant strøm- og kølesystemer.

Klar til at bygge fremtidens AI i Europa?

Slut dig til fremsynede organisationer, der deployer suveræn AI med performance i verdensklasse