SambaNova-fordelen
GPU'er blev ikke bygget til AI. De blev designet til videospilgrafik, og arkitekturen viser det. SambaNova valgte en anden vej og designede chips, der er specialbygget til AI-inference fra bunden. Uafhængige benchmarks viser op til 10x hurtigere inference – den hurtigste tilgængelige LLM-inference-teknologi. Sådan fungerer det.
GPU'er bruger det meste af deres tid på at vente
Når en GPU genererer AI-svar, følger den en gentagen cyklus: hent data fra hukommelsen, beregn, skriv tilbage til hukommelsen, gentag. Turen til hukommelsen tager langt længere end selve beregningen. GPU'er bruger det meste af deres tid på at vente på data, ikke på at behandle dem.
Ingeniører kalder dette "memory-bound". Processoren venter, mens data flyttes frem og tilbage. For AI-inference, hvor hver token kræver denne hent-beregn-skriv-cyklus, hober forsinkelserne sig op. Et svar på 1.000 tokens betyder 1.000 hukommelsesture.
GPU-producenter har forsøgt hurtigere hukommelse og større caches. Kerneproblemet forbliver: data bliver ved med at hoppe mellem processor og hukommelse.
Dataflow streamer data gennem chippen i stedet for at flytte det
SambaNovass Reconfigurable Dataflow Units (RDU'er) fungerer anderledes. I stedet for at hente og gemme data gentagne gange, fordeler de operationer rumligt over chippen og streamer data kontinuerligt igennem. Data bevæger sig i én retning gennem beregningen, som dele på et samlebånd, i stedet for at blive læsset og aflæsset ved hvert trin.
Hele AI-modellen forbliver resident i hukommelsen. Data flyder gennem operationer uden mellemliggende writes. Operationer, der ville kræve separate trin på en GPU, bliver fusioneret sammen. SambaNova kalder dette "execution streaming kontinuerligt over processoren". Det er det modsatte af kernel-for-kernel GPU-eksekvering.
Mindre ventetid. Mere throughput.
Et tre-lags hukommelsessystem lader ét rack køre 600B+ parameter-modeller
SambaNova bruger et tre-lags hukommelseshierarki, der balancerer hastighed og kapacitet. På det hurtigste niveau sidder 520 megabytes SRAM direkte på hver chip, der håndterer de hotteste data og muliggør operationsfusion uden hukommelsesture. Nedenunder holder 64 gigabytes high-bandwidth memory (HBM) modelvægte og aktive data. I modsætning til traditionelle caches er dette lag softwarestyret – systemet bestemmer præcis, hvad der ligger her, i stedet for at stole på automatiske eviction-politikker.
Det tredje lag giver op til 1,5 terabytes DDR-hukommelse pr. chip til prompt-caching og hosting af flere modeller samtidigt. Hver chip kan adressere hukommelse på tværs af alle chips i racket, hvilket skaber en massiv delt hukommelsespulje som et fladt adresserum.
Et enkelt rack kan køre modeller med hundredvis af milliarder parametre. Konkurrenter med rene SRAM-arkitekturer har brug for tusindvis af chips for at opnå samme kapabilitet. Tre-lags-tilgangen bytter en smule topfart for bedre kapacitet og fleksibilitet.
Op til 10x hurtigere end GPU-inference, 5x bedre energieffektivitet
Uafhængige benchmarks fra Artificial Analysis bekræfter performanceforskellen: SambaNovas dataflow-arkitektur leverer op til 10x hurtigere inference end GPU-alternativer, med op til 5x bedre energieffektivitet. Et enkelt rack forbruger omkring 10 til 15 kilowatt mod 40 til 50 kilowatt eller mere for ækvivalent GPU-infrastruktur. Det kører på standard luftkøling uden eksotiske væskekølingssystemer eller specialbyggede datacentre.
For realtidsapplikationer viser dette sig i brugeroplevelsen. En AI-assistent, der svarer på 200 millisekunder i stedet for 2 sekunder, er et andet produkt. Du bruger det konstant i stedet for at vente på det. Hurtigere tokens betyder også flere reasoning-trin inden for samme tidsbudget, hvilket er vigtigt for agentiske workflows og komplekse flertrins-opgaver.
SambaNova-teknologi i Europa: Infercom er den første og eneste offentlige udbyder
Al denne performance er tilgængelig gennem SambaNovas cloud. Men den cloud kører i USA. For europæiske virksomheder med GDPR-compliance-krav, datasuverænitetsmandater eller en præference for at holde følsomme data inden for EU-jurisdiktion skaber det en barriere.
Infercom bringer SambaNova til Europa. Vi driver den første og eneste offentlige SambaNova-cloud i EU, hostet i München, Tyskland. Latency fra Frankfurt er under 10 millisekunder. Med hastigheder over 400 tokens pr. sekund på modeller som MiniMax M2.7 Ultraspeeder det den hurtigste LLM-API i Europa – med komplet EU-datasuverænitet. Dine prompts og svar forlader aldrig europæisk jord. Ingen CLOUD Act-eksponering. Ingen tredjelands-dataoverførsler. Fuldt GDPR-kompatibel.
Hvis du bygger AI-applikationer, der har brug for både hastighed og suverænitet, er dette infrastrukturen.
Vil du gå dybere?
Yderligere læsning: Tekniske papers & benchmarks

