Ordliste for EU-suveræn AI-inference
Klare, kildebelagte definitioner på tværs af EU-suveræn AI-inference - fra Data Residency, GDPR og Zero Data Retention til TTFT, throughput og dataflow-arkitektur. Hver post er understøttet af publicerede kilder og reelle benchmark-data fra vores EU-infrastruktur.
Suverænitet & Compliance
Data Residency
Hvor dine data fysisk lagres og behandles - en nødvendig del af suverænitet, men ikke det samme som kontrol over, hvem der lovligt kan få adgang til dem.
Data Processing Agreement (DPA)
GDPR-artikel-28-kontrakten, der regulerer, hvordan en inference-udbyder må behandle persondataene i dine prompts - og en grundlæggende test af, om en udbyder er enterprise-klar.
GDPR for AI-inference
Hvad Europas databeskyttelseslov kræver, når dine prompts indeholder persondata - en lovlig hjemmel, en processor-aftale og behandling, der forbliver inden for EU-rettens rækkevidde.
Zero Data Retention (ZDR)
Når en inference-udbyder ikke gemmer dine prompts eller outputs efter at have betjent en forespørgsel og aldrig træner på dem - din dataeksponering skrumper til selve behandlingsøjeblikket.
Performance-metrikker
TTFT (Time to First Token)
Hvor længe en bruger venter mellem at sende en forespørgsel og se den første token af svaret.
Inter-Token Latency (ITL)
Det gennemsnitlige tidsinterval mellem på hinanden følgende tokens under generering - også kaldet TPOT.
Tokens per sekund
Standardenheden for LLM-genereringshastighed - og hvorfor det samme tal kan betyde to forskellige ting.
Inference-hastighed
Paraplybegrebet: TTFT, inter-token latency og throughput - og hvilken der betyder noget hvornår.
Arkitektur
RDU (Reconfigurable Dataflow Unit)
SambaNova's AI-processor - specialbyggede AI-chips designet til dataflow-eksekvering i stedet for instruktion-for-instruktion-behandling.
Dataflow-arkitektur
Eksekveringsmodellen hvor data streames gennem operationer som en pipeline - og eliminerer GPU-eksekveringens kernel-for-kernel-rundture.
Modeller & Inference
Inference
At køre en trænet AI-model for at producere output - AI's produktionsworkload, og den hvor omkostning og hastighed forstærkes med brugen.
Throughput (LLM-serving)
Tokens per sekund i to betydninger: per-request output throughput vs. systemdækkende kapacitet - og hvordan batching bytter det ene for det andet.
Prefill vs. Decode
LLM-inferencens to faser - parallel prompt-behandling vs. token-for-token-generering.
Latency vs. Throughput
Det fundamentale serving-trade-off: samlet systemoutput vs. hver brugers hastighed.
Open-Weight-model
En model, hvis trænede parametre er offentliggjort, så enhver selv kan køre den - det tekniske fundament for suveræn inference.
Context Window
Den maksimale mængde tekst, i tokens, en model kan overveje på én gang - prompt plus output. Længden former direkte inference-hastighed og -omkostning.
Parametre
En models lærte vægte - det grove mål for dens størrelse og kapacitet og den direkte drivkraft bag dens hukommelse, hastighed og omkostning.