Ordliste om EU-suveræn AI-inferens
Klare definitioner med kilder inden for EU-suveræn AI-inferens: fra dataresidency, GDPR og zero data retention til TTFT, throughput og dataflow-arkitektur. Hver forklaring bygger på offentliggjorte kilder og reelle benchmarkdata fra vores EU-infrastruktur.
Suverænitet og compliance
Data Residency
Hvor dine data fysisk lagres og behandles. Det er en nødvendig del af suverænitet, men ikke det samme som kontrol over, hvem der juridisk kan få adgang til dem.
Data Processing Agreement (DPA)
Databehandleraftalen efter GDPR artikel 28 (på engelsk Data Processing Agreement, DPA) regulerer, hvordan en inferensudbyder må behandle persondataene i dine prompts. Den viser hurtigt, om en udbyder er klar til virksomhedsbrug.
GDPR for AI-inferens
Hvad EU's databeskyttelsesregler kræver, når dine prompts indeholder persondata: et lovligt grundlag, en databehandleraftale og behandling, der forbliver inden for EU-rettens rækkevidde.
Zero Data Retention (ZDR)
En inferensudbyder gemmer ikke dine prompts eller outputs efter behandlingen og træner aldrig på dem. Dine data findes dermed kun i systemet, mens de behandles.
Ydeevnemålinger
TTFT (Time to First Token)
Hvor længe en bruger venter, fra en forespørgsel sendes, til det første token i svaret dukker op.
Inter-Token Latency (ITL)
Den gennemsnitlige tid mellem to tokens i træk under genereringen, også kaldet TPOT.
Tokens per sekund
Standardenheden for genereringshastighed i LLM'er, og hvorfor det samme tal kan betyde to forskellige ting.
Inference-hastighed
Overbegrebet for TTFT, inter-token latency og throughput, og hvilken metrik der tæller hvornår.
Arkitektur
RDU (Reconfigurable Dataflow Unit)
SambaNovas AI-processor: en chip bygget specifikt til AI, som afvikler modeller som et dataflow i stedet for instruktion for instruktion.
Dataflow-arkitektur
Afviklingsmodellen, hvor data strømmer gennem operationerne som en pipeline. Den fjerner de omveje via hukommelsen, som en GPU tager mellem hver kernel.
Modeller og inferens
Inference
Kørsel af en trænet AI-model for at skabe output. Inferens er AI i produktion: Omkostninger og ventetid kommer igen, hver gang modellen bruges.
Throughput (LLM-serving)
Tokens per sekund i to betydninger: output-throughput per forespørgsel og kapaciteten i hele systemet. Batching øger det ene på bekostning af det andet.
Prefill vs. Decode
LLM-inferensens to faser: parallel behandling af prompten og generering ét token ad gangen.
Latency vs. Throughput
Den grundlæggende afvejning i serving: systemets samlede output mod hver enkelt brugers hastighed.
Open-weight-model
En model, hvis trænede parametre er offentliggjort, så alle selv kan køre den. Det er det tekniske fundament for suveræn inferens.
Context Window
Den maksimale mængde tekst i tokens, som en model kan tage i betragtning på én gang, prompt og output tilsammen. Længden påvirker direkte hastigheden og omkostningen ved inferens.
Parametre
En models lærte vægte: et groft mål for dens størrelse og kapacitet og den direkte årsag til dens hukommelsesforbrug, hastighed og omkostning.
Temperature (Sampling)
Den parameter, der styrer tilfældigheden, når næste token vælges. 1.0 er baseline, og 0 tvinger greedy decoding.
Top-P (Nucleus Sampling)
En sampling-metode, der kun beholder så mange sandsynlige tokens, at de tilsammen dækker sandsynligheden p. Kandidat-puljen tilpasser sig dermed modellens sikkerhed.
Top-K Sampling
En sampling-metode, der begrænser valget til de k mest sandsynlige tokens: et hårdt loft over kandidat-puljen.
Greedy Decoding
Decoding-strategien, der altid vælger det mest sandsynlige token: deterministisk, men udsat for gentagelsesloops.