Ordliste
Modeller & Inference

Top-K Sampling

Top-k sampling begrænser token-valg til de k tokens med højest sandsynlighed. Efter modellen beregner sandsynligheder, fjernes alt uden for top k og de resterende sandsynligheder renormaliseres. Modellen sampler derefter fra dette reducerede sæt. I modsætning til top-p er puljestørrelsen fast uanset hvordan sandsynlighederne er fordelt.

Hvordan top-k virker

Efter [[temperature]] justerer sandsynlighedsfordelingen, filtrerer top-k efter rang. De k tokens med højest sandsynlighed beholdes; resten sættes til nul. De overlevende sandsynligheder renormaliseres til at summere til 1, og sampling trækker fra dette sæt. k sættes typisk mellem 10 og 100 afhængigt af model og use case.

I det ekstreme betyder top_k=1 at kun det enkelte mest sandsynlige token overlever - hvilket funktionelt er det samme som greedy decoding. I den anden ekstrem betyder top_k sat til den fulde vokabularstørrelse ingen filtrering overhovedet. Imellem dem fungerer top-k som et hårdt loft for hvor langt ind i sandsynlighedshalen modellen kan række.

Hvorfor top-k ofte parres med top-p

Top-ks faste puljestørrelse er både dens styrke og svaghed. Den garanterer at modellen ikke kan sample fra ekstremt usandsynlige tokens, hvilket forhindrer nogle former for inkohærent output. Men den tilpasser sig ikke: når modellen er meget sikker (ét token ved 95%), beholder k=50 stadig 50 kandidater selvom 49 af dem er støj. Når modellen er usikker (mange tokens ved lignende sandsynligheder), kan det samme k afskære optioner der faktisk var plausible.

[[Top-p]] adresserer dette ved at tilpasse puljestørrelsen til fordelingens form. I praksis anbefaler model-udgivere ofte at bruge begge: top-p som adaptivt filter (behold tokens der summer til 95% sandsynlighed) og top-k som sikkerhedsloft (aldrig mere end 40-100 kandidater). De to filtre anvendes i sekvens efter temperature, hvilket giver en pipeline af: omform, trim efter masse, begræns efter antal.

Anbefalede værdier

På Infercoms EU-suveræne modeller er udgiver-anbefalede top-k-værdier: MiniMax-M2.7 top_k 40, gemma-4-31B-it top_k 64. gpt-oss-120b og DeepSeek-V3.2 specificerer ikke top-k og stoler på temperature og top-p alene. Infercom API accepterer top_k fra 1 til 100. Er du usikker, start med udgiverens anbefaling eller udelad den og lad top-p gøre filtreringen.

Kilder

Relaterede begreber

Lær hvordan SambaNova's dataflow-arkitektur ændrer økonomien i inference - og hvorfor vi byggede på den.

Klar til at bygge fremtidens AI i Europa?

Slut dig til fremsynede organisationer, der deployer suveræn AI med performance i verdensklasse