Hvordan top-k virker
Efter [[temperature]] justerer sandsynlighedsfordelingen, filtrerer top-k efter rang. De k tokens med højest sandsynlighed beholdes; resten sættes til nul. De overlevende sandsynligheder renormaliseres til at summere til 1, og sampling trækker fra dette sæt. k sættes typisk mellem 10 og 100 afhængigt af model og use case.
I det ekstreme betyder top_k=1 at kun det enkelte mest sandsynlige token overlever - hvilket funktionelt er det samme som greedy decoding. I den anden ekstrem betyder top_k sat til den fulde vokabularstørrelse ingen filtrering overhovedet. Imellem dem fungerer top-k som et hårdt loft for hvor langt ind i sandsynlighedshalen modellen kan række.
Hvorfor top-k ofte parres med top-p
Top-ks faste puljestørrelse er både dens styrke og svaghed. Den garanterer at modellen ikke kan sample fra ekstremt usandsynlige tokens, hvilket forhindrer nogle former for inkohærent output. Men den tilpasser sig ikke: når modellen er meget sikker (ét token ved 95%), beholder k=50 stadig 50 kandidater selvom 49 af dem er støj. Når modellen er usikker (mange tokens ved lignende sandsynligheder), kan det samme k afskære optioner der faktisk var plausible.
[[Top-p]] adresserer dette ved at tilpasse puljestørrelsen til fordelingens form. I praksis anbefaler model-udgivere ofte at bruge begge: top-p som adaptivt filter (behold tokens der summer til 95% sandsynlighed) og top-k som sikkerhedsloft (aldrig mere end 40-100 kandidater). De to filtre anvendes i sekvens efter temperature, hvilket giver en pipeline af: omform, trim efter masse, begræns efter antal.
Anbefalede værdier
På Infercoms EU-suveræne modeller er udgiver-anbefalede top-k-værdier: MiniMax-M2.7 top_k 40, gemma-4-31B-it top_k 64. gpt-oss-120b og DeepSeek-V3.2 specificerer ikke top-k og stoler på temperature og top-p alene. Infercom API accepterer top_k fra 1 til 100. Er du usikker, start med udgiverens anbefaling eller udelad den og lad top-p gøre filtreringen.
Kilder
Relaterede begreber
Temperature (Sampling)
Parameteren der styrer tilfældighed i token-valg - hvor 1.0 er baseline og 0 fremtvinger greedy decoding.
Top-P (Nucleus Sampling)
En sampling-metode der kun beholder nok højsandsynlige tokens til at dække en kumulativ sandsynlighed p - kandidat-puljen tilpasser sig modellens sikkerhed.
Greedy Decoding
Dekodningsstrategien der altid vælger det mest sandsynlige token - deterministisk, men tilbøjelig til gentagelsesloops.
Inference
At køre en trænet AI-model for at producere output - AI's produktionsworkload, og den hvor omkostning og hastighed forstærkes med brugen.
Lær hvordan SambaNova's dataflow-arkitektur ændrer økonomien i inference - og hvorfor vi byggede på den.