Ordliste
Modeller & Inference

Top-P (Nucleus Sampling)

Top-p, også kaldet nucleus sampling, er en token-valgmetode der dynamisk begrænser kandidat-puljen baseret på kumulativ sandsynlighed. Efter modellen beregner sandsynligheder for alle tokens, beholder top-p kun det mindste sæt hvis sandsynligheder summer til mindst p, derefter samples fra det sæt. Det afskærer den lange hale af usandsynlige tokens mens det tilpasser sig modellens sikkerhed - en snæver kerne når modellen er sikker, en bredere når den ikke er.

Hvordan top-p virker

Efter [[temperature]] omformer sandsynlighedsfordelingen, filtrerer top-p den. Tokens sorteres efter sandsynlighed; filteret bliver ved med at tilføje fra toppen indtil den kumulative sandsynlighed når p. Alt under den linje fjernes og de resterende sandsynligheder renormaliseres. Sampling trækker derefter fra det reducerede sæt.

For eksempel med top_p=0.9: hvis top-tokenet har 92% sandsynlighed, overlever kun det token - modellen er sikker og kernen er snæver. Hvis i stedet top-tokenet har 40%, det næste 30%, det næste 15% osv., bliver filteret ved med at tilføje tokens indtil det kumulative krydser 90%, hvilket giver en bredere pulje. Det er grunden til at top-p tilpasser sig sikkerhed hvor [[top-k]] ikke gør - samme tærskel producerer forskellige puljestørrelser afhængigt af hvor spredt fordelingen er.

Top-p vs. top-k

Top-k fikserer puljestørrelsen: behold præcis k tokens, uanset hvordan sandsynlighederne er fordelt. Top-p fikserer den kumulative sandsynlighedsmasse: behold så mange tokens der skal til for at dække p af totalen. Når modellen er sikker, kan top-k inkludere langt flere kandidater end nødvendigt; når modellen er usikker, kan den afskære for aggressivt. Top-p håndterer begge tilfælde med en enkelt parameter.

I praksis anbefaler mange model-udgivere at bruge begge: top-p som primært filter (0.9-0.95 er almindeligt) med top-k som et hårdt loft (40-100) til at fange edge cases hvor selv kernen er meget stor. Temperature, top-p og top-k sammen danner en tre-trins pipeline: omform fordelingen, trim efter kumulativ sandsynlighed, derefter begræns antallet.

Anbefalede værdier

På Infercoms EU-suveræne modeller er udgiver-anbefalede værdier: MiniMax-M2.7 top_p 0.95, gpt-oss-120b top_p 1.0 (ingen filtrering), gemma-4-31B-it top_p 0.95, DeepSeek-V3.2 top_p 0.95. En top_p på 1.0 betyder ingen filtrering i dette trin - den fulde fordeling passerer igennem. Lavere værdier strammer kernen; værdier under 0.5 er usædvanlige og kan overbegrænse outputtet. Se vores API-dokumentation for den fulde parameter-reference.

Kilder

Relaterede begreber

Lær hvordan SambaNova's dataflow-arkitektur ændrer økonomien i inference - og hvorfor vi byggede på den.

Klar til at bygge fremtidens AI i Europa?

Slut dig til fremsynede organisationer, der deployer suveræn AI med performance i verdensklasse