Hvordan top-p virker
Efter [[temperature]] omformer sandsynlighedsfordelingen, filtrerer top-p den. Tokens sorteres efter sandsynlighed; filteret bliver ved med at tilføje fra toppen indtil den kumulative sandsynlighed når p. Alt under den linje fjernes og de resterende sandsynligheder renormaliseres. Sampling trækker derefter fra det reducerede sæt.
For eksempel med top_p=0.9: hvis top-tokenet har 92% sandsynlighed, overlever kun det token - modellen er sikker og kernen er snæver. Hvis i stedet top-tokenet har 40%, det næste 30%, det næste 15% osv., bliver filteret ved med at tilføje tokens indtil det kumulative krydser 90%, hvilket giver en bredere pulje. Det er grunden til at top-p tilpasser sig sikkerhed hvor [[top-k]] ikke gør - samme tærskel producerer forskellige puljestørrelser afhængigt af hvor spredt fordelingen er.
Top-p vs. top-k
Top-k fikserer puljestørrelsen: behold præcis k tokens, uanset hvordan sandsynlighederne er fordelt. Top-p fikserer den kumulative sandsynlighedsmasse: behold så mange tokens der skal til for at dække p af totalen. Når modellen er sikker, kan top-k inkludere langt flere kandidater end nødvendigt; når modellen er usikker, kan den afskære for aggressivt. Top-p håndterer begge tilfælde med en enkelt parameter.
I praksis anbefaler mange model-udgivere at bruge begge: top-p som primært filter (0.9-0.95 er almindeligt) med top-k som et hårdt loft (40-100) til at fange edge cases hvor selv kernen er meget stor. Temperature, top-p og top-k sammen danner en tre-trins pipeline: omform fordelingen, trim efter kumulativ sandsynlighed, derefter begræns antallet.
Anbefalede værdier
På Infercoms EU-suveræne modeller er udgiver-anbefalede værdier: MiniMax-M2.7 top_p 0.95, gpt-oss-120b top_p 1.0 (ingen filtrering), gemma-4-31B-it top_p 0.95, DeepSeek-V3.2 top_p 0.95. En top_p på 1.0 betyder ingen filtrering i dette trin - den fulde fordeling passerer igennem. Lavere værdier strammer kernen; værdier under 0.5 er usædvanlige og kan overbegrænse outputtet. Se vores API-dokumentation for den fulde parameter-reference.
Kilder
Relaterede begreber
Temperature (Sampling)
Parameteren der styrer tilfældighed i token-valg - hvor 1.0 er baseline og 0 fremtvinger greedy decoding.
Top-K Sampling
En sampling-metode der begrænser valget til de k mest sandsynlige tokens - et hårdt loft på kandidat-puljen.
Greedy Decoding
Dekodningsstrategien der altid vælger det mest sandsynlige token - deterministisk, men tilbøjelig til gentagelsesloops.
Inference
At køre en trænet AI-model for at producere output - AI's produktionsworkload, og den hvor omkostning og hastighed forstærkes med brugen.
Lær hvordan SambaNova's dataflow-arkitektur ændrer økonomien i inference - og hvorfor vi byggede på den.