Ordliste
Modeller & Inference

Greedy Decoding

Greedy decoding er token-valgstrategien hvor modellen altid vælger det enkelte mest sandsynlige token ved hvert trin, uden tilfældighed. Det svarer til at sætte temperature til 0 eller top_k til 1. Outputtet er deterministisk givet identiske inputs - men den determinisme kommer med en risiko: hvis modellen kommer ind i et selvforstærkende mønster, kan den ikke undslippe.

Hvordan greedy decoding virker

Ved hvert genereringstrin producerer modellen en sandsynlighedsfordeling over sit vokabular. I greedy decoding vælges tokenet med højest sandsynlighed ubetinget - ingen sampling, ingen tilfældighed. Næste trin konditionerer derefter på det token, producerer en ny fordeling og tager igen maximum. Dette fortsætter indtil modellen udsender et stop-token eller rammer output-grænsen.

Du udløser greedy decoding ved at sætte [[temperature]] til 0, hvilket kollapser fordelingen til en spids på top-tokenet, eller ved at sætte [[top-k]] til 1, hvilket filtrerer til en enkelt kandidat. Begge har samme effekt: tilfældighedsgeneratoren konsulteres aldrig, og samme input producerer altid samme output - forudsat identiske numeriske forhold på hardwaren.

Gentagelsesloop-problemet

Greedy decodings determinisme er dens appel og dens fejlmode. Fordi modellen altid tager den mest sandsynlige sti, kan den sidde fast. Hvis en sekvens af tokens fører ind i et mønster hvor gentagelse eller omformulering er den mest sandsynlige fortsættelse, følger greedy decoding den sti for evigt. Sampling ville lejlighedsvis vælge et mindre sandsynligt token og bryde ud; greedy decoding kan ikke.

Vi har observeret dette direkte på reasoning-modeller: ved temperature 0 løste en model et logikpuslespil korrekt, for derefter at gå ind i en uendelig synonym-cyklus - den omformulerede sin konklusion i forskellige ord indtil den ramte token-grænsen. Ved udgiverens anbefalede indstillinger (temperature 1.0 med [[top-p]] og top-k) fuldførte de samme prompts normalt. Loopet eksisterer som et fixpunkt i modellens sandsynlighedsfordeling; sampling kan undslippe det, greedy decoding kan ikke.

Hvornår man bruger det - og hvornår ikke

Greedy decoding er passende til opgaver hvor konsistens er vigtigere end diversitet og outputtet er kort eller stærkt begrænset - klassifikationslabels, struktureret ekstraktion eller JSON-output via constrained decoding. Til åben generering, reasoning eller enhver opgave hvor modellen kan komme ind i et selvforstærkende mønster, brug i stedet udgiverens anbefalede sampling-parametre. På Infercom defaulter de fleste modeller til greedy decoding hvis du udelader temperature - det er grunden til at vores dokumentation advarer om altid at sætte den eksplicit.

Kilder

Relaterede begreber

Lær hvordan SambaNova's dataflow-arkitektur ændrer økonomien i inference - og hvorfor vi byggede på den.

Klar til at bygge fremtidens AI i Europa?

Slut dig til fremsynede organisationer, der deployer suveræn AI med performance i verdensklasse