Hvordan greedy decoding virker
Ved hvert genereringstrin producerer modellen en sandsynlighedsfordeling over sit vokabular. I greedy decoding vælges tokenet med højest sandsynlighed ubetinget - ingen sampling, ingen tilfældighed. Næste trin konditionerer derefter på det token, producerer en ny fordeling og tager igen maximum. Dette fortsætter indtil modellen udsender et stop-token eller rammer output-grænsen.
Du udløser greedy decoding ved at sætte [[temperature]] til 0, hvilket kollapser fordelingen til en spids på top-tokenet, eller ved at sætte [[top-k]] til 1, hvilket filtrerer til en enkelt kandidat. Begge har samme effekt: tilfældighedsgeneratoren konsulteres aldrig, og samme input producerer altid samme output - forudsat identiske numeriske forhold på hardwaren.
Gentagelsesloop-problemet
Greedy decodings determinisme er dens appel og dens fejlmode. Fordi modellen altid tager den mest sandsynlige sti, kan den sidde fast. Hvis en sekvens af tokens fører ind i et mønster hvor gentagelse eller omformulering er den mest sandsynlige fortsættelse, følger greedy decoding den sti for evigt. Sampling ville lejlighedsvis vælge et mindre sandsynligt token og bryde ud; greedy decoding kan ikke.
Vi har observeret dette direkte på reasoning-modeller: ved temperature 0 løste en model et logikpuslespil korrekt, for derefter at gå ind i en uendelig synonym-cyklus - den omformulerede sin konklusion i forskellige ord indtil den ramte token-grænsen. Ved udgiverens anbefalede indstillinger (temperature 1.0 med [[top-p]] og top-k) fuldførte de samme prompts normalt. Loopet eksisterer som et fixpunkt i modellens sandsynlighedsfordeling; sampling kan undslippe det, greedy decoding kan ikke.
Hvornår man bruger det - og hvornår ikke
Greedy decoding er passende til opgaver hvor konsistens er vigtigere end diversitet og outputtet er kort eller stærkt begrænset - klassifikationslabels, struktureret ekstraktion eller JSON-output via constrained decoding. Til åben generering, reasoning eller enhver opgave hvor modellen kan komme ind i et selvforstærkende mønster, brug i stedet udgiverens anbefalede sampling-parametre. På Infercom defaulter de fleste modeller til greedy decoding hvis du udelader temperature - det er grunden til at vores dokumentation advarer om altid at sætte den eksplicit.
Kilder
Relaterede begreber
Temperature (Sampling)
Parameteren der styrer tilfældighed i token-valg - hvor 1.0 er baseline og 0 fremtvinger greedy decoding.
Top-P (Nucleus Sampling)
En sampling-metode der kun beholder nok højsandsynlige tokens til at dække en kumulativ sandsynlighed p - kandidat-puljen tilpasser sig modellens sikkerhed.
Top-K Sampling
En sampling-metode der begrænser valget til de k mest sandsynlige tokens - et hårdt loft på kandidat-puljen.
Inference
At køre en trænet AI-model for at producere output - AI's produktionsworkload, og den hvor omkostning og hastighed forstærkes med brugen.
Lær hvordan SambaNova's dataflow-arkitektur ændrer økonomien i inference - og hvorfor vi byggede på den.