Come funziona greedy decoding
A ogni passo di generazione, il modello produce una distribuzione di probabilità sul suo vocabolario. Nel greedy decoding, il token con la più alta probabilità viene selezionato incondizionatamente - nessun sampling, nessuna casualità. Il passo successivo poi condiziona su quel token, produce una nuova distribuzione, e di nuovo prende il massimo. Questo continua finché il modello emette un token di stop o raggiunge il limite di output.
Innescate greedy decoding impostando [[temperature]] a 0, che fa collassare la distribuzione a un picco sul token top, o impostando [[top-k]] a 1, che filtra a un singolo candidato. Entrambi hanno lo stesso effetto: il generatore di numeri casuali non viene mai consultato, e lo stesso input produce sempre lo stesso output - assumendo condizioni numeriche identiche sull'hardware.
Il problema del loop di ripetizione
Il determinismo del greedy decoding è il suo fascino e la sua modalità di errore. Perché il modello prende sempre il percorso più probabile, può rimanere bloccato. Se una sequenza di token porta in un pattern dove ripetere o riformulare è la continuazione più probabile, greedy decoding segue quel percorso per sempre. Il sampling occasionalmente sceglierebbe un token meno probabile e uscirebbe; greedy decoding non può.
Abbiamo osservato questo direttamente sui modelli di reasoning: a temperature 0, un modello ha risolto un puzzle logico correttamente, poi è entrato in un ciclo infinito di sinonimi - riformulando la sua conclusione in parole diverse finché non ha raggiunto il limite di token. Con le impostazioni raccomandate dal publisher (temperature 1.0 con [[top-p]] e top-k), gli stessi prompt sono stati completati normalmente. Il loop esiste come punto fisso nella distribuzione di probabilità del modello; il sampling può uscirne, greedy decoding no.
Quando usarlo - e quando no
Greedy decoding è appropriato per task dove la consistenza conta più della diversità e l'output è breve o altamente vincolato - etichette di classificazione, estrazione strutturata, o output JSON via constrained decoding. Per generazione aperta, reasoning, o qualsiasi task dove il modello potrebbe entrare in un pattern auto-rinforzante, usa invece i parametri di sampling raccomandati dal publisher. Su Infercom, se ometti temperature, la maggior parte dei modelli va in default al greedy decoding - ecco perché la nostra documentazione avverte di impostarlo sempre esplicitamente.
Fonti
Termini correlati
Temperature (Sampling)
Il parametro che controlla la casualità nella selezione dei token - dove 1.0 è la baseline e 0 forza il greedy decoding.
Top-P (Nucleus Sampling)
Un metodo di sampling che mantiene solo abbastanza token ad alta probabilità per coprire una probabilità cumulativa p - adattando il pool di candidati alla confidenza del modello.
Top-K Sampling
Un metodo di sampling che limita la selezione ai k token più probabili - un tetto rigido sul pool di candidati.
Inferenza
Eseguire un modello AI addestrato per produrre output - il carico di lavoro di produzione dell'AI, quello i cui costi e velocità si accumulano con l'utilizzo.
Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza - e perché abbiamo costruito su di essa.