Glossario
Modelli & Inferenza

Greedy Decoding

Greedy decoding è la strategia di selezione token dove il modello sceglie sempre il singolo token più probabile a ogni passo, senza casualità. È equivalente a impostare temperature a 0, o top_k a 1. L'output è deterministico dati input identici - ma quel determinismo porta un rischio: se il modello entra in un pattern auto-rinforzante, non può uscirne.

Come funziona greedy decoding

A ogni passo di generazione, il modello produce una distribuzione di probabilità sul suo vocabolario. Nel greedy decoding, il token con la più alta probabilità viene selezionato incondizionatamente - nessun sampling, nessuna casualità. Il passo successivo poi condiziona su quel token, produce una nuova distribuzione, e di nuovo prende il massimo. Questo continua finché il modello emette un token di stop o raggiunge il limite di output.

Innescate greedy decoding impostando [[temperature]] a 0, che fa collassare la distribuzione a un picco sul token top, o impostando [[top-k]] a 1, che filtra a un singolo candidato. Entrambi hanno lo stesso effetto: il generatore di numeri casuali non viene mai consultato, e lo stesso input produce sempre lo stesso output - assumendo condizioni numeriche identiche sull'hardware.

Il problema del loop di ripetizione

Il determinismo del greedy decoding è il suo fascino e la sua modalità di errore. Perché il modello prende sempre il percorso più probabile, può rimanere bloccato. Se una sequenza di token porta in un pattern dove ripetere o riformulare è la continuazione più probabile, greedy decoding segue quel percorso per sempre. Il sampling occasionalmente sceglierebbe un token meno probabile e uscirebbe; greedy decoding non può.

Abbiamo osservato questo direttamente sui modelli di reasoning: a temperature 0, un modello ha risolto un puzzle logico correttamente, poi è entrato in un ciclo infinito di sinonimi - riformulando la sua conclusione in parole diverse finché non ha raggiunto il limite di token. Con le impostazioni raccomandate dal publisher (temperature 1.0 con [[top-p]] e top-k), gli stessi prompt sono stati completati normalmente. Il loop esiste come punto fisso nella distribuzione di probabilità del modello; il sampling può uscirne, greedy decoding no.

Quando usarlo - e quando no

Greedy decoding è appropriato per task dove la consistenza conta più della diversità e l'output è breve o altamente vincolato - etichette di classificazione, estrazione strutturata, o output JSON via constrained decoding. Per generazione aperta, reasoning, o qualsiasi task dove il modello potrebbe entrare in un pattern auto-rinforzante, usa invece i parametri di sampling raccomandati dal publisher. Su Infercom, se ometti temperature, la maggior parte dei modelli va in default al greedy decoding - ecco perché la nostra documentazione avverte di impostarlo sempre esplicitamente.

Fonti

Termini correlati

Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza - e perché abbiamo costruito su di essa.

Pronto a Costruire il Futuro dell'AI in Europa?

Unisciti alle organizzazioni lungimiranti che implementano AI sovrana con prestazioni di livello mondiale