Come funziona top-k
Dopo che [[temperature]] aggiusta la distribuzione di probabilità, top-k filtra per rango. I k token con le probabilità più alte vengono mantenuti; il resto viene azzerato. Le probabilità sopravvissute vengono rinormalizzate per sommare a 1, e il sampling estrae da questo set. k è tipicamente impostato tra 10 e 100 a seconda del modello e del caso d'uso.
All'estremo, top_k=1 significa che sopravvive solo il singolo token più probabile - che è funzionalmente equivalente al greedy decoding. All'altro estremo, top_k impostato alla dimensione completa del vocabolario significa nessun filtraggio. Nel mezzo, top-k agisce come un tetto rigido su quanto lontano nella coda di probabilità il modello può arrivare.
Perché top-k è spesso abbinato a top-p
La dimensione fissa del pool di top-k è sia la sua forza che la sua debolezza. Garantisce che il modello non possa campionare da token estremamente improbabili, prevenendo alcune forme di output incoerente. Ma non si adatta: quando il modello è molto sicuro (un token al 95%), k=50 mantiene comunque 50 candidati anche se 49 di loro sono rumore. Quando il modello è incerto (molti token a probabilità simili), lo stesso k potrebbe tagliare opzioni che erano genuinamente plausibili.
[[Top-p]] affronta questo adattando la dimensione del pool alla forma della distribuzione. In pratica, i publisher di modelli spesso raccomandano di usare entrambi: top-p come filtro adattivo (mantieni token che sommano al 95% di probabilità) e top-k come tetto di sicurezza (mai più di 40-100 candidati). I due filtri si applicano in sequenza dopo temperature, dando una pipeline di: rimodella, taglia per massa, limita per conteggio.
Valori raccomandati
Sui modelli EU-sovrani di Infercom, i valori top-k raccomandati dal publisher sono: MiniMax-M2.7 top_k 40, gemma-4-31B-it top_k 64. gpt-oss-120b e DeepSeek-V3.2 non specificano un top-k, affidandosi solo a temperature e top-p. L'API Infercom accetta top_k da 1 a 100. Se non sei sicuro, inizia con la raccomandazione del publisher o omettilo e lascia che top-p faccia il filtraggio.
Fonti
Termini correlati
Temperature (Sampling)
Il parametro che controlla la casualità nella selezione dei token - dove 1.0 è la baseline e 0 forza il greedy decoding.
Top-P (Nucleus Sampling)
Un metodo di sampling che mantiene solo abbastanza token ad alta probabilità per coprire una probabilità cumulativa p - adattando il pool di candidati alla confidenza del modello.
Greedy Decoding
La strategia di decodifica che sceglie sempre il token più probabile - deterministica, ma incline ai loop di ripetizione.
Inferenza
Eseguire un modello AI addestrato per produrre output - il carico di lavoro di produzione dell'AI, quello i cui costi e velocità si accumulano con l'utilizzo.
Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza - e perché abbiamo costruito su di essa.