Glossario
Modelli & Inferenza

Top-K Sampling

Top-k sampling restringe la selezione token ai k token con la più alta probabilità. Dopo che il modello calcola le probabilità, tutto al di fuori dei top k viene scartato e le probabilità rimanenti vengono rinormalizzate. Il modello poi campiona da questo set ridotto. A differenza di top-p, la dimensione del pool è fissa indipendentemente da come sono distribuite le probabilità.

Come funziona top-k

Dopo che [[temperature]] aggiusta la distribuzione di probabilità, top-k filtra per rango. I k token con le probabilità più alte vengono mantenuti; il resto viene azzerato. Le probabilità sopravvissute vengono rinormalizzate per sommare a 1, e il sampling estrae da questo set. k è tipicamente impostato tra 10 e 100 a seconda del modello e del caso d'uso.

All'estremo, top_k=1 significa che sopravvive solo il singolo token più probabile - che è funzionalmente equivalente al greedy decoding. All'altro estremo, top_k impostato alla dimensione completa del vocabolario significa nessun filtraggio. Nel mezzo, top-k agisce come un tetto rigido su quanto lontano nella coda di probabilità il modello può arrivare.

Perché top-k è spesso abbinato a top-p

La dimensione fissa del pool di top-k è sia la sua forza che la sua debolezza. Garantisce che il modello non possa campionare da token estremamente improbabili, prevenendo alcune forme di output incoerente. Ma non si adatta: quando il modello è molto sicuro (un token al 95%), k=50 mantiene comunque 50 candidati anche se 49 di loro sono rumore. Quando il modello è incerto (molti token a probabilità simili), lo stesso k potrebbe tagliare opzioni che erano genuinamente plausibili.

[[Top-p]] affronta questo adattando la dimensione del pool alla forma della distribuzione. In pratica, i publisher di modelli spesso raccomandano di usare entrambi: top-p come filtro adattivo (mantieni token che sommano al 95% di probabilità) e top-k come tetto di sicurezza (mai più di 40-100 candidati). I due filtri si applicano in sequenza dopo temperature, dando una pipeline di: rimodella, taglia per massa, limita per conteggio.

Valori raccomandati

Sui modelli EU-sovrani di Infercom, i valori top-k raccomandati dal publisher sono: MiniMax-M2.7 top_k 40, gemma-4-31B-it top_k 64. gpt-oss-120b e DeepSeek-V3.2 non specificano un top-k, affidandosi solo a temperature e top-p. L'API Infercom accetta top_k da 1 a 100. Se non sei sicuro, inizia con la raccomandazione del publisher o omettilo e lascia che top-p faccia il filtraggio.

Fonti

Termini correlati

Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza - e perché abbiamo costruito su di essa.

Pronto a Costruire il Futuro dell'AI in Europa?

Unisciti alle organizzazioni lungimiranti che implementano AI sovrana con prestazioni di livello mondiale