Glossario
Modelli & Inferenza

Top-P (Nucleus Sampling)

Top-p, chiamato anche nucleus sampling, è un metodo di selezione token che limita dinamicamente il pool di candidati basandosi sulla probabilità cumulativa. Dopo che il modello calcola le probabilità per tutti i token, top-p mantiene solo il set più piccolo le cui probabilità sommano almeno a p, poi campiona da quel set. Questo taglia la coda lunga dei token improbabili adattandosi alla confidenza del modello - un nucleo stretto quando il modello è sicuro, uno più ampio quando non lo è.

Come funziona top-p

Dopo che [[temperature]] rimodella la distribuzione di probabilità, top-p la filtra. I token vengono ordinati per probabilità; il filtro continua ad aggiungere dall'alto finché la probabilità cumulativa raggiunge p. Tutto sotto quella linea viene rimosso e le probabilità rimanenti vengono rinormalizzate. Il sampling poi estrae dal set ridotto.

Per esempio, con top_p=0.9: se il token top ha il 92% di probabilità, solo quel token sopravvive - il modello è sicuro e il nucleo è stretto. Se invece il token top ha il 40%, il successivo il 30%, il successivo il 15% e così via, il filtro continua ad aggiungere token finché il cumulativo supera il 90%, producendo un pool più ampio. Ecco perché top-p si adatta alla confidenza mentre [[top-k]] no - la stessa soglia produce diverse dimensioni del pool a seconda di quanto è distribuita la distribuzione.

Top-p vs. top-k

Top-k fissa la dimensione del pool: mantieni esattamente k token, indipendentemente da come sono distribuite le probabilità. Top-p fissa la massa di probabilità cumulativa: mantieni quanti token servono per coprire p del totale. Quando il modello è sicuro, top-k può includere molti più candidati del necessario; quando il modello è incerto, può tagliare troppo aggressivamente. Top-p gestisce entrambi i casi con un singolo parametro.

In pratica, molti publisher di modelli raccomandano di usare entrambi: top-p come filtro primario (0.9-0.95 è comune) con top-k come tetto rigido (40-100) per catturare i casi limite dove anche il nucleo è molto grande. Temperature, top-p e top-k insieme formano una pipeline a tre stadi: rimodella la distribuzione, taglia per probabilità cumulativa, poi limita il conteggio.

Valori raccomandati

Sui modelli EU-sovrani di Infercom, i valori raccomandati dal publisher sono: MiniMax-M2.7 top_p 0.95, gpt-oss-120b top_p 1.0 (nessun filtraggio), gemma-4-31B-it top_p 0.95, DeepSeek-V3.2 top_p 0.95. Un top_p di 1.0 significa nessun filtraggio in questo stadio - la distribuzione completa passa attraverso. Valori più bassi restringono il nucleo; valori sotto 0.5 sono insoliti e possono sovra-vincolare l'output. Vedi la nostra documentazione API per il riferimento completo dei parametri.

Fonti

Termini correlati

Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza - e perché abbiamo costruito su di essa.

Pronto a Costruire il Futuro dell'AI in Europa?

Unisciti alle organizzazioni lungimiranti che implementano AI sovrana con prestazioni di livello mondiale