Come funziona top-p
Dopo che [[temperature]] rimodella la distribuzione di probabilità, top-p la filtra. I token vengono ordinati per probabilità; il filtro continua ad aggiungere dall'alto finché la probabilità cumulativa raggiunge p. Tutto sotto quella linea viene rimosso e le probabilità rimanenti vengono rinormalizzate. Il sampling poi estrae dal set ridotto.
Per esempio, con top_p=0.9: se il token top ha il 92% di probabilità, solo quel token sopravvive - il modello è sicuro e il nucleo è stretto. Se invece il token top ha il 40%, il successivo il 30%, il successivo il 15% e così via, il filtro continua ad aggiungere token finché il cumulativo supera il 90%, producendo un pool più ampio. Ecco perché top-p si adatta alla confidenza mentre [[top-k]] no - la stessa soglia produce diverse dimensioni del pool a seconda di quanto è distribuita la distribuzione.
Top-p vs. top-k
Top-k fissa la dimensione del pool: mantieni esattamente k token, indipendentemente da come sono distribuite le probabilità. Top-p fissa la massa di probabilità cumulativa: mantieni quanti token servono per coprire p del totale. Quando il modello è sicuro, top-k può includere molti più candidati del necessario; quando il modello è incerto, può tagliare troppo aggressivamente. Top-p gestisce entrambi i casi con un singolo parametro.
In pratica, molti publisher di modelli raccomandano di usare entrambi: top-p come filtro primario (0.9-0.95 è comune) con top-k come tetto rigido (40-100) per catturare i casi limite dove anche il nucleo è molto grande. Temperature, top-p e top-k insieme formano una pipeline a tre stadi: rimodella la distribuzione, taglia per probabilità cumulativa, poi limita il conteggio.
Valori raccomandati
Sui modelli EU-sovrani di Infercom, i valori raccomandati dal publisher sono: MiniMax-M2.7 top_p 0.95, gpt-oss-120b top_p 1.0 (nessun filtraggio), gemma-4-31B-it top_p 0.95, DeepSeek-V3.2 top_p 0.95. Un top_p di 1.0 significa nessun filtraggio in questo stadio - la distribuzione completa passa attraverso. Valori più bassi restringono il nucleo; valori sotto 0.5 sono insoliti e possono sovra-vincolare l'output. Vedi la nostra documentazione API per il riferimento completo dei parametri.
Fonti
Termini correlati
Temperature (Sampling)
Il parametro che controlla la casualità nella selezione dei token - dove 1.0 è la baseline e 0 forza il greedy decoding.
Top-K Sampling
Un metodo di sampling che limita la selezione ai k token più probabili - un tetto rigido sul pool di candidati.
Greedy Decoding
La strategia di decodifica che sceglie sempre il token più probabile - deterministica, ma incline ai loop di ripetizione.
Inferenza
Eseguire un modello AI addestrato per produrre output - il carico di lavoro di produzione dell'AI, quello i cui costi e velocità si accumulano con l'utilizzo.
Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza - e perché abbiamo costruito su di essa.