Cosa fa realmente temperature
Quando un LLM genera un token, prima produce un punteggio grezzo (logit) per ogni token nel suo vocabolario, poi converte questi punteggi in probabilità tramite la funzione softmax. Temperature viene applicata dentro questa conversione: ogni logit viene diviso per T prima del softmax. Questo riscala la distribuzione di probabilità - T minore di 1 acuisce i picchi, T maggiore di 1 appiattisce la distribuzione.
Un malinteso comune: temperature 1.0 non è 'massima casualità'. È la baseline - la distribuzione su cui il modello è stato addestrato. Pensala come il contrasto di una foto: T=1 è l'originale; qualsiasi altra cosa è un aggiustamento. I publisher di modelli raccomandano tipicamente T=1.0 per i loro modelli, abbinato a [[top-p]] e [[top-k]] per tagliare la coda lunga dei token improbabili.
Perché T=0 è rischioso per i modelli di reasoning
A temperature 0, non c'è sampling - il modello sceglie deterministicamente il token più probabile ogni volta. Sembra consistenza, ma introduce una modalità di errore: se il modello entra in un pattern auto-rinforzante, non può uscirne. Il sampling fornisce una via d'uscita; il greedy decoding no. Abbiamo osservato modelli di reasoning a T=0 entrare in cicli infiniti di sinonimi - risolvendo correttamente il problema, poi ciclando attraverso conclusioni riformulate fino a raggiungere il limite di token.
Ecco perché la nostra documentazione avverte: imposta sempre temperature esplicitamente, e usa il valore raccomandato dal publisher del modello. Omettendolo, la maggior parte dei modelli va in default al greedy decoding (T=0), rischiando loop non terminanti sui workload di reasoning. L'API Infercom non ha un default a livello di piattaforma proprio per rendere visibile questa scelta.
Guida pratica
Per i modelli EU-sovrani su Infercom, usa i valori raccomandati dal publisher: MiniMax-M2.7 specifica temperature 1.0, top_p 0.95, top_k 40; gpt-oss-120b specifica temperature 1.0, top_p 1.0. Se vuoi output più focalizzato, abbassa temperature a 0.3-0.7 piuttosto che a zero - restringi la varianza senza innescare le modalità di errore del greedy decoding. E ricorda: anche a T=0, output byte-identici non sono garantiti attraverso l'inferenza distribuita - la varianza floating-point nel calcolo parallelo può ribaltare decisioni ravvicinate.
Fonti
Termini correlati
Top-P (Nucleus Sampling)
Un metodo di sampling che mantiene solo abbastanza token ad alta probabilità per coprire una probabilità cumulativa p - adattando il pool di candidati alla confidenza del modello.
Top-K Sampling
Un metodo di sampling che limita la selezione ai k token più probabili - un tetto rigido sul pool di candidati.
Greedy Decoding
La strategia di decodifica che sceglie sempre il token più probabile - deterministica, ma incline ai loop di ripetizione.
Inferenza
Eseguire un modello AI addestrato per produrre output - il carico di lavoro di produzione dell'AI, quello i cui costi e velocità si accumulano con l'utilizzo.
Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza - e perché abbiamo costruito su di essa.