Glossario
Modelli & Inferenza

Temperature (Sampling)

Temperature è un parametro di sampling che controlla come un LLM seleziona il prossimo token dalla distribuzione di probabilità. A temperature 1.0, il modello usa le probabilità esattamente come addestrato. Valori più bassi acuiscono la distribuzione, facendo dominare i token ad alta probabilità; valori più alti la appiattiscono, dando più chance ai token a bassa probabilità. A temperature 0, il modello sceglie sempre il token più probabile - greedy decoding.

Cosa fa realmente temperature

Quando un LLM genera un token, prima produce un punteggio grezzo (logit) per ogni token nel suo vocabolario, poi converte questi punteggi in probabilità tramite la funzione softmax. Temperature viene applicata dentro questa conversione: ogni logit viene diviso per T prima del softmax. Questo riscala la distribuzione di probabilità - T minore di 1 acuisce i picchi, T maggiore di 1 appiattisce la distribuzione.

Un malinteso comune: temperature 1.0 non è 'massima casualità'. È la baseline - la distribuzione su cui il modello è stato addestrato. Pensala come il contrasto di una foto: T=1 è l'originale; qualsiasi altra cosa è un aggiustamento. I publisher di modelli raccomandano tipicamente T=1.0 per i loro modelli, abbinato a [[top-p]] e [[top-k]] per tagliare la coda lunga dei token improbabili.

Perché T=0 è rischioso per i modelli di reasoning

A temperature 0, non c'è sampling - il modello sceglie deterministicamente il token più probabile ogni volta. Sembra consistenza, ma introduce una modalità di errore: se il modello entra in un pattern auto-rinforzante, non può uscirne. Il sampling fornisce una via d'uscita; il greedy decoding no. Abbiamo osservato modelli di reasoning a T=0 entrare in cicli infiniti di sinonimi - risolvendo correttamente il problema, poi ciclando attraverso conclusioni riformulate fino a raggiungere il limite di token.

Ecco perché la nostra documentazione avverte: imposta sempre temperature esplicitamente, e usa il valore raccomandato dal publisher del modello. Omettendolo, la maggior parte dei modelli va in default al greedy decoding (T=0), rischiando loop non terminanti sui workload di reasoning. L'API Infercom non ha un default a livello di piattaforma proprio per rendere visibile questa scelta.

Guida pratica

Per i modelli EU-sovrani su Infercom, usa i valori raccomandati dal publisher: MiniMax-M2.7 specifica temperature 1.0, top_p 0.95, top_k 40; gpt-oss-120b specifica temperature 1.0, top_p 1.0. Se vuoi output più focalizzato, abbassa temperature a 0.3-0.7 piuttosto che a zero - restringi la varianza senza innescare le modalità di errore del greedy decoding. E ricorda: anche a T=0, output byte-identici non sono garantiti attraverso l'inferenza distribuita - la varianza floating-point nel calcolo parallelo può ribaltare decisioni ravvicinate.

Fonti

Termini correlati

Scopri come l'architettura dataflow di SambaNova cambia l'economia dell'inferenza - e perché abbiamo costruito su di essa.

Pronto a Costruire il Futuro dell'AI in Europa?

Unisciti alle organizzazioni lungimiranti che implementano AI sovrana con prestazioni di livello mondiale