Ordliste
Modeller & Inference

Temperature (Sampling)

Temperature er en sampling-parameter der styrer hvordan en LLM vælger sit næste token fra sandsynlighedsfordelingen. Ved temperature 1.0 bruger modellen sandsynligheder præcis som trænet. Lavere værdier skærper fordelingen så højsandsynlige tokens dominerer; højere værdier fladgør den og giver lavsandsynlige tokens bedre chancer. Ved temperature 0 vælger modellen altid det mest sandsynlige token - greedy decoding.

Hvad temperature faktisk gør

Når en LLM genererer et token, producerer den først en rå score (logit) for hvert token i sit vokabular, derefter konverterer den disse scores til sandsynligheder via softmax-funktionen. Temperature anvendes inde i denne konvertering: hvert logit divideres med T før softmax. Det reskalerer sandsynlighedsfordelingen - T mindre end 1 skærper toppene, T større end 1 fladgør fordelingen.

En almindelig misforståelse: temperature 1.0 er ikke 'maksimal tilfældighed'. Det er baseline - fordelingen modellen blev trænet på. Tænk på det som kontrast på et foto: T=1 er originalen; alt andet er en justering. Model-udgivere anbefaler typisk T=1.0 for deres modeller, parret med [[top-p]] og [[top-k]] til at afskære den lange hale af usandsynlige tokens.

Hvorfor T=0 er risikabelt for reasoning-modeller

Ved temperature 0 er der ingen sampling - modellen vælger deterministisk det mest sandsynlige token hver gang. Det lyder som konsistens, men det introducerer en fejlmode: hvis modellen kommer ind i et selvforstærkende mønster, kan den ikke undslippe. Sampling giver en udvej; greedy decoding gør ikke. Vi har observeret reasoning-modeller ved T=0 komme ind i uendelige synonym-cyklusser - de løste problemet korrekt, for derefter at cykle gennem omformulerede konklusioner indtil de ramte token-grænsen.

Det er derfor vores dokumentation advarer: sæt altid temperature eksplicit, og brug den værdi model-udgiveren anbefaler. Udelader du den, defaulter de fleste modeller til greedy decoding (T=0), hvilket risikerer ikke-terminerende loops på reasoning-workloads. Infercom API har ingen platform-bred default netop for at gøre dette valg synligt.

Praktisk vejledning

For EU-suveræne modeller på Infercom, brug udgiverens anbefalede værdier: MiniMax-M2.7 specificerer temperature 1.0, top_p 0.95, top_k 40; gpt-oss-120b specificerer temperature 1.0, top_p 1.0. Vil du have mere fokuseret output, sænk temperature til 0.3-0.7 snarere end nul - du indsnævrer variansen uden at udløse greedy decodings fejlmodes. Og husk: selv ved T=0 er byte-identiske outputs ikke garanteret på tværs af distribueret inferens - floating-point-varians i parallel beregning kan flippe tætte afgørelser.

Kilder

Relaterede begreber

Lær hvordan SambaNova's dataflow-arkitektur ændrer økonomien i inference - og hvorfor vi byggede på den.

Klar til at bygge fremtidens AI i Europa?

Slut dig til fremsynede organisationer, der deployer suveræn AI med performance i verdensklasse