Hvad temperature faktisk gør
Når en LLM genererer et token, producerer den først en rå score (logit) for hvert token i sit vokabular, derefter konverterer den disse scores til sandsynligheder via softmax-funktionen. Temperature anvendes inde i denne konvertering: hvert logit divideres med T før softmax. Det reskalerer sandsynlighedsfordelingen - T mindre end 1 skærper toppene, T større end 1 fladgør fordelingen.
En almindelig misforståelse: temperature 1.0 er ikke 'maksimal tilfældighed'. Det er baseline - fordelingen modellen blev trænet på. Tænk på det som kontrast på et foto: T=1 er originalen; alt andet er en justering. Model-udgivere anbefaler typisk T=1.0 for deres modeller, parret med [[top-p]] og [[top-k]] til at afskære den lange hale af usandsynlige tokens.
Hvorfor T=0 er risikabelt for reasoning-modeller
Ved temperature 0 er der ingen sampling - modellen vælger deterministisk det mest sandsynlige token hver gang. Det lyder som konsistens, men det introducerer en fejlmode: hvis modellen kommer ind i et selvforstærkende mønster, kan den ikke undslippe. Sampling giver en udvej; greedy decoding gør ikke. Vi har observeret reasoning-modeller ved T=0 komme ind i uendelige synonym-cyklusser - de løste problemet korrekt, for derefter at cykle gennem omformulerede konklusioner indtil de ramte token-grænsen.
Det er derfor vores dokumentation advarer: sæt altid temperature eksplicit, og brug den værdi model-udgiveren anbefaler. Udelader du den, defaulter de fleste modeller til greedy decoding (T=0), hvilket risikerer ikke-terminerende loops på reasoning-workloads. Infercom API har ingen platform-bred default netop for at gøre dette valg synligt.
Praktisk vejledning
For EU-suveræne modeller på Infercom, brug udgiverens anbefalede værdier: MiniMax-M2.7 specificerer temperature 1.0, top_p 0.95, top_k 40; gpt-oss-120b specificerer temperature 1.0, top_p 1.0. Vil du have mere fokuseret output, sænk temperature til 0.3-0.7 snarere end nul - du indsnævrer variansen uden at udløse greedy decodings fejlmodes. Og husk: selv ved T=0 er byte-identiske outputs ikke garanteret på tværs af distribueret inferens - floating-point-varians i parallel beregning kan flippe tætte afgørelser.
Kilder
Relaterede begreber
Top-P (Nucleus Sampling)
En sampling-metode der kun beholder nok højsandsynlige tokens til at dække en kumulativ sandsynlighed p - kandidat-puljen tilpasser sig modellens sikkerhed.
Top-K Sampling
En sampling-metode der begrænser valget til de k mest sandsynlige tokens - et hårdt loft på kandidat-puljen.
Greedy Decoding
Dekodningsstrategien der altid vælger det mest sandsynlige token - deterministisk, men tilbøjelig til gentagelsesloops.
Inference
At køre en trænet AI-model for at producere output - AI's produktionsworkload, og den hvor omkostning og hastighed forstærkes med brugen.
Lær hvordan SambaNova's dataflow-arkitektur ændrer økonomien i inference - og hvorfor vi byggede på den.