Wie top-p funktioniert
Nachdem [[temperature]] die Wahrscheinlichkeitsverteilung umgeformt hat, filtert top-p sie. Token werden nach Wahrscheinlichkeit sortiert; der Filter addiert von oben, bis die kumulative Wahrscheinlichkeit p erreicht. Alles darunter wird entfernt und die verbleibenden Wahrscheinlichkeiten werden renormalisiert. Dann wird aus der reduzierten Menge gesampelt.
Zum Beispiel mit top_p=0.9: Hat das Top-Token 92% Wahrscheinlichkeit, überlebt nur dieses Token - das Modell ist sicher und der Kern ist eng. Hat stattdessen das Top-Token 40%, das nächste 30%, das nächste 15% und so weiter, fügt der Filter Token hinzu, bis die kumulative Summe 90% überschreitet, was einen breiteren Pool ergibt. Deshalb passt sich top-p an die Sicherheit an, während [[top-k]] das nicht tut - derselbe Schwellenwert erzeugt je nach Verteilung unterschiedliche Poolgrößen.
Top-p vs. top-k
Top-k fixiert die Poolgröße: Behalte genau k Token, unabhängig von der Wahrscheinlichkeitsverteilung. Top-p fixiert die kumulative Wahrscheinlichkeitsmasse: Behalte so viele Token, wie nötig sind, um p des Gesamten abzudecken. Wenn das Modell sicher ist, kann top-k weit mehr Kandidaten einschließen als nötig; wenn das Modell unsicher ist, kann es zu aggressiv abschneiden. Top-p handhabt beide Fälle mit einem einzigen Parameter.
In der Praxis empfehlen viele Modellhersteller, beides zu verwenden: top-p als primären Filter (0.9-0.95 ist üblich) mit top-k als harter Obergrenze (40-100), um Randfälle abzufangen, in denen selbst der Kern sehr groß ist. Temperature, top-p und top-k bilden zusammen eine dreistufige Pipeline: Verteilung umformen, nach kumulativer Wahrscheinlichkeit kürzen, dann nach Anzahl begrenzen.
Empfohlene Werte
Auf Infercoms EU-souveränen Modellen sind die vom Hersteller empfohlenen Werte: MiniMax-M2.7 top_p 0.95, gpt-oss-120b top_p 1.0 (keine Filterung), gemma-4-31B-it top_p 0.95, DeepSeek-V3.2 top_p 0.95. Ein top_p von 1.0 bedeutet keine Filterung in diesem Schritt - die vollständige Verteilung wird durchgelassen. Niedrigere Werte verengen den Kern; Werte unter 0.5 sind ungewöhnlich und können die Ausgabe zu stark einschränken. Siehe unsere API-Dokumentation für die vollständige Parameterreferenz.
Quellen
Verwandte Begriffe
Temperature (Sampling)
Der Parameter, der die Zufälligkeit bei der Token-Auswahl steuert - wobei 1.0 die Basis ist und 0 Greedy Decoding erzwingt.
Top-K Sampling
Eine Sampling-Methode, die die Auswahl auf die k wahrscheinlichsten Token beschränkt - eine harte Obergrenze für den Kandidatenpool.
Greedy Decoding
Die Dekodierungsstrategie, die immer das wahrscheinlichste Token wählt - deterministisch, aber anfällig für Wiederholungsschleifen.
Inferenz
Der Betrieb eines trainierten KI-Modells zur Erzeugung von Ausgaben - der Produktions-Workload der KI, dessen Kosten und Geschwindigkeit sich mit der Nutzung vervielfachen.
Erfahren Sie, wie SambaNovas Dataflow-Architektur die Ökonomie der Inferenz verändert - und warum wir darauf aufbauen.