Wie top-k funktioniert
Nachdem [[temperature]] die Wahrscheinlichkeitsverteilung angepasst hat, filtert top-k nach Rang. Die k Token mit den höchsten Wahrscheinlichkeiten werden behalten; der Rest wird auf null gesetzt. Die überlebenden Wahrscheinlichkeiten werden renormalisiert, sodass sie sich zu 1 summieren, und das Sampling zieht aus dieser Menge. k wird typischerweise zwischen 10 und 100 gesetzt, je nach Modell und Anwendungsfall.
Im Extrem bedeutet top_k=1, dass nur das einzige wahrscheinlichste Token überlebt - was funktional Greedy Decoding entspricht. Am anderen Extrem bedeutet top_k auf die volle Vokabulargröße gesetzt keine Filterung. Dazwischen wirkt top-k als harte Obergrenze dafür, wie weit in den Wahrscheinlichkeitsschwanz das Modell reichen kann.
Warum top-k oft mit top-p kombiniert wird
Die fixe Poolgröße von top-k ist zugleich seine Stärke und seine Schwäche. Sie garantiert, dass das Modell nicht aus extrem unwahrscheinlichen Token sampeln kann, was einige Formen inkohärenter Ausgaben verhindert. Aber sie passt sich nicht an: Wenn das Modell sehr sicher ist (ein Token bei 95%), behält k=50 immer noch 50 Kandidaten, obwohl 49 davon Rauschen sind. Wenn das Modell unsicher ist (viele Token mit ähnlichen Wahrscheinlichkeiten), könnte dasselbe k Optionen abschneiden, die tatsächlich plausibel waren.
[[Top-p]] adressiert dies, indem es die Poolgröße an die Form der Verteilung anpasst. In der Praxis empfehlen Modellhersteller oft, beides zu verwenden: top-p als adaptiven Filter (behalte Token, die sich zu 95% Wahrscheinlichkeit summieren) und top-k als Sicherheitsobergrenze (nie mehr als 40-100 Kandidaten). Beide Filter werden nach Temperature in Reihe angewendet, was eine Pipeline ergibt von: umformen, nach Masse kürzen, nach Anzahl begrenzen.
Empfohlene Werte
Auf Infercoms EU-souveränen Modellen sind die vom Hersteller empfohlenen top-k-Werte: MiniMax-M2.7 top_k 40, gemma-4-31B-it top_k 64. gpt-oss-120b und DeepSeek-V3.2 spezifizieren kein top-k und verlassen sich allein auf Temperature und top-p. Die Infercom-API akzeptiert top_k von 1 bis 100. Wenn Sie unsicher sind, beginnen Sie mit der Empfehlung des Herstellers oder lassen Sie es weg und überlassen Sie top-p die Filterung.
Quellen
Verwandte Begriffe
Temperature (Sampling)
Der Parameter, der die Zufälligkeit bei der Token-Auswahl steuert - wobei 1.0 die Basis ist und 0 Greedy Decoding erzwingt.
Top-P (Nucleus Sampling)
Eine Sampling-Methode, die nur genug hochwahrscheinliche Token behält, um eine kumulative Wahrscheinlichkeit p zu erreichen - der Kandidatenpool passt sich der Sicherheit des Modells an.
Greedy Decoding
Die Dekodierungsstrategie, die immer das wahrscheinlichste Token wählt - deterministisch, aber anfällig für Wiederholungsschleifen.
Inferenz
Der Betrieb eines trainierten KI-Modells zur Erzeugung von Ausgaben - der Produktions-Workload der KI, dessen Kosten und Geschwindigkeit sich mit der Nutzung vervielfachen.
Erfahren Sie, wie SambaNovas Dataflow-Architektur die Ökonomie der Inferenz verändert - und warum wir darauf aufbauen.