OpenAI-Qualität, Open-Weight-Freiheit
gpt-oss-120b ist OpenAIs erstes Open-Weight-Modell - Apache 2.0 lizenziert, entwickelt für produktive agentische Workloads. Es ist nicht das auffälligste Modell, aber eines, auf das Sie sich Tag für Tag verlassen können.
Integriertes Reasoning
Chain-of-Thought-Reasoning mit einstellbaren Aufwandsstufen - optimieren Sie für Geschwindigkeit oder Genauigkeit pro Aufgabe.
Produktionsreif
Erreicht GPT-4o bei den meisten Aufgaben. Übertrifft es bei reasoning-lastigen Benchmarks.
Bester Wert
Bestes Preis-Intelligenz-Verhältnis laut Artificial Analysis.
Effizient durch Design
| Gesamtparameter | 117B |
| Aktive Parameter | 5.1B per forward pass |
| Architektur | Mixture of Experts (MoE) |
| Experten | 128 experts, Top-4 routing per token |
| Schichten | 36 |
| Kontextlänge | 128K tokens |
| Lizenz | Apache 2.0 |
Gemessen auf EU-Infrastruktur
10K Input / 1K Output, 1 gleichzeitig, 10 Anfragen
Bis zu 772 tok/s bei kürzeren Prompts. Zuletzt gemessen: July 2026.
Alle Benchmarks und die Methodik ansehenVertiefung in unserem Glossar
Warum es so schnell ist
Die MoE-Architektur bedeutet 117B-Modellqualität bei nur 5,1B aktiven Parametern pro Anfrage - deshalb ist es so schnell.
- 22x weniger aktive Parameter pro Inferenz
- Geringere Speicherbandbreitenanforderungen
- Experten-Routing optimiert für jeden Token
- Gleiche Qualität, Bruchteil der Rechenleistung
Nicht für Entwickler. Für Agenten.
"If you're building a public-facing AI agent, gpt-oss is your best bet - it's the best privately hostable model that functions on a single high-end GPU in production."
- Tigris
Reasoning-Kontrolle
Denkaufwand (niedrig/mittel/hoch) pro Aufgabe anpassen
Function Calling
Native Tool-Nutzung für agentische Workflows
Strukturierte Ausgaben
JSON-Modus für zuverlässiges Parsing
Web Browsing
Eingebaute Fähigkeit für Research-Agenten
Websites navigieren, Daten extrahieren und mehrstufige Rechercheaufgaben autonom durchführen.
Code-Ausführung
Python-Ausführung für Datenanalyse-Agenten
Python in einer Sandbox-Umgebung für Datenverarbeitung, Berechnungen und Analysen ausführen.
Das richtige Modell für die richtige Aufgabe
Nicht jede Anfrage braucht Ihr teuerstes Modell. Smarte Teams nutzen gpt-oss-120b als Teil einer Multi-Modell-Strategie.
"The technical quality is undeniable, and the chain-of-thought reasoning system is genuinely innovative in the open-weight space."
- Apatero (2026 Review)
Balanced Mode
Im Balanced-Modus: Erreicht GPT-4o bei den meisten Aufgaben
Deep Mode
Im Deep-Modus: Übertrifft GPT-4o beim Reasoning (MATH, HumanEval)
Cost Efficiency
Zu einem Bruchteil der Kosten proprietärer Modelle
| Szenario | Modellwahl |
|---|---|
| Komplexes Reasoning | gpt-oss-120b (hoher Aufwand) |
| Standardaufgaben | gpt-oss-120b (mittlerer Aufwand) |
| Einfache Anfragen | gpt-oss-120b (niedriger Aufwand) |
| Premium-Aufgaben | MiniMax M2.7 Ultraspeed |
"We optimized workflows twice: once for accuracy + latency, and once for accuracy + cost-capturing the tradeoffs that matter most in real-world deployments."
- DataRobot
OpenAI Open-Weight auf EU-Infrastruktur
OpenAIs Open-Weight-Modell nutzen, ohne Daten in die USA zu senden:
- Gehostet in Deutschland auf Infercom-eigener Infrastruktur
- Vollständige DSGVO-Konformität mit EU-basiertem DPA
- Kein US CLOUD Act-Risiko
- ISO 27001 zertifiziert
- Apache 2.0 Lizenz - volle Freiheit zum Deployen
In 2 Minuten starten
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)OpenAI-kompatible API. Drop-in-Ersatz für Ihren bestehenden Code.
Zahlen Sie nur für die genutzten Tokens.
gpt-oss-120b: Häufige Fragen
713 Tokens pro Sekunde Output-Throughput und 388 ms Time to First Token, beides serverseitige p50-Werte bei 10K Input / 1K Output auf unserer Produktions-API in München. Bei kürzeren Prompts sind Spitzen bis zu 772 tok/s möglich. Das ist bis zu 10x schneller als GPU-basierte Alternativen, und Sie können jede Zahl mit unserem Open-Source-Benchmark-Tool reproduzieren.
Alle Benchmarks ansehenJa. OpenAI hat gpt-oss-120b unter der Apache-2.0-Lizenz veröffentlicht. Die Gewichte sind offen, und Sie dürfen das Modell ohne gesonderte Vereinbarung kommerziell einsetzen, betreiben und feinabstimmen. Über Infercom bedeutet das schlicht: Wir hosten und betreiben es für Sie auf EU-Infrastruktur.
Was Open-Weight konkret bedeutetJa. Infercom betreibt gpt-oss-120b auf eigener Hardware in einem Tier-III+-Rechenzentrum in München. Anfragen werden innerhalb der EU-Jurisdiktion verarbeitet, ohne Exponierung gegenüber dem US CLOUD Act. Die Infrastruktur ist ISO 27001 zertifiziert, ein EU-Auftragsverarbeitungsvertrag ist auf Anfrage verfügbar. Wir trainieren nicht mit Ihren Daten.
So funktioniert EU-Souveränität hierJa. Richten Sie das OpenAI-SDK auf https://api.infercom.ai/v1, verwenden Sie Ihren Infercom-API-Key und geben Sie gpt-oss-120b als Modellnamen an. Code, der bereits die OpenAI Chat Completions API spricht, läuft ohne Änderungen - inklusive Streaming, Function Calling und Structured Output.
API-Dokumentation lesen128K Tokens (131.072), aufgeteilt zwischen Ihrem Prompt und der Antwort des Modells. Das reicht für große Codebasen, lange Agenten-Traces und Prompts über mehrere Dokumente in einer einzigen Anfrage.
Was ein Kontextfenster istAbrechnung pro Token, ohne Mindestumsatz und ohne monatliche Bindung: 0,22 EUR pro Million Input-Tokens und 0,59 EUR pro Million Output-Tokens. Sie zahlen nur für die tatsächliche Nutzung, Verbrauch und Kosten sehen Sie live im Cloud-Portal.
Vollständige Preise ansehenMehr erfahren
Performance-Benchmarks
Sehen Sie, wie gpt-oss-120b auf unserer EU-Infrastruktur performt
MiniMax M2.7 Ultraspeed
Wenn Sie SOTA agentische Performance brauchen
Gemma 4 31B
Wenn Bild und Text in dieselbe Anfrage gehören
EU-souveräne KI
Wo Ihre Daten liegen und wer darauf zugreifen kann
API-Dokumentation
Vollständige API-Referenz und Integrationsanleitungen
Preise
Transparente Token-basierte Preise