OpenAI-kvalitet, Open-Weight frihed
gpt-oss-120b er OpenAIs første open-weight model - Apache 2.0 licenseret, designet til produktions-agentiske workloads. Det er ikke den mest prangende model, men den du kan stole på dag efter dag.
Indbygget Reasoning
Chain-of-thought reasoning med justerbare indsatsniveauer - optimer for hastighed eller nøjagtighed per opgave.
Produktionsklar
Matcher GPT-4o på de fleste opgaver. Slår det på reasoning-tunge benchmarks.
Bedste værdi
Bedste pris-til-intelligens ratio ifølge Artificial Analysis.
Effektiv fra design
| Totale parametre | 117B |
| Aktive parametre | 5.1B per forward pass |
| Arkitektur | Mixture of Experts (MoE) |
| Eksperter | 128 experts, Top-4 routing per token |
| Lag | 36 |
| Kontekstlængde | 128K tokens |
| Licens | Apache 2.0 |
Målt på EU-infrastruktur
10K input / 1K output, 1 samtidig, 10 requests
Op til 772 tok/s på kortere prompts. Sidst målt: July 2026.
Se alle benchmarks og metoden bagUddybning i vores ordliste
Hvorfor den er så hurtig
MoE-arkitekturen betyder 117B model-kvalitet med kun 5,1B aktive parametre per request - derfor er den så hurtig.
- 22x færre aktive parametre per inferens
- Lavere krav til hukommelsesbåndbredde
- Ekspert-routing optimeret for hver token
- Samme kvalitet, brøkdel af beregningen
Ikke til udviklere. Til agenter.
"If you're building a public-facing AI agent, gpt-oss is your best bet - it's the best privately hostable model that functions on a single high-end GPU in production."
- Tigris
Reasoning-kontrol
Juster tænkeindsats (lav/mellem/høj) per opgave
Function Calling
Native tool-brug til agentiske workflows
Strukturerede outputs
JSON-tilstand til pålidelig parsing
Web Browsing
Indbygget kapabilitet til research-agenter
Naviger websites, udtræk data og udfør flertrinns research-opgaver autonomt.
Kodeudførelse
Python-udførelse til dataanalyse-agenter
Kør Python i et sandboxet miljø til databehandling, beregninger og analyse.
Den rigtige model til den rigtige opgave
Ikke hver request har brug for din dyreste model. Smarte teams bruger gpt-oss-120b som del af en multi-model strategi.
"The technical quality is undeniable, and the chain-of-thought reasoning system is genuinely innovative in the open-weight space."
- Apatero (2026 Review)
Balanced Mode
I balanced mode: Matcher GPT-4o på de fleste opgaver
Deep Mode
I deep mode: Slår GPT-4o på reasoning (MATH, HumanEval)
Cost Efficiency
Til en brøkdel af prisen for proprietære modeller
| Scenarie | Modelvalg |
|---|---|
| Kompleks reasoning | gpt-oss-120b (høj indsats) |
| Standardopgaver | gpt-oss-120b (mellem indsats) |
| Simple forespørgsler | gpt-oss-120b (lav indsats) |
| Premium-opgaver | MiniMax M2.7 Ultraspeed |
"We optimized workflows twice: once for accuracy + latency, and once for accuracy + cost-capturing the tradeoffs that matter most in real-world deployments."
- DataRobot
OpenAI Open-Weight på EU-infrastruktur
Kør OpenAIs open-weight model uden at sende data til USA:
- Hostet i Tyskland på Infercom-ejet infrastruktur
- Fuld GDPR-overholdelse med EU-baseret DPA
- Ingen US CLOUD Act-eksponering
- ISO 27001 certificeret
- Apache 2.0 licens - fuld frihed til at deploye
Kom i gang på 2 minutter
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)OpenAI-kompatibel API. Drop-in erstatning for din eksisterende kode.
Betal kun for de tokens, du bruger.
gpt-oss-120b: ofte stillede spørgsmål
713 tokens per sekund i output-throughput og 388 ms Time to First Token, begge serverside-p50 målt ved 10K input / 1K output på vores produktions-API i München. På kortere prompts topper den op til 772 tok/s. Det er op til 10x hurtigere end GPU-baserede alternativer, og du kan reproducere hvert tal med vores open source-benchmarkværktøj.
Se alle benchmarksJa. OpenAI udgav gpt-oss-120b under Apache 2.0-licensen, så vægtene er offentlige, og du må frit deployere, finjustere og bruge modellen kommercielt uden en separat aftale. Gennem Infercom betyder det blot, at vi hoster og driver den for dig på EU-infrastruktur.
Hvad open-weight faktisk betyderJa. Infercom leverer gpt-oss-120b fra hardware, vi selv ejer, i et Tier III+ datacenter i München i Tyskland. Forespørgsler behandles inden for EU-jurisdiktion uden eksponering mod den amerikanske CLOUD Act, infrastrukturen er ISO 27001-certificeret, og en EU-databehandleraftale er tilgængelig på forespørgsel. Vi træner ikke på dine data.
Sådan fungerer EU-suverænitet herJa. Peg OpenAI-SDK'et mod https://api.infercom.ai/v1, brug din Infercom-API-nøgle og angiv gpt-oss-120b som modelnavn. Kode, der allerede taler OpenAI Chat Completions API, virker uden ændringer - inklusive streaming, function calling og structured output.
Læs API-dokumentationen128K tokens (131.072), delt mellem din prompt og modellens svar. Det giver plads til store kodebaser, lange agent-traces og prompts på tværs af flere dokumenter i én forespørgsel.
Hvad et kontekstvindue erBetaling per token uden minimum og uden månedlig binding: 0,22 EUR per million input-tokens og 0,59 EUR per million output-tokens. Du betaler kun for det, du bruger, og forbrug og omkostninger kan følges live i cloud-portalen.
Se de fulde priserLæs mere
Performance Benchmarks
Se hvordan gpt-oss-120b performer på vores EU-infrastruktur
MiniMax M2.7 Ultraspeed
Når du har brug for SOTA agentisk ydeevne
Gemma 4 31B
Når billede og tekst hører til i samme forespørgsel
EU-suveræn AI
Hvor dine data ligger, og hvem der kan nå dem
API-dokumentation
Fuld API-reference og integrationsvejledninger
Priser
Gennemsigtig token-baseret prissætning