Qualita OpenAI, liberta Open-Weight
gpt-oss-120b e il primo modello open-weight di OpenAI - licenza Apache 2.0, progettato per workload agentici di produzione. Non e il modello piu appariscente, ma quello su cui puoi contare giorno dopo giorno.
Reasoning Integrato
Reasoning chain-of-thought con livelli di sforzo regolabili - ottimizza per velocita o precisione per compito.
Pronto per la produzione
Eguaglia GPT-4o sulla maggior parte dei compiti. Lo supera sui benchmark di reasoning.
Miglior valore
Miglior rapporto prezzo-intelligenza secondo Artificial Analysis.
Efficiente per design
| Parametri totali | 117B |
| Parametri attivi | 5.1B per forward pass |
| Architettura | Mixture of Experts (MoE) |
| Esperti | 128 experts, Top-4 routing per token |
| Layer | 36 |
| Lunghezza contesto | 128K tokens |
| Licenza | Apache 2.0 |
Misurato su infrastruttura UE
10K input / 1K output, 1 concorrente, 10 richieste
Fino a 772 tok/s su prompt più corti. Ultima misurazione: July 2026.
Vedi tutti i benchmark e la metodologiaApprofondimenti nel nostro glossario
Perche e cosi veloce
L'architettura MoE significa qualita di un modello 117B attivando solo 5,1B parametri per richiesta - ecco perche e cosi veloce.
- 22x meno parametri attivi per inferenza
- Minori requisiti di banda di memoria
- Routing degli esperti ottimizzato per ogni token
- Stessa qualita, frazione del calcolo
Non per sviluppatori. Per agenti.
"If you're building a public-facing AI agent, gpt-oss is your best bet - it's the best privately hostable model that functions on a single high-end GPU in production."
- Tigris
Controllo reasoning
Regola lo sforzo di pensiero (basso/medio/alto) per compito
Function Calling
Uso nativo degli strumenti per workflow agentici
Output strutturati
Modalita JSON per parsing affidabile
Web Browsing
Capacita integrata per agenti di ricerca
Naviga siti web, estrai dati ed esegui attivita di ricerca multi-step in autonomia.
Esecuzione codice
Esecuzione Python per agenti di analisi dati
Esegui Python in un ambiente sandbox per elaborazione dati, calcoli e analisi.
Il modello giusto per il compito giusto
Non ogni richiesta ha bisogno del tuo modello piu costoso. I team intelligenti usano gpt-oss-120b come parte di una strategia multi-modello.
"The technical quality is undeniable, and the chain-of-thought reasoning system is genuinely innovative in the open-weight space."
- Apatero (2026 Review)
Balanced Mode
In modalita balanced: Eguaglia GPT-4o sulla maggior parte dei compiti
Deep Mode
In modalita deep: Supera GPT-4o sul reasoning (MATH, HumanEval)
Cost Efficiency
A una frazione del costo dei modelli proprietari
| Scenario | Scelta modello |
|---|---|
| Reasoning complesso | gpt-oss-120b (sforzo alto) |
| Compiti standard | gpt-oss-120b (sforzo medio) |
| Query semplici | gpt-oss-120b (sforzo basso) |
| Compiti premium | MiniMax M2.7 Ultraspeed |
"We optimized workflows twice: once for accuracy + latency, and once for accuracy + cost-capturing the tradeoffs that matter most in real-world deployments."
- DataRobot
OpenAI Open-Weight su infrastruttura UE
Esegui il modello open-weight di OpenAI senza inviare dati negli USA:
- Ospitato in Germania su infrastruttura di proprieta Infercom
- Piena conformita GDPR con DPA basato in UE
- Nessuna esposizione al US CLOUD Act
- Certificato ISO 27001
- Licenza Apache 2.0 - piena liberta di deploy
Inizia in 2 minuti
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gpt-oss-120b",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)API compatibile OpenAI. Sostituzione drop-in per il tuo codice esistente.
Paghi solo per i token che usi.
gpt-oss-120b: domande frequenti
713 token al secondo di output throughput e 388 ms di Time to First Token, entrambi p50 lato server misurati con 10K token di input e 1K di output sulla nostra API di produzione a Monaco di Baviera. Sui prompt più corti si arriva fino a 772 tok/s. È fino a 10x più veloce delle alternative su GPU, e puoi riprodurre ogni valore con il nostro strumento di benchmark open source.
Vedi tutti i benchmarkSì. OpenAI ha rilasciato gpt-oss-120b con licenza Apache 2.0: i pesi sono pubblici e puoi distribuire, mettere a punto e usare il modello commercialmente senza un accordo separato. Tramite Infercom significa semplicemente che lo ospitiamo e lo gestiamo per te su infrastruttura UE.
Cosa significa davvero open-weightSì. Infercom eroga gpt-oss-120b da hardware di sua proprietà in un datacenter Tier III+ a Monaco di Baviera, in Germania. Le richieste sono elaborate all'interno della giurisdizione UE senza esposizione al CLOUD Act statunitense, l'infrastruttura è certificata ISO 27001 e un accordo di trattamento dati UE è disponibile su richiesta. Non addestriamo sui tuoi dati.
Come funziona qui la sovranità UESì. Punta l'SDK OpenAI a https://api.infercom.ai/v1, usa la tua chiave API Infercom e indica gpt-oss-120b come nome del modello. Il codice che già parla la Chat Completions API di OpenAI funziona senza modifiche, streaming, function calling e structured output inclusi.
Leggi la documentazione API128K token (131.072), condivisi tra il tuo prompt e la risposta del modello. Sono sufficienti per codebase estese, lunghe tracce di agenti e prompt su più documenti in una sola richiesta.
Cos'è una finestra di contestoPagamento a token senza minimi e senza impegno mensile: 0,22 EUR per milione di token di input e 0,59 EUR per milione di token di output. Paghi solo ciò che usi, e consumo e spesa sono visibili in tempo reale nel portale cloud.
Vedi i prezzi completiScopri di piu
Benchmark prestazioni
Vedi come performa gpt-oss-120b sulla nostra infrastruttura UE
MiniMax M2.7 Ultraspeed
Quando serve prestazione agentica SOTA
Gemma 4 31B
Quando immagine e testo vanno nella stessa richiesta
AI sovrana UE
Dove risiedono i tuoi dati e chi può raggiungerli
Documentazione API
Riferimento API completo e guide di integrazione
Prezzi
Prezzi trasparenti per token