Gemma 4 31B API in Europa
Il modello aperto dense più capace di Google: multimodale e ospitato nell'UE.
Ragionamento di livello frontier, multimodalità nativa e prestazioni di coding adatte alla produzione. Gemma 4 nasce dalla stessa base di ricerca di Gemini 3 e ora gira su infrastruttura sovrana UE.
Perché Gemma 4 31B
Il modello aperto dense più capace di Google DeepMind unisce ragionamento avanzato e comprensione multimodale. È ideale per i workflow agentici che richiedono sia velocità sia intelligenza.
Ragionamento avanzato
Una modalità di pensiero configurabile per la pianificazione in più passaggi e i problemi complessi. Regoli la profondità del ragionamento in base a ciò che serve al tuo workload: una riflessione approfondita o risposte rapide.
Multimodale nativo
Elabora testo e immagini insieme per comprendere documenti, analizzare immagini, estrarre dati dai grafici e produrre output strutturati. Perfetto per i workflow che uniscono visione e ragionamento.
Workflow agentici
Function calling nativo, output JSON strutturato e supporto per i system prompt. Costruisci agenti autonomi che interagiscono in modo affidabile con strumenti e API, per esempio con framework come OpenClaw e CrewAI.
Modalità di pensiero configurabile
Attiva o disattiva la modalità di pensiero in base al compito. Attivala per il ragionamento complesso, disattivala per le applicazioni sensibili alla latenza che devono rispondere in fretta.
31B
Parametri (dense)
128K
30%+
Più veloce dei provider GPU
rispetto al provider basato su GPU più veloce (Artificial Analysis, luglio 2026)
Misurato sull'infrastruttura UE di Infercom
Throughput di output
199tok/s
Time to First Token
1189ms
Context window
128Ktoken
Lato server p50, 10K input / 1K output, singola richiesta
Ultima misurazione: July 2026.
Vedi tutti i benchmark e la metodologiaApprofondimenti nel nostro glossario
Risultati nei benchmark
Punteggi di livello frontier nei benchmark di ragionamento, coding e conoscenza. Tutti i punteggi provengono dalla valutazione di Google DeepMind.
MMLU Pro
85.2%
Ragionamento avanzato sulla conoscenza
AIME 2026
89.2%
Ragionamento matematico (senza strumenti)
LiveCodeBench v6
80.0%
Compiti di coding dalla produzione
GPQA Diamond
84.3%
Domande scientifiche di livello universitario
Codeforces ELO
2150
Programmazione competitiva
Quando usare Gemma 4 31B
Gemma 4 eccelle nei compiti che richiedono ragionamento, visione o capacità agentiche. L'architettura dense rende efficienti il fine-tuning e il deployment.
Assistente per il codice
Coding per la produzione
Trasforma qualsiasi workstation in un assistente per il codice di livello frontier. I risultati solidi su LiveCodeBench e Codeforces rendono Gemma 4 una buona scelta per l'agentic coding con Claude Code o strumenti simili.
Configura l'agentic codingElaborazione di documenti
Vision + Reasoning
Estrai dati strutturati da grafici, documenti e screenshot. Il modello unisce comprensione visiva e ragionamento e restituisce JSON pulito per i workflow automatizzati.
AI agentica
Agenti autonomi
Il function calling nativo e l'uso degli strumenti permettono di costruire agenti autonomi che interagiscono con API e servizi esterni. Compatibile con OpenClaw, CrewAI e altri framework multi-agente.
Compiti complessi
Ragionamento matematico e scientifico
89,2% su AIME 2026 (ragionamento matematico) e 84,3% su GPQA Diamond (domande scientifiche). Attiva la modalità di pensiero per i problemi complessi in più passaggi che richiedono una riflessione approfondita.
Modalità di pensiero: quando attivarla
Modalità di pensiero attiva
Compiti di ragionamento complessi, problemi matematici, pianificazione in più passaggi, decisioni sull'architettura del codice. Qui la latenza in più vale la maggiore precisione.
Modalità di pensiero disattivata
Applicazioni sensibili alla latenza, domande semplici, pipeline ad alto throughput, interazioni in tempo reale. Risposte rapide senza il tempo extra della riflessione.
Come attivare la modalità di pensiero
response = client.chat.completions.create(
model="gemma-4-31B-it",
messages=[{"role": "user", "content": "Your prompt"}],
extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)Imposta enable_thinking su true tramite chat_template_kwargs. Con l'SDK di OpenAI passa il parametro dentro extra_body, con le chiamate API dirette al primo livello. Documentazione sul ragionamento
Prezzi
Licenza Apache 2.0 con prezzi trasparenti basati sul consumo. Nessun costo nascosto.
| Modello | Input (per 1M) | Output (per 1M) | Contesto |
|---|---|---|---|
| Gemma 4 31B (Infercom) | €0,20 | €0,35 | 128K |
Prezzi in EUR IVA esclusa. Gestione sovrana UE, pienamente conforme al GDPR.
Deployment sovrano UE
Gemma 4 31B gira sull'infrastruttura UE dedicata di Infercom. I tuoi dati non lasciano mai la giurisdizione europea.
- Ospitato in Germania (Equinix Monaco 4)
- Piena conformità al GDPR
- Nessuna esposizione al CLOUD Act USA
- Infrastruttura certificata ISO 27001
- DPA disponibile
Inizia con Gemma 4
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gemma-4-31B-it",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)Compatibile con l'API di OpenAI: cambia la base URL e usa Gemma 4 in pochi minuti. Non servono altre modifiche al codice.
Pay-as-you-go senza vincoli.
Domande frequenti
Quanto è veloce Gemma 4 su Infercom?
199 token al secondo di throughput di output e 1.189ms di time to first token (il tempo al primo token), entrambi misurati lato server come p50 con 10K token di input e 1K di output sulla nostra API di produzione a Monaco. Gemma 4 cede un po' di velocità pura in cambio della comprensione di immagini e testo in un unico modello. Se ti serve solo testo, gpt-oss-120b misura 713 tok/s sulla stessa infrastruttura. Puoi rimisurare ogni valore con il nostro strumento di benchmark open source.
Vedi tutti i benchmarkCos'è Gemma 4 31B?
Gemma 4 31B è il modello aperto dense più capace di Google DeepMind e nasce dalla stessa base di ricerca di Gemini 3. Ha 31 miliardi di parametri, un context window di 128K, multimodalità nativa (testo e immagini) e una modalità di pensiero configurabile per i compiti di ragionamento complessi.
Gemma 4 è multimodale?
Sì. Gemma 4 31B elabora nativamente testo e immagini nello stesso contesto. Può quindi comprendere documenti, analizzare immagini, estrarre dati dai grafici e produrre dati strutturati a partire da immagini, senza bisogno di un modello di visione separato.
Gemma 4 è un modello open-weight? Quale licenza si applica?
Sì. Google ha rilasciato Gemma 4 con licenza Apache 2.0, la prima generazione di Gemma con una licenza open source approvata dall'OSI. I pesi sono pubblici e si possono usare, modificare e distribuire a fini commerciali senza un accordo separato. Usare Gemma 4 tramite Infercom significa che lo ospitiamo e lo gestiamo noi per te su infrastruttura UE.
Cos'è un modello open-weightIn cosa si differenzia Gemma 4 da Gemma 3?
Gemma 4 è un grande passo avanti rispetto a Gemma 3, con punteggi di livello frontier: 85,2% su MMLU Pro, 89,2% su AIME 2026 (ragionamento matematico) e 80% su LiveCodeBench v6. Aggiunge multimodalità nativa, una modalità di pensiero configurabile e un supporto migliore per i workflow agentici con function calling nativo.
Cos'è la modalità di pensiero e come si attiva?
La modalità di pensiero è una funzione configurabile che consente un ragionamento più approfondito nei compiti complessi. Quando è attiva, Gemma 4 riflette prima di rispondere a problemi in più passaggi, domande matematiche o decisioni sull'architettura del codice. La attivi passando enable_thinking: true tramite chat_template_kwargs (dentro extra_body con l'SDK di OpenAI, al primo livello con le chiamate API dirette). Per le applicazioni sensibili alla latenza lasciala disattivata, così le risposte arrivano più in fretta.
I miei dati restano nell'UE?
Sì. Infercom esegue Gemma 4 31B su infrastruttura dedicata in Germania (Equinix Monaco 4). I tuoi dati non lasciano mai la giurisdizione europea. Il trattamento è pienamente conforme al GDPR e non è esposto al CLOUD Act USA, e l'infrastruttura è certificata ISO 27001. Un DPA è disponibile su richiesta.
Come funziona la sovranità UE da noiQuanto costa Gemma 4 31B?
Paghi per token, senza minimi e senza vincoli mensili: €0,20 per milione di token di input e €0,35 per milione di token di output (IVA esclusa), con un context window di 128K. Ti viene fatturato solo ciò che usi, e consumi e spesa sono visibili in tempo reale nel portale cloud.
Vedi tutti i prezziRisorse correlate
Benchmark di prestazioni
Latenza e throughput misurati sulla nostra infrastruttura.
Guida all'agentic coding
Usa Gemma 4 come assistente per il codice local-first.
gpt-oss-120b
Il nostro modello più veloce, quando ti serve solo testo.
MiniMax M2.7 Ultraspeed
Ragionamento di livello frontier per lunghe esecuzioni agentiche.
AI sovrana UE
Dove si trovano i tuoi dati e chi può accedervi.
Dettagli sui prezzi
Tutti i prezzi di tutti i modelli.