Gemma 4 31B API in Europa

Il modello aperto dense più capace di Google: multimodale e ospitato nell'UE.

Ragionamento di livello frontier, multimodalità nativa e prestazioni di coding adatte alla produzione. Gemma 4 nasce dalla stessa base di ricerca di Gemini 3 e ora gira su infrastruttura sovrana UE.

Perché Gemma 4 31B

Il modello aperto dense più capace di Google DeepMind unisce ragionamento avanzato e comprensione multimodale. È ideale per i workflow agentici che richiedono sia velocità sia intelligenza.

Ragionamento avanzato

Una modalità di pensiero configurabile per la pianificazione in più passaggi e i problemi complessi. Regoli la profondità del ragionamento in base a ciò che serve al tuo workload: una riflessione approfondita o risposte rapide.

Multimodale nativo

Elabora testo e immagini insieme per comprendere documenti, analizzare immagini, estrarre dati dai grafici e produrre output strutturati. Perfetto per i workflow che uniscono visione e ragionamento.

Workflow agentici

Function calling nativo, output JSON strutturato e supporto per i system prompt. Costruisci agenti autonomi che interagiscono in modo affidabile con strumenti e API, per esempio con framework come OpenClaw e CrewAI.

Modalità di pensiero configurabile

Attiva o disattiva la modalità di pensiero in base al compito. Attivala per il ragionamento complesso, disattivala per le applicazioni sensibili alla latenza che devono rispondere in fretta.

31B

Parametri (dense)

30%+

Più veloce dei provider GPU

rispetto al provider basato su GPU più veloce (Artificial Analysis, luglio 2026)

Sovrano UE Monaco, Germania

Misurato sull'infrastruttura UE di Infercom

Throughput di output

199tok/s

Time to First Token

1189ms

Context window

128Ktoken

Lato server p50, 10K input / 1K output, singola richiesta

Ultima misurazione: July 2026.

Vedi tutti i benchmark e la metodologia

Risultati nei benchmark

Punteggi di livello frontier nei benchmark di ragionamento, coding e conoscenza. Tutti i punteggi provengono dalla valutazione di Google DeepMind.

MMLU Pro

85.2%

Ragionamento avanzato sulla conoscenza

AIME 2026

89.2%

Ragionamento matematico (senza strumenti)

LiveCodeBench v6

80.0%

Compiti di coding dalla produzione

GPQA Diamond

84.3%

Domande scientifiche di livello universitario

Codeforces ELO

2150

Programmazione competitiva

Quando usare Gemma 4 31B

Gemma 4 eccelle nei compiti che richiedono ragionamento, visione o capacità agentiche. L'architettura dense rende efficienti il fine-tuning e il deployment.

Assistente per il codice

Coding per la produzione

Trasforma qualsiasi workstation in un assistente per il codice di livello frontier. I risultati solidi su LiveCodeBench e Codeforces rendono Gemma 4 una buona scelta per l'agentic coding con Claude Code o strumenti simili.

Configura l'agentic coding

Elaborazione di documenti

Vision + Reasoning

Estrai dati strutturati da grafici, documenti e screenshot. Il modello unisce comprensione visiva e ragionamento e restituisce JSON pulito per i workflow automatizzati.

AI agentica

Agenti autonomi

Il function calling nativo e l'uso degli strumenti permettono di costruire agenti autonomi che interagiscono con API e servizi esterni. Compatibile con OpenClaw, CrewAI e altri framework multi-agente.

Compiti complessi

Ragionamento matematico e scientifico

89,2% su AIME 2026 (ragionamento matematico) e 84,3% su GPQA Diamond (domande scientifiche). Attiva la modalità di pensiero per i problemi complessi in più passaggi che richiedono una riflessione approfondita.

Modalità di pensiero: quando attivarla

Modalità di pensiero attiva

Compiti di ragionamento complessi, problemi matematici, pianificazione in più passaggi, decisioni sull'architettura del codice. Qui la latenza in più vale la maggiore precisione.

Modalità di pensiero disattivata

Applicazioni sensibili alla latenza, domande semplici, pipeline ad alto throughput, interazioni in tempo reale. Risposte rapide senza il tempo extra della riflessione.

Come attivare la modalità di pensiero

response = client.chat.completions.create(
    model="gemma-4-31B-it",
    messages=[{"role": "user", "content": "Your prompt"}],
    extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)

Imposta enable_thinking su true tramite chat_template_kwargs. Con l'SDK di OpenAI passa il parametro dentro extra_body, con le chiamate API dirette al primo livello. Documentazione sul ragionamento

Prezzi

Licenza Apache 2.0 con prezzi trasparenti basati sul consumo. Nessun costo nascosto.

ModelloInput (per 1M)Output (per 1M)Contesto
Gemma 4 31B (Infercom)€0,20€0,35128K

Prezzi in EUR IVA esclusa. Gestione sovrana UE, pienamente conforme al GDPR.

Deployment sovrano UE

Gemma 4 31B gira sull'infrastruttura UE dedicata di Infercom. I tuoi dati non lasciano mai la giurisdizione europea.

  • Ospitato in Germania (Equinix Monaco 4)
  • Piena conformità al GDPR
  • Nessuna esposizione al CLOUD Act USA
  • Infrastruttura certificata ISO 27001
  • DPA disponibile
ISO 27001
Conforme al GDPR
Germania
RDU di SambaNova

Inizia con Gemma 4

quickstart.py
from openai import OpenAI

client = OpenAI(
    api_key="your-infercom-key",
    base_url="https://api.infercom.ai/v1"
)

response = client.chat.completions.create(
    model="gemma-4-31B-it",
    messages=[{"role": "user", "content": "Your prompt here"}],
    max_tokens=4096
)

print(response.choices[0].message.content)

Compatibile con l'API di OpenAI: cambia la base URL e usa Gemma 4 in pochi minuti. Non servono altre modifiche al codice.

Pay-as-you-go senza vincoli.

Domande frequenti

Quanto è veloce Gemma 4 su Infercom?

199 token al secondo di throughput di output e 1.189ms di time to first token (il tempo al primo token), entrambi misurati lato server come p50 con 10K token di input e 1K di output sulla nostra API di produzione a Monaco. Gemma 4 cede un po' di velocità pura in cambio della comprensione di immagini e testo in un unico modello. Se ti serve solo testo, gpt-oss-120b misura 713 tok/s sulla stessa infrastruttura. Puoi rimisurare ogni valore con il nostro strumento di benchmark open source.

Vedi tutti i benchmark
Cos'è Gemma 4 31B?

Gemma 4 31B è il modello aperto dense più capace di Google DeepMind e nasce dalla stessa base di ricerca di Gemini 3. Ha 31 miliardi di parametri, un context window di 128K, multimodalità nativa (testo e immagini) e una modalità di pensiero configurabile per i compiti di ragionamento complessi.

Gemma 4 è multimodale?

Sì. Gemma 4 31B elabora nativamente testo e immagini nello stesso contesto. Può quindi comprendere documenti, analizzare immagini, estrarre dati dai grafici e produrre dati strutturati a partire da immagini, senza bisogno di un modello di visione separato.

Gemma 4 è un modello open-weight? Quale licenza si applica?

Sì. Google ha rilasciato Gemma 4 con licenza Apache 2.0, la prima generazione di Gemma con una licenza open source approvata dall'OSI. I pesi sono pubblici e si possono usare, modificare e distribuire a fini commerciali senza un accordo separato. Usare Gemma 4 tramite Infercom significa che lo ospitiamo e lo gestiamo noi per te su infrastruttura UE.

Cos'è un modello open-weight
In cosa si differenzia Gemma 4 da Gemma 3?

Gemma 4 è un grande passo avanti rispetto a Gemma 3, con punteggi di livello frontier: 85,2% su MMLU Pro, 89,2% su AIME 2026 (ragionamento matematico) e 80% su LiveCodeBench v6. Aggiunge multimodalità nativa, una modalità di pensiero configurabile e un supporto migliore per i workflow agentici con function calling nativo.

Cos'è la modalità di pensiero e come si attiva?

La modalità di pensiero è una funzione configurabile che consente un ragionamento più approfondito nei compiti complessi. Quando è attiva, Gemma 4 riflette prima di rispondere a problemi in più passaggi, domande matematiche o decisioni sull'architettura del codice. La attivi passando enable_thinking: true tramite chat_template_kwargs (dentro extra_body con l'SDK di OpenAI, al primo livello con le chiamate API dirette). Per le applicazioni sensibili alla latenza lasciala disattivata, così le risposte arrivano più in fretta.

I miei dati restano nell'UE?

Sì. Infercom esegue Gemma 4 31B su infrastruttura dedicata in Germania (Equinix Monaco 4). I tuoi dati non lasciano mai la giurisdizione europea. Il trattamento è pienamente conforme al GDPR e non è esposto al CLOUD Act USA, e l'infrastruttura è certificata ISO 27001. Un DPA è disponibile su richiesta.

Come funziona la sovranità UE da noi
Quanto costa Gemma 4 31B?

Paghi per token, senza minimi e senza vincoli mensili: €0,20 per milione di token di input e €0,35 per milione di token di output (IVA esclusa), con un context window di 128K. Ti viene fatturato solo ciò che usi, e consumi e spesa sono visibili in tempo reale nel portale cloud.

Vedi tutti i prezzi

Vuoi costruire il futuro dell'AI in Europa?

Unisciti alle organizzazioni che usano l'AI sovrana con prestazioni di altissimo livello