Gemma 4 31B API i Europa
Googles mest kapable dense open model - multimodal og EU-hostet.
Frontier-klasse ræsonnement, native multimodale funktioner og produktionsklar kodningsydelse. Bygget på samme forskningsfundament som Gemini 3, nu kørende på EU-suveræn infrastruktur.
Hvorfor Gemma 4 31B
Google DeepMinds mest kapable dense open model kombinerer avanceret ræsonnement med multimodal forståelse. Ideel til agentiske arbejdsflows, der kræver både hastighed og intelligens.
Avanceret ræsonnement
Konfigurerbar tænketilstand til flertrinplanlægning og kompleks problemløsning. Skift ræsonnementsdybde baseret på, om din arbejdsbyrde kræver dyb overvejelse eller hurtig respons.
Native multimodal
Behandl tekst og billeder sammen til dokumentforståelse, visuel analyse, diagramudtrækning og struktureret dataoutput. Perfekt til vision-plus-ræsonnement arbejdsflows.
Agentiske workflows
Native funktionskald, struktureret JSON-output og system-prompt support. Byg autonome agenter, der pålideligt interagerer med værktøjer og API'er ved hjælp af frameworks som OpenClaw og CrewAI.
Konfigurerbar tænkning
Slå tænketilstand til eller fra afhængigt af opgavekravene. Aktiver for kompleks ræsonnement, deaktiver for latency-sensitive applikationer, der kræver hurtige svar.
31B
Parametre (Dense)
128K
30%+
Hurtigere end GPU-udbydere
vs. hurtigste GPU-baserede udbyder (Artificial Analysis, juli 2026)
Målt på Infercoms EU-infrastruktur
Output-throughput
199tok/s
Time to First Token
1189ms
Kontekstvindue
128Ktokens
Serverside-p50, 10K input / 1K output, enkelt forespørgsel
Sidst målt: July 2026.
Se alle benchmarks og metoden bagUddybning i vores ordliste
Benchmark-ydelse
Frontier-klasse scorer på tværs af ræsonnement, kodning og vidensbenchmarks. Alle scorer fra Google DeepMind-evaluering.
MMLU Pro
85.2%
Advanced knowledge reasoning
AIME 2026
89.2%
Mathematical reasoning (no tools)
LiveCodeBench v6
80.0%
Production coding tasks
GPQA Diamond
84.3%
Graduate-level science QA
Codeforces ELO
2150
Competitive programming
Hvornår skal man bruge Gemma 4 31B
Gemma 4 udmærker sig ved opgaver, der kræver ræsonnement, vision eller agentiske evner. Den dense arkitektur muliggør effektiv finjustering og deployment.
Kodeassistent
Produktionsklar kodning
Forvandl enhver arbejdsstation til en frontier-klasse kodeassistent. Stærk præstation på LiveCodeBench og Codeforces benchmarks gør Gemma 4 ideel til agentiske kodnings-workflows med Claude Code eller lignende værktøjer.
Kom i gang med agentisk kodningDokumentbehandling
Vision + Ræsonnement
Udtræk strukturerede data fra diagrammer, dokumenter og skærmbilleder. Kombiner visuel forståelse med ræsonnement for at returnere rent JSON-output til automatiserede workflows.
Agentisk AI
Autonome agenter
Native funktionskald og værktøjsbrug gør det muligt at bygge autonome agenter, der interagerer med API'er og eksterne tjenester. Kompatibel med OpenClaw, CrewAI og andre multi-agent frameworks.
Komplekse opgaver
Matematisk og videnskabeligt ræsonnement
89,2% på AIME 2026 matematisk ræsonnement og 84,3% på GPQA Diamond videnskabelig QA. Aktiver tænketilstand for komplekse flertrinsproblemer, der kræver dyb overvejelse.
Tænketilstand: Hvornår aktiveres
Tænkning til
Komplekse ræsonneringsopgaver, matematiske problemer, flertrinplanlægning, kodearkitekturbeslutninger. Værd at tage den ekstra latency for nøjagtighed.
Tænkning fra
Latency-sensitive applikationer, simple forespørgsler, højgennemløbs-pipelines, real-time interaktioner. Hurtig respons uden overvejelsesoverhead.
Sådan aktiverer du tænketilstand
response = client.chat.completions.create(
model="gemma-4-31B-it",
messages=[{"role": "user", "content": "Your prompt"}],
extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)Sæt enable_thinking til true via chat_template_kwargs. Med OpenAI SDK'et angiver du det i extra_body; ved direkte API-kald placeres det på øverste niveau. Reasoning-dokumentation
Prissætning
Apache 2.0-licenseret med transparent forbrugsbaseret prissætning. Ingen skjulte gebyrer.
| Model | Input (pr. 1M) | Output (pr. 1M) | Kontekst |
|---|---|---|---|
| Gemma 4 31B (Infercom) | €0.20 | €0.35 | 128K |
Priser i EUR ekskl. moms. EU-suveræn deployment med fuld GDPR-overholdelse.
EU-suveræn deployment
Gemma 4 31B kører på Infercoms dedikerede EU-infrastruktur. Dine data forlader aldrig europæisk jurisdiktion.
- Hostet i Tyskland (Equinix München 4)
- Fuld GDPR-overholdelse med EU-baseret DPO
- Ingen US CLOUD Act-eksponering
- ISO 27001-certificeret infrastruktur
- Databehandlingsaftale tilgængelig
Kom i gang med Gemma 4
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gemma-4-31B-it",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)Drop-in OpenAI API-kompatibilitet. Skift din base URL og begynd at bruge Gemma 4 på få minutter. Ingen kodeændringer nødvendige.
Betal efter forbrug uden forpligtelser.
Ofte stillede spørgsmål
199 tokens per sekund i output-throughput og 1.189 ms Time to First Token, begge serverside-p50 målt ved 10K input / 1K output på vores produktions-API i München. Gemma 4 giver lidt rå hastighed op til gengæld for at forstå billede og tekst nativt i én model. Har du kun brug for tekst, måler gpt-oss-120b 713 tok/s på samme infrastruktur. Hvert tal kan reproduceres med vores open source-benchmarkværktøj.
Se alle benchmarksGemma 4 31B er Google DeepMinds mest kapable dense open model, bygget på samme forskningsfundament som Gemini 3. Den har 31 milliarder parametre, 128K kontekstvindue, native multimodale funktioner (tekst og vision) og konfigurerbar tænketilstand til komplekse ræsonneringsopgaver.
Ja. Gemma 4 31B behandler native både tekst og billeder i samme kontekst. Dette muliggør dokumentforståelse, visuel analyse, diagramudtrækning og struktureret dataoutput fra billeder uden at kræve separate vision-modeller.
Ja. Google udgav Gemma 4 under Apache 2.0-licensen - den første Gemma-generation under en OSI-godkendt open source-licens. Vægtene er offentlige og må frit bruges, ændres og udrulles kommercielt uden en separat aftale. Gennem Infercom betyder det blot, at vi hoster og driver Gemma 4 for dig på EU-infrastruktur.
Hvad open-weight faktisk betyderGemma 4 repræsenterer et betydeligt spring fra Gemma 3 med frontier-klasse benchmark-scorer: 85,2% på MMLU Pro, 89,2% på AIME 2026 matematisk ræsonnement og 80% på LiveCodeBench v6. Den tilføjer native multimodale funktioner, konfigurerbar tænketilstand og forbedret agentisk workflow-support med native funktionskald.
Tænketilstand er en konfigurerbar funktion, der muliggør dybere ræsonnement for komplekse opgaver. Når den er aktiveret, overvejer Gemma 4 før den svarer på flertrinsproblemer, matematisk ræsonnement og kodearkitekturbeslutninger. Aktivér den ved at sende enable_thinking: true via chat_template_kwargs (i extra_body med OpenAI SDK'et, eller på øverste niveau ved direkte API-kald). For latency-sensitive applikationer lader du den være slået fra for hurtigere svar.
Ja. Infercom kører Gemma 4 31B på dedikeret infrastruktur i Tyskland (Equinix München 4). Dine data forlader aldrig europæisk jurisdiktion, med fuld GDPR-overholdelse, ingen US CLOUD Act-eksponering og ISO 27001-certificeret infrastruktur. En databehandlingsaftale er tilgængelig på forespørgsel.
faq.q5.ctaBetaling per token uden minimum og uden månedlig binding: 0,20 EUR per million input-tokens og 0,35 EUR per million output-tokens, med et 128K kontekstvindue. Du betaler kun for det, du bruger, og forbrug og omkostninger kan følges live i cloud-portalen.
Se de fulde priserRelaterede ressourcer
Ydelsestest
Målt latency og gennemløb på vores infrastruktur.
Agentisk kodningsguide
Brug Gemma 4 som en lokal kodeassistent.
gpt-oss-120b
Vores hurtigste model, når du kun har brug for tekst.
MiniMax M2.7 Ultraspeed
Frontier-reasoning til lange agentiske kørsler.
EU-suveræn AI
Hvor dine data ligger, og hvem der kan nå dem.
Prisdetaljer
Komplet prissætning for alle modeller.