Gemma 4 31B API i Europa
Googles mest kapable åbne dense-model: multimodal og hostet i EU.
Ræsonnering på frontier-niveau, indbygget multimodalitet og kodeydelse, der holder i produktion. Gemma 4 bygger på samme forskningsgrundlag som Gemini 3 og kører nu på EU-suveræn infrastruktur.
Derfor Gemma 4 31B
Google DeepMinds mest kapable åbne model med dense-arkitektur kombinerer avanceret ræsonnering med multimodal forståelse. Den passer især til agentiske workflows, der kræver både hastighed og intelligens.
Avanceret ræsonnering
En justerbar tænketilstand til planlægning i flere trin og komplekse problemer. Du vælger ræsonneringsdybden efter, om dit workload kræver grundig overvejelse eller hurtige svar.
Indbygget multimodal
Behandl tekst og billeder sammen til dokumentforståelse, visuel analyse, udtræk fra diagrammer og struktureret dataoutput. Ideelt til workflows, der kombinerer billedforståelse og ræsonnering.
Agentiske workflows
Indbygget function calling, struktureret JSON-output og understøttelse af systemprompts. Byg autonome agenter, der arbejder pålideligt med værktøjer og API'er, for eksempel med frameworks som OpenClaw og CrewAI.
Justerbar tænketilstand
Slå tænketilstanden til eller fra efter opgaven. Slå den til ved kompleks ræsonnering, og slå den fra i latenskritiske applikationer, der skal svare hurtigt.
31B
Parametre (dense)
128K
30%+
Hurtigere end GPU-udbydere
sammenlignet med den hurtigste GPU-baserede udbyder (Artificial Analysis, juli 2026)
Målt på Infercoms infrastruktur i EU
Output-throughput
199tok/s
Time to First Token
1189ms
Kontekstvindue
128Ktokens
Serverside p50, 10K input / 1K output, én forespørgsel
Senest målt: July 2026.
Se alle benchmarks og metodenLæs mere i vores ordliste
Benchmarkresultater
Resultater på frontier-niveau i benchmarks for ræsonnering, kode og viden. Alle resultater stammer fra Google DeepMinds evaluering.
MMLU Pro
85.2%
Avanceret vidensræsonnering
AIME 2026
89.2%
Matematisk ræsonnering (uden værktøjer)
LiveCodeBench v6
80.0%
Kodeopgaver fra produktion
GPQA Diamond
84.3%
Naturvidenskabelige spørgsmål på universitetsniveau
Codeforces ELO
2150
Konkurrenceprogrammering
Hvornår Gemma 4 31B passer
Gemma 4 er stærk til opgaver, der kræver ræsonnering, billedforståelse eller agentiske evner. Dense-arkitekturen gør fine-tuning og deployment effektivt.
Kodeassistent
Kode til produktion
Gør enhver arbejdsstation til en kodeassistent på frontier-niveau. De stærke resultater i LiveCodeBench og Codeforces gør Gemma 4 til et godt valg til agentic coding med Claude Code eller lignende værktøjer.
Sæt agentic coding opDokumentbehandling
Vision + Reasoning
Udtræk strukturerede data fra diagrammer, dokumenter og skærmbilleder. Modellen kombinerer billedforståelse med ræsonnering og leverer rent JSON til automatiserede workflows.
Agentisk AI
Autonome agenter
Indbygget function calling og brug af værktøjer gør det muligt at bygge autonome agenter, der arbejder med API'er og eksterne tjenester. Kompatibel med OpenClaw, CrewAI og andre multi-agent-frameworks.
Komplekse opgaver
Matematisk og videnskabelig ræsonnering
89,2% i AIME 2026 (matematisk ræsonnering) og 84,3% i GPQA Diamond (videnskabelige spørgsmål). Slå tænketilstanden til ved komplekse problemer i flere trin, der kræver grundig overvejelse.
Tænketilstand: hvornår du skal slå den til
Tænketilstand til
Komplekse ræsonneringsopgaver, matematiske problemer, planlægning i flere trin, beslutninger om kodearkitektur. Her er den ekstra latens prisen værd for mere præcision.
Tænketilstand fra
Latenskritiske applikationer, enkle forespørgsler, pipelines med høj throughput, interaktioner i realtid. Hurtige svar uden ekstra tid til overvejelse.
Sådan slår du tænketilstanden til
response = client.chat.completions.create(
model="gemma-4-31B-it",
messages=[{"role": "user", "content": "Your prompt"}],
extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)Sæt enable_thinking til true via chat_template_kwargs. Med OpenAI SDK'et sender du parameteren i extra_body, ved direkte API-kald på øverste niveau. Dokumentation om ræsonnering
Priser
Licenseret under Apache 2.0 med gennemsigtig, forbrugsbaseret afregning. Ingen skjulte gebyrer.
| Model | Input (per 1M) | Output (per 1M) | Kontekst |
|---|---|---|---|
| Gemma 4 31B (Infercom) | €0,20 | €0,35 | 128K |
Priser i EUR ekskl. moms. EU-suveræn drift, fuldt GDPR-kompatibel.
EU-suveræn deployment
Gemma 4 31B kører på Infercoms dedikerede infrastruktur i EU. Dine data forlader aldrig europæisk jurisdiktion.
- Hostet i Tyskland (Equinix München 4)
- Fuldt GDPR-kompatibel
- Ikke omfattet af US CLOUD Act
- ISO 27001-certificeret infrastruktur
- Databehandleraftale tilgængelig
Kom i gang med Gemma 4
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gemma-4-31B-it",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)Kompatibel med OpenAI API'et: Skift din base URL, og brug Gemma 4 på få minutter. Andre kodeændringer er ikke nødvendige.
Pay-as-you-go uden binding.
Ofte stillede spørgsmål
Hvor hurtig er Gemma 4 hos Infercom?
199 tokens per sekund i output-throughput og 1.189ms time to first token, begge målt serverside som p50 ved 10K input og 1K output på vores produktions-API i München. Gemma 4 opgiver lidt rå hastighed til gengæld for at forstå billeder og tekst i én model. Hvis du kun har brug for tekst, måler gpt-oss-120b 713 tok/s på samme infrastruktur. Du kan selv eftermåle hvert tal med vores open source-benchmarkværktøj.
Se alle benchmarksHvad er Gemma 4 31B?
Gemma 4 31B er Google DeepMinds mest kapable åbne dense-model og bygger på samme forskningsgrundlag som Gemini 3. Den har 31 milliarder parametre, et kontekstvindue på 128K, indbygget multimodalitet (tekst og billeder) og en justerbar tænketilstand til komplekse ræsonneringsopgaver.
Er Gemma 4 multimodal?
Ja. Gemma 4 31B behandler både tekst og billeder direkte i samme kontekst. Den kan derfor forstå dokumenter, analysere billeder, aflæse diagrammer og levere strukturerede data fra billeder, uden at du skal bruge en separat vision-model.
Er Gemma 4 en open-weight-model? Hvilken licens gælder?
Ja. Google har udgivet Gemma 4 under Apache 2.0-licensen som den første Gemma-generation under en OSI-godkendt open source-licens. Vægtene er offentlige og må bruges, ændres og deployes kommercielt uden en særskilt aftale. At køre Gemma 4 gennem Infercom betyder, at vi hoster og driver den for dig på infrastruktur i EU.
Hvad en open-weight-model erHvad adskiller Gemma 4 fra Gemma 3?
Gemma 4 er et stort skridt frem fra Gemma 3 med benchmarkresultater på frontier-niveau: 85,2% i MMLU Pro, 89,2% i AIME 2026 (matematisk ræsonnering) og 80% i LiveCodeBench v6. Nyt er indbygget multimodalitet, en justerbar tænketilstand og bedre understøttelse af agentiske workflows med indbygget function calling.
Hvad er tænketilstanden, og hvordan slår jeg den til?
Tænketilstanden er en justerbar funktion til grundigere ræsonnering ved komplekse opgaver. Når den er slået til, overvejer Gemma 4, før den svarer på problemer i flere trin, matematiske spørgsmål eller beslutninger om kodearkitektur. Du slår den til ved at sende enable_thinking: true via chat_template_kwargs (i extra_body med OpenAI SDK'et, på øverste niveau ved direkte API-kald). I latenskritiske applikationer lader du den være slået fra, så svarene kommer hurtigere.
Bliver mine data opbevaret i EU?
Ja. Infercom kører Gemma 4 31B på dedikeret infrastruktur i Tyskland (Equinix München 4). Dine data forlader aldrig europæisk jurisdiktion. Behandlingen er fuldt GDPR-kompatibel og ikke omfattet af US CLOUD Act, og infrastrukturen er ISO 27001-certificeret. En databehandleraftale kan fås på forespørgsel.
Sådan fungerer EU-suverænitet hos osHvad koster Gemma 4 31B?
Du betaler per token uden minimumsforbrug og uden månedlig binding: €0,20 per million input-tokens og €0,35 per million output-tokens (ekskl. moms) med et kontekstvindue på 128K. Du afregner kun for det, du bruger, og forbrug og udgifter kan følges live i cloud-portalen.
Se alle priserRelaterede ressourcer
Performance-benchmarks
Målt latens og throughput på vores infrastruktur.
Guide til agentic coding
Brug Gemma 4 som local-first-kodeassistent.
gpt-oss-120b
Vores hurtigste model, når du kun har brug for tekst.
MiniMax M2.7 Ultraspeed
Frontier-ræsonnering til lange agentiske kørsler.
EU-suveræn AI
Hvor dine data ligger, og hvem der kan få adgang til dem.
Prisdetaljer
Alle priser for alle modeller.