Gemma 4 31B API i Europa

Googles mest kapable åbne dense-model: multimodal og hostet i EU.

Ræsonnering på frontier-niveau, indbygget multimodalitet og kodeydelse, der holder i produktion. Gemma 4 bygger på samme forskningsgrundlag som Gemini 3 og kører nu på EU-suveræn infrastruktur.

Derfor Gemma 4 31B

Google DeepMinds mest kapable åbne model med dense-arkitektur kombinerer avanceret ræsonnering med multimodal forståelse. Den passer især til agentiske workflows, der kræver både hastighed og intelligens.

Avanceret ræsonnering

En justerbar tænketilstand til planlægning i flere trin og komplekse problemer. Du vælger ræsonneringsdybden efter, om dit workload kræver grundig overvejelse eller hurtige svar.

Indbygget multimodal

Behandl tekst og billeder sammen til dokumentforståelse, visuel analyse, udtræk fra diagrammer og struktureret dataoutput. Ideelt til workflows, der kombinerer billedforståelse og ræsonnering.

Agentiske workflows

Indbygget function calling, struktureret JSON-output og understøttelse af systemprompts. Byg autonome agenter, der arbejder pålideligt med værktøjer og API'er, for eksempel med frameworks som OpenClaw og CrewAI.

Justerbar tænketilstand

Slå tænketilstanden til eller fra efter opgaven. Slå den til ved kompleks ræsonnering, og slå den fra i latenskritiske applikationer, der skal svare hurtigt.

31B

Parametre (dense)

30%+

Hurtigere end GPU-udbydere

sammenlignet med den hurtigste GPU-baserede udbyder (Artificial Analysis, juli 2026)

EU-suveræn München, Tyskland

Målt på Infercoms infrastruktur i EU

Output-throughput

199tok/s

Time to First Token

1189ms

Kontekstvindue

128Ktokens

Serverside p50, 10K input / 1K output, én forespørgsel

Senest målt: July 2026.

Se alle benchmarks og metoden

Benchmarkresultater

Resultater på frontier-niveau i benchmarks for ræsonnering, kode og viden. Alle resultater stammer fra Google DeepMinds evaluering.

MMLU Pro

85.2%

Avanceret vidensræsonnering

AIME 2026

89.2%

Matematisk ræsonnering (uden værktøjer)

LiveCodeBench v6

80.0%

Kodeopgaver fra produktion

GPQA Diamond

84.3%

Naturvidenskabelige spørgsmål på universitetsniveau

Codeforces ELO

2150

Konkurrenceprogrammering

Hvornår Gemma 4 31B passer

Gemma 4 er stærk til opgaver, der kræver ræsonnering, billedforståelse eller agentiske evner. Dense-arkitekturen gør fine-tuning og deployment effektivt.

Kodeassistent

Kode til produktion

Gør enhver arbejdsstation til en kodeassistent på frontier-niveau. De stærke resultater i LiveCodeBench og Codeforces gør Gemma 4 til et godt valg til agentic coding med Claude Code eller lignende værktøjer.

Sæt agentic coding op

Dokumentbehandling

Vision + Reasoning

Udtræk strukturerede data fra diagrammer, dokumenter og skærmbilleder. Modellen kombinerer billedforståelse med ræsonnering og leverer rent JSON til automatiserede workflows.

Agentisk AI

Autonome agenter

Indbygget function calling og brug af værktøjer gør det muligt at bygge autonome agenter, der arbejder med API'er og eksterne tjenester. Kompatibel med OpenClaw, CrewAI og andre multi-agent-frameworks.

Komplekse opgaver

Matematisk og videnskabelig ræsonnering

89,2% i AIME 2026 (matematisk ræsonnering) og 84,3% i GPQA Diamond (videnskabelige spørgsmål). Slå tænketilstanden til ved komplekse problemer i flere trin, der kræver grundig overvejelse.

Tænketilstand: hvornår du skal slå den til

Tænketilstand til

Komplekse ræsonneringsopgaver, matematiske problemer, planlægning i flere trin, beslutninger om kodearkitektur. Her er den ekstra latens prisen værd for mere præcision.

Tænketilstand fra

Latenskritiske applikationer, enkle forespørgsler, pipelines med høj throughput, interaktioner i realtid. Hurtige svar uden ekstra tid til overvejelse.

Sådan slår du tænketilstanden til

response = client.chat.completions.create(
    model="gemma-4-31B-it",
    messages=[{"role": "user", "content": "Your prompt"}],
    extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)

Sæt enable_thinking til true via chat_template_kwargs. Med OpenAI SDK'et sender du parameteren i extra_body, ved direkte API-kald på øverste niveau. Dokumentation om ræsonnering

Priser

Licenseret under Apache 2.0 med gennemsigtig, forbrugsbaseret afregning. Ingen skjulte gebyrer.

ModelInput (per 1M)Output (per 1M)Kontekst
Gemma 4 31B (Infercom)€0,20€0,35128K

Priser i EUR ekskl. moms. EU-suveræn drift, fuldt GDPR-kompatibel.

EU-suveræn deployment

Gemma 4 31B kører på Infercoms dedikerede infrastruktur i EU. Dine data forlader aldrig europæisk jurisdiktion.

  • Hostet i Tyskland (Equinix München 4)
  • Fuldt GDPR-kompatibel
  • Ikke omfattet af US CLOUD Act
  • ISO 27001-certificeret infrastruktur
  • Databehandleraftale tilgængelig
ISO 27001
GDPR-kompatibel
Tyskland
SambaNova RDU'er

Kom i gang med Gemma 4

quickstart.py
from openai import OpenAI

client = OpenAI(
    api_key="your-infercom-key",
    base_url="https://api.infercom.ai/v1"
)

response = client.chat.completions.create(
    model="gemma-4-31B-it",
    messages=[{"role": "user", "content": "Your prompt here"}],
    max_tokens=4096
)

print(response.choices[0].message.content)

Kompatibel med OpenAI API'et: Skift din base URL, og brug Gemma 4 på få minutter. Andre kodeændringer er ikke nødvendige.

Pay-as-you-go uden binding.

Ofte stillede spørgsmål

Hvor hurtig er Gemma 4 hos Infercom?

199 tokens per sekund i output-throughput og 1.189ms time to first token, begge målt serverside som p50 ved 10K input og 1K output på vores produktions-API i München. Gemma 4 opgiver lidt rå hastighed til gengæld for at forstå billeder og tekst i én model. Hvis du kun har brug for tekst, måler gpt-oss-120b 713 tok/s på samme infrastruktur. Du kan selv eftermåle hvert tal med vores open source-benchmarkværktøj.

Se alle benchmarks
Hvad er Gemma 4 31B?

Gemma 4 31B er Google DeepMinds mest kapable åbne dense-model og bygger på samme forskningsgrundlag som Gemini 3. Den har 31 milliarder parametre, et kontekstvindue på 128K, indbygget multimodalitet (tekst og billeder) og en justerbar tænketilstand til komplekse ræsonneringsopgaver.

Er Gemma 4 multimodal?

Ja. Gemma 4 31B behandler både tekst og billeder direkte i samme kontekst. Den kan derfor forstå dokumenter, analysere billeder, aflæse diagrammer og levere strukturerede data fra billeder, uden at du skal bruge en separat vision-model.

Er Gemma 4 en open-weight-model? Hvilken licens gælder?

Ja. Google har udgivet Gemma 4 under Apache 2.0-licensen som den første Gemma-generation under en OSI-godkendt open source-licens. Vægtene er offentlige og må bruges, ændres og deployes kommercielt uden en særskilt aftale. At køre Gemma 4 gennem Infercom betyder, at vi hoster og driver den for dig på infrastruktur i EU.

Hvad en open-weight-model er
Hvad adskiller Gemma 4 fra Gemma 3?

Gemma 4 er et stort skridt frem fra Gemma 3 med benchmarkresultater på frontier-niveau: 85,2% i MMLU Pro, 89,2% i AIME 2026 (matematisk ræsonnering) og 80% i LiveCodeBench v6. Nyt er indbygget multimodalitet, en justerbar tænketilstand og bedre understøttelse af agentiske workflows med indbygget function calling.

Hvad er tænketilstanden, og hvordan slår jeg den til?

Tænketilstanden er en justerbar funktion til grundigere ræsonnering ved komplekse opgaver. Når den er slået til, overvejer Gemma 4, før den svarer på problemer i flere trin, matematiske spørgsmål eller beslutninger om kodearkitektur. Du slår den til ved at sende enable_thinking: true via chat_template_kwargs (i extra_body med OpenAI SDK'et, på øverste niveau ved direkte API-kald). I latenskritiske applikationer lader du den være slået fra, så svarene kommer hurtigere.

Bliver mine data opbevaret i EU?

Ja. Infercom kører Gemma 4 31B på dedikeret infrastruktur i Tyskland (Equinix München 4). Dine data forlader aldrig europæisk jurisdiktion. Behandlingen er fuldt GDPR-kompatibel og ikke omfattet af US CLOUD Act, og infrastrukturen er ISO 27001-certificeret. En databehandleraftale kan fås på forespørgsel.

Sådan fungerer EU-suverænitet hos os
Hvad koster Gemma 4 31B?

Du betaler per token uden minimumsforbrug og uden månedlig binding: €0,20 per million input-tokens og €0,35 per million output-tokens (ekskl. moms) med et kontekstvindue på 128K. Du afregner kun for det, du bruger, og forbrug og udgifter kan følges live i cloud-portalen.

Se alle priser

Klar til at bygge fremtidens AI i Europa?

Slut dig til virksomheder, der bruger suveræn AI med performance i topklasse