Gemma 4 31B API in Europa

Googles leistungsfähigstes offenes Dense-Modell: multimodal und in der EU gehostet.

Reasoning auf Frontier-Niveau, native Multimodalität und Coding-Leistung, die für die Produktion taugt. Gemma 4 entstand auf derselben Forschungsgrundlage wie Gemini 3 und läuft jetzt auf EU-souveräner Infrastruktur.

Warum Gemma 4 31B

Das leistungsfähigste offene Modell von Google DeepMind mit Dense-Architektur verbindet fortgeschrittenes Reasoning mit multimodalem Verständnis. Es eignet sich besonders für agentische Workflows, die Geschwindigkeit und Intelligenz zugleich brauchen.

Fortgeschrittenes Reasoning

Ein einstellbarer Denkmodus für mehrstufige Planung und komplexe Probleme. Sie legen die Reasoning-Tiefe danach fest, ob Ihr Workload gründliches Abwägen oder schnelle Antworten braucht.

Nativ multimodal

Text und Bilder gemeinsam verarbeiten: für das Verständnis von Dokumenten, visuelle Analysen, das Auslesen von Diagrammen und strukturierte Datenausgabe. Ideal für Workflows, die Bildverständnis und Reasoning verbinden.

Agentische Workflows

Natives Function Calling, strukturierte JSON-Ausgabe und Unterstützung für System-Prompts. Bauen Sie autonome Agenten, die zuverlässig mit Tools und APIs arbeiten, etwa mit Frameworks wie OpenClaw und CrewAI.

Einstellbarer Denkmodus

Schalten Sie den Denkmodus je nach Aufgabe ein oder aus. Für komplexes Reasoning schalten Sie ihn ein, für latenzkritische Anwendungen mit schnellen Antworten aus.

31B

Parameter (Dense)

30%+

Schneller als GPU-Anbieter

im Vergleich zum schnellsten GPU-basierten Anbieter (Artificial Analysis, Juli 2026)

EU-souverän München, Deutschland

Gemessen auf der EU-Infrastruktur von Infercom

Ausgabe-Durchsatz

199tok/s

Time to First Token

1189ms

Kontextfenster

128KToken

Serverseitig p50, 10K Input / 1K Output, einzelner Request

Zuletzt gemessen: July 2026.

Alle Benchmarks und die Methodik ansehen

Benchmark-Ergebnisse

Werte auf Frontier-Niveau in Benchmarks für Reasoning, Coding und Wissen. Alle Werte stammen aus der Evaluierung von Google DeepMind.

MMLU Pro

85.2%

Fortgeschrittenes Wissens-Reasoning

AIME 2026

89.2%

Mathematisches Reasoning (ohne Tools)

LiveCodeBench v6

80.0%

Coding-Aufgaben aus der Produktion

GPQA Diamond

84.3%

Naturwissenschaftliche Fragen auf Hochschulniveau

Codeforces ELO

2150

Wettbewerbsprogrammierung

Wann sich Gemma 4 31B eignet

Gemma 4 ist stark bei Aufgaben, die Reasoning, Bildverständnis oder agentische Fähigkeiten verlangen. Die Dense-Architektur macht Fine-Tuning und Deployment effizient.

Code-Assistent

Coding für die Produktion

Machen Sie jede Workstation zum Code-Assistenten auf Frontier-Niveau. Die starken Ergebnisse in LiveCodeBench und Codeforces machen Gemma 4 zu einer guten Wahl für Agentic Coding mit Claude Code oder ähnlichen Tools.

Agentic Coding einrichten

Dokumentenverarbeitung

Vision + Reasoning

Extrahieren Sie strukturierte Daten aus Diagrammen, Dokumenten und Screenshots. Das Modell verbindet Bildverständnis mit Reasoning und liefert sauberes JSON für automatisierte Workflows.

Agentische KI

Autonome Agenten

Natives Function Calling und Tool-Nutzung ermöglichen autonome Agenten, die mit APIs und externen Diensten arbeiten. Kompatibel mit OpenClaw, CrewAI und anderen Multi-Agent-Frameworks.

Komplexe Aufgaben

Mathematisches und wissenschaftliches Reasoning

89,2% in AIME 2026 (mathematisches Reasoning) und 84,3% in GPQA Diamond (wissenschaftliche Fragen). Schalten Sie den Denkmodus für komplexe, mehrstufige Probleme ein, die gründliches Abwägen erfordern.

Denkmodus: wann Sie ihn einschalten

Denkmodus an

Komplexe Reasoning-Aufgaben, mathematische Probleme, mehrstufige Planung, Entscheidungen zur Code-Architektur. Hier lohnt sich die zusätzliche Latenz für mehr Genauigkeit.

Denkmodus aus

Latenzkritische Anwendungen, einfache Anfragen, Pipelines mit hohem Durchsatz, Interaktionen in Echtzeit. Schnelle Antworten ohne den Mehraufwand des Abwägens.

So schalten Sie den Denkmodus ein

response = client.chat.completions.create(
    model="gemma-4-31B-it",
    messages=[{"role": "user", "content": "Your prompt"}],
    extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)

Setzen Sie enable_thinking über chat_template_kwargs auf true. Mit dem OpenAI SDK übergeben Sie den Parameter in extra_body, bei direkten API-Aufrufen auf oberster Ebene. Dokumentation zu Reasoning

Preise

Lizenziert unter Apache 2.0, mit transparenter Abrechnung nach Nutzung. Keine versteckten Gebühren.

ModellInput (pro 1M)Output (pro 1M)Kontext
Gemma 4 31B (Infercom)€0,20€0,35128K

Preise in EUR zzgl. MwSt. EU-souveräner Betrieb, vollständig DSGVO-konform.

EU-souveränes Deployment

Gemma 4 31B läuft auf der dedizierten EU-Infrastruktur von Infercom. Ihre Daten verlassen nie die europäische Jurisdiktion.

  • Gehostet in Deutschland (Equinix München 4)
  • Vollständig DSGVO-konform
  • Nicht dem US CLOUD Act ausgesetzt
  • Nach ISO 27001 zertifizierte Infrastruktur
  • Auftragsverarbeitungsvertrag verfügbar
ISO 27001
DSGVO-konform
Deutschland
RDUs von SambaNova

Mit Gemma 4 starten

quickstart.py
from openai import OpenAI

client = OpenAI(
    api_key="your-infercom-key",
    base_url="https://api.infercom.ai/v1"
)

response = client.chat.completions.create(
    model="gemma-4-31B-it",
    messages=[{"role": "user", "content": "Your prompt here"}],
    max_tokens=4096
)

print(response.choices[0].message.content)

Kompatibel mit der OpenAI API: Ändern Sie die Base URL und nutzen Sie Gemma 4 in wenigen Minuten. Weitere Codeänderungen sind nicht nötig.

Pay-as-you-go ohne Vertragsbindung.

Häufige Fragen

Wie schnell ist Gemma 4 bei Infercom?

199 Token pro Sekunde Ausgabe-Durchsatz und 1189ms Time to First Token, beides serverseitig als p50 gemessen, bei 10K Input und 1K Output auf unserer Produktions-API in München. Gemma 4 gibt etwas reine Geschwindigkeit auf und versteht dafür Bild und Text in einem einzigen Modell. Wenn Sie nur Text brauchen, erreicht gpt-oss-120b auf derselben Infrastruktur 713 tok/s. Jeden Wert können Sie mit unserem Open-Source-Benchmark-Tool nachmessen.

Alle Benchmarks ansehen
Was ist Gemma 4 31B?

Gemma 4 31B ist das leistungsfähigste offene Dense-Modell von Google DeepMind und entstand auf derselben Forschungsgrundlage wie Gemini 3. Es hat 31 Milliarden Parameter, ein Kontextfenster von 128K, native Multimodalität (Text und Bild) und einen einstellbaren Denkmodus für komplexe Reasoning-Aufgaben.

Ist Gemma 4 multimodal?

Ja. Gemma 4 31B verarbeitet Text und Bilder nativ im selben Kontext. So kann es Dokumente verstehen, Bilder analysieren, Diagramme auslesen und strukturierte Daten aus Bildern liefern, ohne dass Sie ein separates Vision-Modell brauchen.

Ist Gemma 4 ein Open-Weight-Modell? Welche Lizenz gilt?

Ja. Google hat Gemma 4 unter der Apache-2.0-Lizenz veröffentlicht. Es ist die erste Gemma-Generation unter einer von der OSI anerkannten Open-Source-Lizenz. Die Gewichte sind öffentlich und dürfen ohne gesonderte Vereinbarung kommerziell genutzt, verändert und eingesetzt werden. Über Infercom heißt das nur: Wir hosten und betreiben Gemma 4 für Sie auf EU-Infrastruktur.

Was ein Open-Weight-Modell ist
Was unterscheidet Gemma 4 von Gemma 3?

Gemma 4 ist ein großer Schritt nach vorn gegenüber Gemma 3, mit Benchmark-Werten auf Frontier-Niveau: 85,2% in MMLU Pro, 89,2% in AIME 2026 (mathematisches Reasoning) und 80% in LiveCodeBench v6. Neu sind native Multimodalität, ein einstellbarer Denkmodus und bessere Unterstützung für agentische Workflows mit nativem Function Calling.

Was ist der Denkmodus, und wie schalte ich ihn ein?

Der Denkmodus ist eine einstellbare Funktion für gründlicheres Reasoning bei komplexen Aufgaben. Ist er eingeschaltet, wägt Gemma 4 ab, bevor es auf mehrstufige Probleme, mathematische Fragen oder Entscheidungen zur Code-Architektur antwortet. Sie schalten ihn ein, indem Sie enable_thinking: true über chat_template_kwargs übergeben (mit dem OpenAI SDK in extra_body, bei direkten API-Aufrufen auf oberster Ebene). Für latenzkritische Anwendungen lassen Sie ihn aus, dann kommen die Antworten schneller.

Werden meine Daten in der EU gespeichert?

Ja. Infercom betreibt Gemma 4 31B auf dedizierter Infrastruktur in Deutschland (Equinix München 4). Ihre Daten verlassen nie die europäische Jurisdiktion. Die Verarbeitung ist vollständig DSGVO-konform und nicht dem US CLOUD Act ausgesetzt, und die Infrastruktur ist nach ISO 27001 zertifiziert. Ein Auftragsverarbeitungsvertrag ist auf Anfrage erhältlich.

So funktioniert EU-Souveränität bei uns
Was kostet Gemma 4 31B?

Sie zahlen pro Token, ohne Mindestumsatz und ohne monatliche Bindung: €0,20 pro Million Input-Token und €0,35 pro Million Output-Token (zzgl. MwSt.), mit einem Kontextfenster von 128K. Abgerechnet wird nur, was Sie nutzen. Verbrauch und Kosten sehen Sie live im Cloud-Portal.

Alle Preise ansehen

Bereit, die Zukunft der KI in Europa zu gestalten?

Schließen Sie sich Unternehmen an, die souveräne KI mit erstklassiger Performance einsetzen