Gemma 4 31B API in Europa
Googles leistungsfähigstes offenes Dense-Modell: multimodal und in der EU gehostet.
Reasoning auf Frontier-Niveau, native Multimodalität und Coding-Leistung, die für die Produktion taugt. Gemma 4 entstand auf derselben Forschungsgrundlage wie Gemini 3 und läuft jetzt auf EU-souveräner Infrastruktur.
Warum Gemma 4 31B
Das leistungsfähigste offene Modell von Google DeepMind mit Dense-Architektur verbindet fortgeschrittenes Reasoning mit multimodalem Verständnis. Es eignet sich besonders für agentische Workflows, die Geschwindigkeit und Intelligenz zugleich brauchen.
Fortgeschrittenes Reasoning
Ein einstellbarer Denkmodus für mehrstufige Planung und komplexe Probleme. Sie legen die Reasoning-Tiefe danach fest, ob Ihr Workload gründliches Abwägen oder schnelle Antworten braucht.
Nativ multimodal
Text und Bilder gemeinsam verarbeiten: für das Verständnis von Dokumenten, visuelle Analysen, das Auslesen von Diagrammen und strukturierte Datenausgabe. Ideal für Workflows, die Bildverständnis und Reasoning verbinden.
Agentische Workflows
Natives Function Calling, strukturierte JSON-Ausgabe und Unterstützung für System-Prompts. Bauen Sie autonome Agenten, die zuverlässig mit Tools und APIs arbeiten, etwa mit Frameworks wie OpenClaw und CrewAI.
Einstellbarer Denkmodus
Schalten Sie den Denkmodus je nach Aufgabe ein oder aus. Für komplexes Reasoning schalten Sie ihn ein, für latenzkritische Anwendungen mit schnellen Antworten aus.
31B
Parameter (Dense)
128K
30%+
Schneller als GPU-Anbieter
im Vergleich zum schnellsten GPU-basierten Anbieter (Artificial Analysis, Juli 2026)
Gemessen auf der EU-Infrastruktur von Infercom
Ausgabe-Durchsatz
199tok/s
Time to First Token
1189ms
Kontextfenster
128KToken
Serverseitig p50, 10K Input / 1K Output, einzelner Request
Zuletzt gemessen: July 2026.
Alle Benchmarks und die Methodik ansehenMehr dazu in unserem Glossar
Benchmark-Ergebnisse
Werte auf Frontier-Niveau in Benchmarks für Reasoning, Coding und Wissen. Alle Werte stammen aus der Evaluierung von Google DeepMind.
MMLU Pro
85.2%
Fortgeschrittenes Wissens-Reasoning
AIME 2026
89.2%
Mathematisches Reasoning (ohne Tools)
LiveCodeBench v6
80.0%
Coding-Aufgaben aus der Produktion
GPQA Diamond
84.3%
Naturwissenschaftliche Fragen auf Hochschulniveau
Codeforces ELO
2150
Wettbewerbsprogrammierung
Wann sich Gemma 4 31B eignet
Gemma 4 ist stark bei Aufgaben, die Reasoning, Bildverständnis oder agentische Fähigkeiten verlangen. Die Dense-Architektur macht Fine-Tuning und Deployment effizient.
Code-Assistent
Coding für die Produktion
Machen Sie jede Workstation zum Code-Assistenten auf Frontier-Niveau. Die starken Ergebnisse in LiveCodeBench und Codeforces machen Gemma 4 zu einer guten Wahl für Agentic Coding mit Claude Code oder ähnlichen Tools.
Agentic Coding einrichtenDokumentenverarbeitung
Vision + Reasoning
Extrahieren Sie strukturierte Daten aus Diagrammen, Dokumenten und Screenshots. Das Modell verbindet Bildverständnis mit Reasoning und liefert sauberes JSON für automatisierte Workflows.
Agentische KI
Autonome Agenten
Natives Function Calling und Tool-Nutzung ermöglichen autonome Agenten, die mit APIs und externen Diensten arbeiten. Kompatibel mit OpenClaw, CrewAI und anderen Multi-Agent-Frameworks.
Komplexe Aufgaben
Mathematisches und wissenschaftliches Reasoning
89,2% in AIME 2026 (mathematisches Reasoning) und 84,3% in GPQA Diamond (wissenschaftliche Fragen). Schalten Sie den Denkmodus für komplexe, mehrstufige Probleme ein, die gründliches Abwägen erfordern.
Denkmodus: wann Sie ihn einschalten
Denkmodus an
Komplexe Reasoning-Aufgaben, mathematische Probleme, mehrstufige Planung, Entscheidungen zur Code-Architektur. Hier lohnt sich die zusätzliche Latenz für mehr Genauigkeit.
Denkmodus aus
Latenzkritische Anwendungen, einfache Anfragen, Pipelines mit hohem Durchsatz, Interaktionen in Echtzeit. Schnelle Antworten ohne den Mehraufwand des Abwägens.
So schalten Sie den Denkmodus ein
response = client.chat.completions.create(
model="gemma-4-31B-it",
messages=[{"role": "user", "content": "Your prompt"}],
extra_body={"chat_template_kwargs": {"enable_thinking": True}},
)Setzen Sie enable_thinking über chat_template_kwargs auf true. Mit dem OpenAI SDK übergeben Sie den Parameter in extra_body, bei direkten API-Aufrufen auf oberster Ebene. Dokumentation zu Reasoning
Preise
Lizenziert unter Apache 2.0, mit transparenter Abrechnung nach Nutzung. Keine versteckten Gebühren.
| Modell | Input (pro 1M) | Output (pro 1M) | Kontext |
|---|---|---|---|
| Gemma 4 31B (Infercom) | €0,20 | €0,35 | 128K |
Preise in EUR zzgl. MwSt. EU-souveräner Betrieb, vollständig DSGVO-konform.
EU-souveränes Deployment
Gemma 4 31B läuft auf der dedizierten EU-Infrastruktur von Infercom. Ihre Daten verlassen nie die europäische Jurisdiktion.
- Gehostet in Deutschland (Equinix München 4)
- Vollständig DSGVO-konform
- Nicht dem US CLOUD Act ausgesetzt
- Nach ISO 27001 zertifizierte Infrastruktur
- Auftragsverarbeitungsvertrag verfügbar
Mit Gemma 4 starten
from openai import OpenAI
client = OpenAI(
api_key="your-infercom-key",
base_url="https://api.infercom.ai/v1"
)
response = client.chat.completions.create(
model="gemma-4-31B-it",
messages=[{"role": "user", "content": "Your prompt here"}],
max_tokens=4096
)
print(response.choices[0].message.content)Kompatibel mit der OpenAI API: Ändern Sie die Base URL und nutzen Sie Gemma 4 in wenigen Minuten. Weitere Codeänderungen sind nicht nötig.
Pay-as-you-go ohne Vertragsbindung.
Häufige Fragen
Wie schnell ist Gemma 4 bei Infercom?
199 Token pro Sekunde Ausgabe-Durchsatz und 1189ms Time to First Token, beides serverseitig als p50 gemessen, bei 10K Input und 1K Output auf unserer Produktions-API in München. Gemma 4 gibt etwas reine Geschwindigkeit auf und versteht dafür Bild und Text in einem einzigen Modell. Wenn Sie nur Text brauchen, erreicht gpt-oss-120b auf derselben Infrastruktur 713 tok/s. Jeden Wert können Sie mit unserem Open-Source-Benchmark-Tool nachmessen.
Alle Benchmarks ansehenWas ist Gemma 4 31B?
Gemma 4 31B ist das leistungsfähigste offene Dense-Modell von Google DeepMind und entstand auf derselben Forschungsgrundlage wie Gemini 3. Es hat 31 Milliarden Parameter, ein Kontextfenster von 128K, native Multimodalität (Text und Bild) und einen einstellbaren Denkmodus für komplexe Reasoning-Aufgaben.
Ist Gemma 4 multimodal?
Ja. Gemma 4 31B verarbeitet Text und Bilder nativ im selben Kontext. So kann es Dokumente verstehen, Bilder analysieren, Diagramme auslesen und strukturierte Daten aus Bildern liefern, ohne dass Sie ein separates Vision-Modell brauchen.
Ist Gemma 4 ein Open-Weight-Modell? Welche Lizenz gilt?
Ja. Google hat Gemma 4 unter der Apache-2.0-Lizenz veröffentlicht. Es ist die erste Gemma-Generation unter einer von der OSI anerkannten Open-Source-Lizenz. Die Gewichte sind öffentlich und dürfen ohne gesonderte Vereinbarung kommerziell genutzt, verändert und eingesetzt werden. Über Infercom heißt das nur: Wir hosten und betreiben Gemma 4 für Sie auf EU-Infrastruktur.
Was ein Open-Weight-Modell istWas unterscheidet Gemma 4 von Gemma 3?
Gemma 4 ist ein großer Schritt nach vorn gegenüber Gemma 3, mit Benchmark-Werten auf Frontier-Niveau: 85,2% in MMLU Pro, 89,2% in AIME 2026 (mathematisches Reasoning) und 80% in LiveCodeBench v6. Neu sind native Multimodalität, ein einstellbarer Denkmodus und bessere Unterstützung für agentische Workflows mit nativem Function Calling.
Was ist der Denkmodus, und wie schalte ich ihn ein?
Der Denkmodus ist eine einstellbare Funktion für gründlicheres Reasoning bei komplexen Aufgaben. Ist er eingeschaltet, wägt Gemma 4 ab, bevor es auf mehrstufige Probleme, mathematische Fragen oder Entscheidungen zur Code-Architektur antwortet. Sie schalten ihn ein, indem Sie enable_thinking: true über chat_template_kwargs übergeben (mit dem OpenAI SDK in extra_body, bei direkten API-Aufrufen auf oberster Ebene). Für latenzkritische Anwendungen lassen Sie ihn aus, dann kommen die Antworten schneller.
Werden meine Daten in der EU gespeichert?
Ja. Infercom betreibt Gemma 4 31B auf dedizierter Infrastruktur in Deutschland (Equinix München 4). Ihre Daten verlassen nie die europäische Jurisdiktion. Die Verarbeitung ist vollständig DSGVO-konform und nicht dem US CLOUD Act ausgesetzt, und die Infrastruktur ist nach ISO 27001 zertifiziert. Ein Auftragsverarbeitungsvertrag ist auf Anfrage erhältlich.
So funktioniert EU-Souveränität bei unsWas kostet Gemma 4 31B?
Sie zahlen pro Token, ohne Mindestumsatz und ohne monatliche Bindung: €0,20 pro Million Input-Token und €0,35 pro Million Output-Token (zzgl. MwSt.), mit einem Kontextfenster von 128K. Abgerechnet wird nur, was Sie nutzen. Verbrauch und Kosten sehen Sie live im Cloud-Portal.
Alle Preise ansehenWeiterführende Ressourcen
Performance-Benchmarks
Gemessene Latenz und gemessener Durchsatz auf unserer Infrastruktur.
Anleitung für Agentic Coding
Gemma 4 als Code-Assistenten nach dem Local-first-Prinzip nutzen.
gpt-oss-120b
Unser schnellstes Modell, wenn Sie nur Text brauchen.
MiniMax M2.7 Ultraspeed
Frontier-Reasoning für lange agentische Läufe.
EU-souveräne KI
Wo Ihre Daten liegen und wer darauf zugreifen kann.
Preisdetails
Alle Preise für alle Modelle.