Einfache, transparente Preise
Pay-as-you-go-Tarife für die Inference API. Keine Mindestabnahme, keine Verpflichtung - Sie zahlen nur für die Token, die Sie nutzen.
Preise der Inference API
Pay-per-Token-Tarife für unsere geteilte, EU-souveräne Inferenz-Plattform. Benötigen Sie reservierte Kapazität oder eigene Hardware? Diese beiden werden pro Engagement bepreist.
Inference API
Geteilte Infrastruktur, Pay-per-Token. Starten Sie in Minuten und skalieren Sie mit Ihrem Wachstum - keine Mindestabnahme, keine Verpflichtung.
So funktioniert die API-Preisgestaltung
Die Inference API wird pro Token abgerechnet. Ein Token entspricht im Englischen etwa 4 Zeichen (dies variiert je nach Modell und Sprache). Sie zahlen für das, was Sie nutzen - keine Mindestabnahme, keine Verpflichtungen.
Was ist ein Token?
Token sind die Grundeinheiten, die LLMs verarbeiten. Im Englischen entspricht 1 Token ≈ 4 Zeichen oder ¾ eines Wortes. 1.000 Wörter ≈ 1.300 Token. Andere Sprachen benötigen unter Umständen mehr Token pro Zeichen.
Input vs. Output
Sie zahlen separat für Input (Ihren Prompt) und Output (die Antwort des Modells). Output kostet mehr als Input, weil Ihr Prompt in einem einzigen parallelen Durchlauf gelesen wird, während jeder Output-Token einen eigenen vollständigen Durchlauf durch das Modell benötigt - ein Token nach dem anderen.
Ein Modell wählen
Jedes Modell glänzt bei unterschiedlichen Aufgaben - es gibt keine einzelne "beste" Wahl. EU-souveräne Modelle (🇪🇺) garantieren, dass Ihre Daten in europäischer Jurisdiktion bleiben.
EU-souveräne Modelle
Vollständige DSGVO-Konformität, kein US-CLOUD-Act-Risiko
| Modell | Modalität | Input/1M | Output/1M | Kontext |
|---|---|---|---|---|
| MiniMax M2.7 Ultraspeed | Text | €0.60 | €2.40 | 192K |
| Gemma 4 31B | Text + vision | €0.20 | €0.35 | 128K |
| gpt-oss-120b | Text | €0.22 | €0.59 | 128K |
| Whisper Large v3 | Speech-to-text | €0.10 | — | — |
| E5-Mistral 7B | Embeddings | €0.13 | — | 4K |
Preise in EUR, zzgl. MwSt. EU-gehostete Modelle beinhalten vollständige Datensouveränität. Speech-to-text und Embeddings werden nur auf Input-Token abgerechnet (sie liefern Transkripte oder Vektoren, keinen generierten Text).
Globaler Modellkatalog
Zusätzliche Modelle über globale Infrastruktur
| Modell | Modalität | Input/1M | Output/1M | Kontext |
|---|---|---|---|---|
| Llama 3.3 70B | Text | €0.60 | €1.20 | 128K |
| DeepSeek V3.1 | Text | €3.00 | €4.50 | 128K |
| DeepSeek V3.2 | Text | €3.00 | €4.50 | 32K |
Preise in EUR, zzgl. MwSt. Anfragen werden auf globaler Infrastruktur außerhalb der EU verarbeitet.
Schätzen Sie Ihre monatlichen Kosten
Starten Sie mit einem typischen Workload und passen Sie die Zahlen dann an Ihren an.
≈ 300,000 / Monat
≈ 600 Wörter
≈ 188 Wörter
Geschätzte monatliche Kosten
€324.00
Nur eine Schätzung. Geht von ca. 30 Tagen gleichmäßiger Nutzung aus. Die tatsächliche Token-Anzahl variiert je nach Sprache, Inhalt und Modell-Tokenizer (~750 Wörter ≈ 1.000 Token im Englischen). Speech-to-text und Embeddings werden hier nicht angezeigt - sie werden nur auf Input-Token abgerechnet; siehe die Tariftabelle oben. Prüfen Sie Ihre exakte Nutzung jederzeit unter cloud.infercom.ai/plans/usage.
Zugangsstufen
Wählen Sie, wie Sie starten möchten - jederzeit upgraden, wenn Sie wachsen.
Pay-as-you-go
Registrieren Sie sich, erstellen Sie einen API-Key und zahlen Sie nur für die Token, die Sie nutzen. Keine Mindestabnahme, keine Verpflichtung.
Rate Limits ansehen →Listenpreis, mit Mengenrabatten
Dieselben Per-Token-Tarife als Basis, mit Rabatten für zugesagte Volumen, individuellen SLAs, Priority-Support und höheren Rate Limits.
Vertrieb kontaktieren →