Developer-Ressourcen

Glossar zur EU-souveränen AI-Inferenz

Klare, belegte Definitionen rund um EU-souveräne AI-Inferenz - von Data Residency, DSGVO und Zero Data Retention bis TTFT, Durchsatz und Dataflow-Architektur. Jeder Eintrag ist mit veröffentlichten Quellen und echten Benchmark-Daten aus unserer EU-Infrastruktur belegt.

Modelle & Inferenz

Inferenz

Der Betrieb eines trainierten KI-Modells zur Erzeugung von Ausgaben - der Produktions-Workload der KI, dessen Kosten und Geschwindigkeit sich mit der Nutzung vervielfachen.

Durchsatz (LLM-Serving)

Token pro Sekunde in zwei Bedeutungen: Ausgabe-Durchsatz pro Anfrage vs. systemweite Kapazität - und wie Batching das eine gegen das andere eintauscht.

Prefill vs. Decode

Die zwei Phasen der LLM-Inferenz - parallele Prompt-Verarbeitung vs. Token-für-Token-Generierung.

Latenz vs. Durchsatz

Der fundamentale Serving-Zielkonflikt: Gesamtleistung des Systems vs. Geschwindigkeit jedes einzelnen Nutzers.

Open-Weight-Modell

Ein Modell, dessen trainierte Parameter veröffentlicht sind, sodass es jeder selbst betreiben kann - die technische Basis souveräner Inferenz.

Context Window

Die maximale Textmenge in Tokens, die ein Modell auf einmal berücksichtigt - Prompt plus Ausgabe. Die Länge prägt Geschwindigkeit und Kosten direkt.

Parameter

Die gelernten Weights eines Modells - das grobe Maß für Größe und Kapazität und der direkte Treiber von Speicher, Geschwindigkeit und Kosten.

Temperature (Sampling)

Der Parameter, der die Zufälligkeit bei der Token-Auswahl steuert - wobei 1.0 die Basis ist und 0 Greedy Decoding erzwingt.

Top-P (Nucleus Sampling)

Eine Sampling-Methode, die nur genug hochwahrscheinliche Token behält, um eine kumulative Wahrscheinlichkeit p zu erreichen - der Kandidatenpool passt sich der Sicherheit des Modells an.

Top-K Sampling

Eine Sampling-Methode, die die Auswahl auf die k wahrscheinlichsten Token beschränkt - eine harte Obergrenze für den Kandidatenpool.

Greedy Decoding

Die Dekodierungsstrategie, die immer das wahrscheinlichste Token wählt - deterministisch, aber anfällig für Wiederholungsschleifen.

Bereit, die Zukunft der AI in Europa zu gestalten?

Schließen Sie sich zukunftsorientierten Unternehmen an, die Souveräne KI mit Weltklasse-Performance einsetzen