Europas einziger öffentlicher SambaNova-Anbieter

SambaNova-Technologie in Europa

Infercom ist Europas erster und einziger öffentlicher Anbieter von SambaNova's Dataflow-Architektur. KI-Inferenz aus Deutschland, vollständig DSGVO-konform.

Bis zu 10x

Schnellere Inferenz

Bis zu 5x

Energieeffizienter

100%

EU-gehostet

Dataflow vs. GPU-Architektur

Warum eine zweckgebundene Dataflow-Architektur herkömmliche GPUs bei der KI-Inferenz übertrifft

SambaNova

Dataflow-Architektur

Speziell für KI entwickelt

Für KI-Workloads optimiert: Individuelle Verarbeitungs-Pipelines für vollständige Berechnungsgraphen bei minimalem Datentransfer.

  • Gesamtes Modell dauerhaft im Speicher
  • Daten fließen durch Operationen ohne Zwischenspeicherung
  • Operator Fusion: Hunderte von Operationen in einem einzelnen Kernel
  • Software-definierte Hardware optimiert sich für jeden Workload

Herkömmliche GPU

Allzweck-Design

Das Allzweck-Design mit kernelweiser Ausführung erzeugt Engpässe bei KI-Inferenz-Workloads.

  • Kernelweise Ausführung verursacht unnötigen Overhead
  • Übermäßiger Datentransfer zwischen Prozessor und Speicher
  • Speicherbandbreite als Performance-Engpass
  • Unterauslastung der Rechenressourcen

Deep Dive: Wie Dataflow die KI-Inferenz-Krise löst

Der SambaNova-Vorteil

GPUs wurden nicht für KI entwickelt. Sie wurden für Videospielgrafik konzipiert, und das zeigt sich in der Architektur. SambaNova ging einen anderen Weg und entwickelte Chips, die von Grund auf für KI-Inferenz optimiert sind. Unabhängige Benchmarks zeigen bis zu 10x schnellere Inferenz – die schnellste verfügbare LLM-Inferenztechnologie. So funktioniert es.

GPUs verbringen die meiste Zeit mit Warten

Wenn eine GPU KI-Antworten generiert, folgt sie einem sich wiederholenden Zyklus: Daten aus dem Speicher abrufen, berechnen, zurück in den Speicher schreiben, wiederholen. Der Weg zum Speicher dauert viel länger als die eigentliche Berechnung. GPUs verbringen die meiste Zeit damit, auf Daten zu warten, nicht sie zu verarbeiten.

Ingenieure nennen das "speichergebunden". Der Prozessor wartet, während Daten hin und her bewegt werden. Bei KI-Inferenz, wo jeder Token diesen Abruf-Berechnung-Schreib-Zyklus erfordert, summieren sich die Verzögerungen. Eine Antwort mit 1.000 Token bedeutet 1.000 Speicherzugriffe.

GPU-Hersteller haben schnelleren Speicher und größere Caches versucht. Das Kernproblem bleibt: Daten werden ständig zwischen Prozessor und Speicher hin- und herbewegt.

Dataflow streamt Daten durch den Chip statt sie zu verschieben

SambaNovass Reconfigurable Dataflow Units (RDUs) arbeiten anders. Anstatt Daten wiederholt abzurufen und zu speichern, verteilen sie Operationen räumlich über den Chip und streamen Daten kontinuierlich hindurch. Daten bewegen sich in einer Richtung durch die Berechnung, wie Teile auf einem Fließband, anstatt bei jedem Schritt geladen und entladen zu werden.

Das gesamte KI-Modell bleibt resident im Speicher. Daten fließen durch Operationen ohne Zwischenschreibvorgänge. Operationen, die auf einer GPU separate Schritte erfordern würden, werden zusammengeführt. SambaNova nennt das "kontinuierliches Execution-Streaming über den Prozessor". Es ist das Gegenteil der Kernel-für-Kernel-Ausführung bei GPUs.

Weniger Warten. Mehr Durchsatz.

Learn how dataflow architecture delivers speed

Ein dreistufiges Speichersystem ermöglicht 600B+ Parameter-Modelle auf einem Rack

SambaNova verwendet eine dreistufige Speicherhierarchie, die Geschwindigkeit und Kapazität ausbalanciert. Auf der schnellsten Ebene befinden sich 520 Megabyte SRAM direkt auf jedem Chip, der die heißesten Daten verarbeitet und Operationen ohne Speicherzugriffe fusionieren lässt. Darunter halten 64 Gigabyte High-Bandwidth Memory (HBM) Modellgewichte und aktive Daten. Anders als traditionelle Caches ist diese Schicht softwaregesteuert – das System entscheidet genau, was hier liegt, statt auf automatische Verdrängungsrichtlinien zu vertrauen.

Die dritte Stufe bietet bis zu 1,5 Terabyte DDR-Speicher pro Chip für Prompt-Caching und das gleichzeitige Hosting mehrerer Modelle. Jeder Chip kann auf Speicher aller Chips im Rack zugreifen und bildet einen massiven gemeinsamen Speicherpool als flachen Adressraum.

Ein einzelnes Rack kann Modelle mit Hunderten von Milliarden Parametern ausführen. Konkurrenten mit reinen SRAM-Architekturen benötigen Tausende von Chips für die gleiche Fähigkeit. Der dreistufige Ansatz tauscht etwas Spitzengeschwindigkeit gegen bessere Kapazität und Flexibilität.

Bis zu 10x schneller als GPU-Inferenz, 5x bessere Energieeffizienz

Unabhängige Benchmarks von Artificial Analysis bestätigen den Leistungsunterschied: SambaNovas Dataflow-Architektur liefert bis zu 10x schnellere Inferenz als GPU-Alternativen, mit bis zu 5x besserer Energieeffizienz. Ein einzelnes Rack verbraucht etwa 10 bis 15 Kilowatt gegenüber 40 bis 50 Kilowatt oder mehr für vergleichbare GPU-Infrastruktur. Es läuft mit Standard-Luftkühlung, ohne exotische Flüssigkühlungssysteme oder speziell gebaute Rechenzentren.

Bei Echtzeit-Anwendungen zeigt sich das in der Benutzererfahrung. Ein KI-Assistent, der in 200 Millisekunden statt 2 Sekunden antwortet, ist ein anderes Produkt. Man nutzt ihn ständig, statt auf ihn zu warten. Schnellere Token bedeuten auch mehr Reasoning-Schritte im gleichen Zeitbudget, was für agentische Workflows und komplexe mehrstufige Aufgaben wichtig ist.

SambaNova-Technologie in Europa: Infercom ist der erste und einzige öffentliche Anbieter

All diese Leistung ist über SambaNovas Cloud verfügbar. Aber diese Cloud läuft in den Vereinigten Staaten. Für europäische Unternehmen mit DSGVO-Compliance-Anforderungen, Datensouveränitätsvorgaben oder der Präferenz, sensible Daten innerhalb der EU-Jurisdiktion zu halten, stellt das eine Barriere dar.

Infercom bringt SambaNova nach Europa. Wir betreiben die erste und einzige öffentliche SambaNova-Cloud in der EU, gehostet in München, Deutschland. Die Latenz von Frankfurt beträgt unter 10 Millisekunden. Mit Geschwindigkeiten von über 400 Token pro Sekunde bei Modellen wie MiniMax M2.7 Ultraspeedist es die schnellste LLM-API in Europa – mit vollständiger EU-Datensouveränität. Ihre Prompts und Antworten verlassen niemals europäischen Boden. Kein CLOUD Act. Keine Drittland-Datentransfers. Vollständig DSGVO-konform.

Wenn Sie KI-Anwendungen entwickeln, die sowohl Geschwindigkeit als auch Souveränität benötigen, ist dies die Infrastruktur.

SN40L Reconfigurable Dataflow Unit

Gefertigt im TSMC-5nm-Prozess mit 1.040 Rechenkernen pro Chip - 638 BF16 TFLOPS pro Chip, 10,2 PetaFLOPS pro Rack.

SambaNova SN40L Reconfigurable Dataflow Unit (RDU) chip

SambaNova SN40L RDU - Dual-Die CoWoS-Package auf TSMC 5nm

638

TFLOPS/Chip (BF16)

1.040

PCUs/Chip

10,2

PFLOPS/Rack

TSMC 5nm

Fertigungsprozess

Dreistufige Speicherarchitektur pro Chip

520MB

SRAM

Ultraschneller On-Chip-Cache

64GB

HBM

Hochbandbreiten-Co-Package-Speicher

Bis zu 1,5TB

DDR

Off-Package DIMM-Speicher

Rack-Konfiguration (SN40L-16)

16

RDU-Chips

Bis zu 25TB

Gesamtspeicher

~10kW

Typische Leistung

Luft

Kühlung

Weltrekord-Performance

Performance gemessen in Output-Token pro Sekunde. Benchmarks von der Infercom-EU-Infrastruktur in München, Deutschland.

MiniMax M2.7 UltraspeedNEU - EU-gehostet
404Token/Sek.

Leistungsstarkes multimodales Modell, jetzt auf Infercoms EU-Infrastruktur gehostet. Von Artificial Analysis unabhängig gemessen mit 400+ Token/Sek.

EU-souverän

gpt-oss-120bSchnellstes EU-Modell
772Token/Sek.

OpenAIs Open-Source-Modell mit 120B Parametern. Außergewöhnlicher Durchsatz für hochvolumige souveräne Workloads.

EU-souverän

Nachhaltige KI-Infrastruktur

Bis zu 5x bessere Energieeffizienz gegenüber GPU-basierter Inferenz

Geringerer Stromverbrauch

Typisch 10 kW pro Rack gegenüber GPU-Racks mit 40–50 kW+ für vergleichbare Workloads. Die Dataflow-Architektur benötigt weniger Chips, was zu erheblichen Energieeinsparungen führt.

Kleinerer Footprint

Deutlich reduzierter Platzbedarf, vereinfachte Kühlung und niedrigere Gesamtbetriebskosten.

Luftgekühltes Design

Keine Flüssigkühlungsinfrastruktur erforderlich. Standardluftkühlung vereinfacht den Betrieb, reduziert den Wartungsaufwand und senkt die Betriebskosten.

"Nicht alle Token sind gleich. Der eigentliche Wert liegt nicht in der Anzahl generierter Token, sondern in der Qualität der gelieferten Intelligenz pro verbrauchter Energieeinheit."

SambaNova - "Intelligence per Joule"

Erweiterte Modellfähigkeiten

Unterstützung für sehr große Modelle

Große Modelle mit Hunderten von Milliarden Parametern auf einem einzigen Rack ausführen. Unterstützung für Composition of Experts (CoE) mit über 100 Expert-Modellen gleichzeitig.

100e Mrd. Param.CoE-Support100+ Modelle

Große Kontextfenster

Verarbeitung von Kontextfenstern mit bis zu 192K Token (MiniMax M2.7) und 128K bei den meisten anderen Modellen. Die große Speicherkapazität ermöglicht Dokumentenanalyse, Code-Generierung und Reasoning-Aufgaben.

Bis zu 192K TokenSingle NodeKeine Kürzung

Modellwechsel in Millisekunden

Mehrere Modelle gleichzeitig im Speicher mit Millisekunden-Latenz beim Wechsel - um Größenordnungen schneller als GPU-Systeme. Ideal für autonome KI-Agenten und Multi-Modell-Workflows.

ms-WechselMulti-ModellKI-Agenten

SambaNova-Infrastruktur in Europa

Infercom betreibt Europas erste öffentliche SambaNova-Cloud. Gehostet in einem Tier III+ zertifizierten Rechenzentrum in München — EU-Jurisdiktion.

Row of SambaNova racks powering Infercom's EU infrastructure

SambaNova Rack-Infrastruktur - luftgekühlt, 10 kW pro Rack

German Flag

Hosting in München

Europas einzige öffentliche SambaNova-Installation. Alle Daten und Verarbeitungsprozesse verbleiben in Deutschland unter EU-Jurisdiktion.

Keine US-Jurisdiktion

Vollständige DSGVO-Konformität. Schutz vor CLOUD Act, PATRIOT Act und ausländischen Geheimdienstzugriffen. Ihre Daten verlassen Europa nie.

AI Act-bereit

Infrastruktur vorbereitet für die Anforderungen und Compliance-Vorgaben des EU AI Act.

Tier III+ zertifiziert

99,982 % Verfügbarkeitsgarantie mit redundanter Strom- und Kühlungsversorgung.

Bereit, die Zukunft der AI in Europa zu gestalten?

Schließen Sie sich zukunftsorientierten Unternehmen an, die Souveräne KI mit Weltklasse-Performance einsetzen