GPU Solutions

Preise · Plattform

Dedizierte NVIDIA-B200-GPUs, in Spanien. Wirklich souverän.

Volle GPUs oder MIG-Fraktionen, stundenweise oder reserviert, dazu Inferenz mit offenen Modellen (GLM 5.3, Qwen3.8, Nemotron, ALIA) auf NVIDIA B200 in Madrid. Ihr Code und Ihre Daten verlassen das Land nie.

180 GB

HBM3e pro B200-GPU

1/8

Kleinste Fraktion, per MIG hardwareseitig isoliert

8,00 €

Pro Stunde für eine volle B200, ohne Bindung, zzgl. MwSt.

100 %

Daten in Spanien verarbeitet und gespeichert

Wie der Slice funktioniert

Ihr Slice gehört Ihnen. Per Hardware. Die ganze Zeit.

Wir nutzen NVIDIA Multi-Instance GPU (MIG): Die B200 wird physisch in isolierte Instanzen partitioniert. Jeder Slice hat eigene Rechenkapazität, eigenen HBM3e-Speicher, eigenen Cache und eigene Bandbreite. Sie konkurrieren mit niemandem um Zyklen. Ihr 1/4 bleibt immer Ihr 1/4, auch wenn der Rest der GPU am Limit läuft.

  • Hardware-Isolation (kein Time-Slicing, keine Virtualisierung): SMs, Speicher und Cache sind zwischen Slices physisch getrennt.
  • Garantierte Bandbreite: Ihr Anteil am HBM3e wird nicht langsamer, wenn andere Kunden ihren Slice voll auslasten.
  • 24/7 reserviert (mindestens 6 Monate) oder stundenweise ohne Bindung bei Traffic-Spitzen.
NVIDIA B200 · MIG
180 GB HBM3e
1/4
45 GB
1/4
45 GB
1/4
45 GB
1/4
45 GB
Dediziert: Compute · Speicher · CacheBandbreite pro Slice · ~2 TB/s

Jeder Slice = isolierte SMs + HBM3e + L2-Cache + NVDEC/NVENC · kein Noisy Neighbor

Warum ein dedizierter Slice

Ihre KI, innerhalb Ihres Perimeters. Keine Ausnahme.

Mit einer öffentlichen API trainieren Ihre Prompts das nächste Modell, und Ihre Daten reisen über drei Kontinente, bevor sie zurückkommen. Mit einem dedizierten Slice in Madrid verlässt nichts den Perimeter. Gleiches Modell, isolierte Umgebung, Compliance by design.

Was in Ihrem Slice passiert, bleibt in Ihrem Slice

Datenschutz, Compliance und Souveränität integriert. Keine Add-ons.

01

Daten in Spanien, 100 %

Prompts, Embeddings und Antworten verlassen Madrid nie. Keine Exposition gegenüber dem CLOUD Act, keine US-Sub-Auftragsverarbeiter, keine internationalen Transfers, die das Legal-Team unterschreiben muss.

02

Privates Modell und privater Kontext

Ihr B200-Slice gehört Ihnen, mit Hardware-Isolation per MIG. Ihre Eingaben trainieren nicht das nächste Modell, und Ihr Durchsatz hängt nicht vom Nachbarmieter ab. Niemand sonst fasst Ihre Gewichte an.

03

ISO 27001 + ENS Media inklusive

Ihr Auditor erhält die Zertifikate direkt. Ihr CISO schließt die Due Diligence ab, ohne die SoA zu erweitern. Keine zusätzlichen Audits, keine mehrdeutigen DPAs.

04

Dedizierter Endpoint, nicht geteilt

Privates HTTPS mit mTLS + VPN, erreichbar nur von Ihren IPs. Keine erzwungenen Rate-Limits, keine Inferenz-Warteschlangen. Die Latenz gehört Ihnen, 24/7.

05

InfiniBand-Kolokation

Ihr Pod, Ihr Speicher und Ihre Tokens leben im selben Rack, verkabelt über InfiniBand. Weniger Hops, geringere Latenz, null Cross-Region-Egress. Ihr Multi-Step-Agent verschluckt sich nicht am Netzwerk.

Und die Zeit zahlt sich auch selbst aus

Die operative Einsparung ist ein Nebeneffekt. Sie deckt den Slice trotzdem 3×.

01

Team

10 Devs

× 80 €/h

02

Leerlaufzeit

30 Min/Tag

× 220 Arbeitstage

03

Jährliche verlorene Kosten

88.000 €

1100 h/Jahr Leerlauf

04

1/4-Slice jährlich

26.280 €

1/4-Slice reserviert

Return on Time

+ 61.720 €/Jahr

3× der Slice

Der wahre Grund zu wechseln ist Souveränität und Compliance. Die gewonnene Zeit ist der Bonus, der Finance überzeugt.

Ihre Daten, Ihr Modell, Ihre Latenz. Und Ihr Team hört auch auf zu warten.

Kombinieren Sie sie

Drei Modi. Sie bauen die Kombination.

Reservieren Sie einen Slice für Ihr eigenes Modell. Fügen Sie stündliche Bursts hinzu, wenn der Traffic ansteigt. Und ziehen Sie Tokens aus der Token Factory für ein großes Modell, wenn Sie die GPU nicht selbst managen wollen. Alles im selben Cluster, alles souverän, jede Zeile getrennt abgerechnet, ohne Überraschungen.

01 / Reserviert€/Monat

€/Monat · dedizierte GPU

Feste Monatsgebühr für eine GPU oder MIG-Fraktion, 24/7 dediziert, mit garantierter Kapazität. Mindestens 6 Monate. Ideal für Dev-Teams und stabile Produktion.

Am besten für stabile Produktion

02 / On-Demand€/Stunde

€/Stunde · zahlen Sie nach Nutzung

Starten Sie eine Fraktion oder eine volle GPU und zahlen Sie stundenweise, bis Sie sie abschalten. Ohne Bindung und ohne Reservierung; Kapazität je nach Verfügbarkeit im Cluster.

Am besten für Spitzen und POCs

03 / Endpoints€/1M Tokens

€/1M Tokens · Token Factory

Zahlen Sie nur die Tokens, die das Modell generiert. Keine GPU-Verwaltung. Rufen Sie den privaten HTTPS-Endpoint aus Ihrer App auf. Perfekt für Produktionsinferenz mit variabler Skala.

Am besten für Produktinferenz

GPU Compute mit MIG

Von 1/8 GPU bis zum vollen 8-GPU-Knoten. Immer dediziert.

MIG-Fraktionen von 1/8, 1/4 und 1/2, volle GPUs und ein HGX-Knoten mit 8 B200 für Training und Enterprise-Workloads. Gleiche Plattform, gleicher Vertrag: vom Prototyp zur Produktion ohne Migration.

01 / Mini

1/8

B200

Speicher≈ 23 GB HBM3e
Bandbreite≈ 1 TB/s

OCR, Sprache, Embeddings und kleine Modelle (bis ~14B) · Proofs of Concept. Der Einstiegspunkt.

Reserviert

1.095 €/Monat

On-Demand

1,50 €/Stunde

Loslegen →

02 / Slice

1/4

B200

Speicher45 GB HBM3e
Bandbreite≈ 2 TB/s

Coding-Assistent für 3-5 Devs · leichtes Fine-Tuning · Modelle bis ~30B mit großem Kontext.

Reserviert

2.190 €/Monat

On-Demand

3,00 €/Stunde

Loslegen →

03 / Halb

1/2

B200

Am beliebtesten
Speicher90 GB HBM3e
Bandbreite≈ 4 TB/s

Echte Produktion für 8-12 Devs · 70B-Inferenz in nativer FP8-Präzision · Training kleiner bis mittlerer Modelle.

Reserviert

4.380 €/Monat

On-Demand

6,00 €/Stunde

Mit dem Vertrieb sprechen →

04 / Volle B200

1 ×

B200

Speicher180 GB HBM3e
Bandbreite8 TB/s

72B-Modelle in voller FP8-Präzision · Hochdurchsatz-Inferenz für Teams ab 15 Devs · verteiltes Training.

Reserviert

5.840 €/Monat

On-Demand

8,00 €/Stunde

Mit dem Vertrieb sprechen →

05 / HGX-Cluster

8 ×B200

8× B200 mit NVLink 5 intra-Node und InfiniBand NDR inter-Node · Training von Foundation-Modellen · Inferenz im großen Maßstab · dedizierte Enterprise-Compliance.

Speicher8 × 180 GB HBM3e
Bandbreite64 TB/s aggregiert

Reserviert

46.720 €/Monat

64,00 €/Stunde

Mit dem Vertrieb sprechen →

Preise zzgl. MwSt. On-Demand: stundenweise, ohne Bindung, je nach Verfügbarkeit. Reserviert: garantierte exklusive Kapazität, mindestens 6 Monate; der Monatspreis entspricht 730 Stunden.

Bindung über 12 Monate oder länger? Sprechen Sie uns an, wir erstellen Ihnen ein Angebot. →

Token Factory

Die neuesten Open-Source-Modelle. Schnell serviert.

Offene Modelle, betrieben auf unseren B200 in Spanien, viele in NVFP4, zu denselben Preisen wie auf GPU Flow (gpuflow.ai), unserer Self-Service-Plattform. Ihre Prompts und Ihr Kontext verlassen das Land nicht.

Katalog offener Modelle mit Preisen in Euro pro Million Input- und Output-Tokens, zzgl. MwSt.
ModellParamsKontextInput / 1MOutput / 1M
Z.aiGLM 5.3 NVFP4Neu753B · MoE1M1,206 €3,789 €
QwenQwen3.8Coding27B96k0,10 €0,30 €
QwenQwen314B32k0,20 €1,00 €
QwenQwen3.5Schnell9B64k0,10 €0,15 €
BSCALIA Instruct40B160k0,20 €2,00 €
GoogleGemma 426B · MoE32k0,12 €0,30 €
NVIDIANemotron 3.5 LightningSchnell30B · MoE128k0,12 €0,30 €
NVIDIANemotron Nano VLVision12B128k0,06 €0,24 €
QwenQwen3-VL OCRVision32B64k0,10 €0,35 €

Preise in Euro pro Million Tokens, zzgl. MwSt., nach Verbrauch. Sprache: Whisper large-v3 für 0,0015 € pro Audiominute und Sprachsynthese ab 5 € pro Million Zeichen. Hohes Volumen oder eigenes Modell? Wir deployen es auf einer dedizierten GPU; fragen Sie uns.

Sandboxes

Entwicklungsumgebungen, abgerechnet pro aktiver Stunde.

Container mit SSH, Python, PyTorch, Jupyter und Coding-Agenten, im selben Cluster wie die Inferenz. Pausiert automatisch, wenn Sie aufhören: Leerlaufstunden zählen nicht.

Starter

0,15 €

/aktive Stunde

4 vCPU · 8 GB RAM

Pro

0,30 €

/aktive Stunde

8 vCPU · 32 GB RAM

Team

0,55 €

/aktive Stunde

16 vCPU · 64 GB RAM

Persistenter Speicher wird separat berechnet, ab 5 €/Monat. Preise zzgl. MwSt.

Wo Ihr Code lebt

Drei Orte. Einer gibt Ihnen alle.

Es gibt keine immer richtige Option. Es gibt eine, die Geschwindigkeit, Datenschutz und Kapazität kombiniert, und zwei, die einen Trade-off erzwingen.

01 / Auf Ihrem Laptop

Lokal, auf Ihrer Maschine

Maximaler physischer Datenschutz (nichts verlässt das Gerät), aber begrenzt durch RAM und Bandbreite. Große Modelle passen nicht oder laufen langsam. Ihr Laptop ist während der Inferenz unbenutzbar.

Geschwindigkeit15
Datenschutz70
Modellkapazität20

Gewinnt Datenschutz · verliert Geschwindigkeit und Kapazität

02 / Öffentliche API

Dritt-API

Schnell, mit leistungsstarken Modellen, aber jeder Prompt reist zu den Servern von jemand anderem, mit variablen Aufbewahrungsrichtlinien und einer Gerichtsbarkeit, die je nach Anbieter wechselt. Die interne Compliance wird Sie Stunden kosten.

Geschwindigkeit80
Datenschutz15
Modellkapazität85

Gewinnt Geschwindigkeit · verliert Datenschutz

03 / Ihr Slice bei GPU SolutionsAusgewogen

Dediziertes Cluster in Madrid

Geschwindigkeit des B200-Clusters mit HBM3e, Modelle der neuesten Generation in nativer Präzision, Isolation auf VM-Ebene. Prompts und Code werden hier verarbeitet. Datenresidenz 100 % spanisch, ISO 27001 und ENS Media zertifiziert.

Geschwindigkeit95
Datenschutz100
Modellkapazität100

Geschwindigkeit · Datenschutz · Kapazität

Alle Pläne enthalten

ISO 27001 + ENS Media
100 % Daten in Spanien
Isolation auf VM-Ebene
Verschlüsselter Speicher
Support auf Deutsch, Spanisch und Englisch
Kein Vendor-Lock-in

Maßgeschneidertes Angebot

Jeder Use Case ist anders. Sagen Sie uns, was Sie tun möchten, und wir schicken Ihnen in unter 24 Stunden ein konkretes Angebot.

Angebot anfordern →