Preise · Plattform
Dedizierte NVIDIA-B200-GPUs, in Spanien. Wirklich souverän.
Volle GPUs oder MIG-Fraktionen, stundenweise oder reserviert, dazu Inferenz mit offenen Modellen (GLM 5.3, Qwen3.8, Nemotron, ALIA) auf NVIDIA B200 in Madrid. Ihr Code und Ihre Daten verlassen das Land nie.
180 GB
HBM3e pro B200-GPU
1/8
Kleinste Fraktion, per MIG hardwareseitig isoliert
8,00 €
Pro Stunde für eine volle B200, ohne Bindung, zzgl. MwSt.
100 %
Daten in Spanien verarbeitet und gespeichert
Wie der Slice funktioniert
Ihr Slice gehört Ihnen. Per Hardware. Die ganze Zeit.
Wir nutzen NVIDIA Multi-Instance GPU (MIG): Die B200 wird physisch in isolierte Instanzen partitioniert. Jeder Slice hat eigene Rechenkapazität, eigenen HBM3e-Speicher, eigenen Cache und eigene Bandbreite. Sie konkurrieren mit niemandem um Zyklen. Ihr 1/4 bleibt immer Ihr 1/4, auch wenn der Rest der GPU am Limit läuft.
- Hardware-Isolation (kein Time-Slicing, keine Virtualisierung): SMs, Speicher und Cache sind zwischen Slices physisch getrennt.
- Garantierte Bandbreite: Ihr Anteil am HBM3e wird nicht langsamer, wenn andere Kunden ihren Slice voll auslasten.
- 24/7 reserviert (mindestens 6 Monate) oder stundenweise ohne Bindung bei Traffic-Spitzen.
Jeder Slice = isolierte SMs + HBM3e + L2-Cache + NVDEC/NVENC · kein Noisy Neighbor
Warum ein dedizierter Slice
Ihre KI, innerhalb Ihres Perimeters. Keine Ausnahme.
Mit einer öffentlichen API trainieren Ihre Prompts das nächste Modell, und Ihre Daten reisen über drei Kontinente, bevor sie zurückkommen. Mit einem dedizierten Slice in Madrid verlässt nichts den Perimeter. Gleiches Modell, isolierte Umgebung, Compliance by design.
Was in Ihrem Slice passiert, bleibt in Ihrem Slice
Datenschutz, Compliance und Souveränität integriert. Keine Add-ons.
Daten in Spanien, 100 %
Prompts, Embeddings und Antworten verlassen Madrid nie. Keine Exposition gegenüber dem CLOUD Act, keine US-Sub-Auftragsverarbeiter, keine internationalen Transfers, die das Legal-Team unterschreiben muss.
Privates Modell und privater Kontext
Ihr B200-Slice gehört Ihnen, mit Hardware-Isolation per MIG. Ihre Eingaben trainieren nicht das nächste Modell, und Ihr Durchsatz hängt nicht vom Nachbarmieter ab. Niemand sonst fasst Ihre Gewichte an.
ISO 27001 + ENS Media inklusive
Ihr Auditor erhält die Zertifikate direkt. Ihr CISO schließt die Due Diligence ab, ohne die SoA zu erweitern. Keine zusätzlichen Audits, keine mehrdeutigen DPAs.
Dedizierter Endpoint, nicht geteilt
Privates HTTPS mit mTLS + VPN, erreichbar nur von Ihren IPs. Keine erzwungenen Rate-Limits, keine Inferenz-Warteschlangen. Die Latenz gehört Ihnen, 24/7.
InfiniBand-Kolokation
Ihr Pod, Ihr Speicher und Ihre Tokens leben im selben Rack, verkabelt über InfiniBand. Weniger Hops, geringere Latenz, null Cross-Region-Egress. Ihr Multi-Step-Agent verschluckt sich nicht am Netzwerk.
Und die Zeit zahlt sich auch selbst aus
Die operative Einsparung ist ein Nebeneffekt. Sie deckt den Slice trotzdem 3×.
Team
10 Devs
× 80 €/h
Leerlaufzeit
30 Min/Tag
× 220 Arbeitstage
Jährliche verlorene Kosten
88.000 €
1100 h/Jahr Leerlauf
1/4-Slice jährlich
26.280 €
1/4-Slice reserviert
Return on Time
+ 61.720 €/Jahr
3× der SliceDer wahre Grund zu wechseln ist Souveränität und Compliance. Die gewonnene Zeit ist der Bonus, der Finance überzeugt.
Ihre Daten, Ihr Modell, Ihre Latenz. Und Ihr Team hört auch auf zu warten.
Kombinieren Sie sie
Drei Modi. Sie bauen die Kombination.
Reservieren Sie einen Slice für Ihr eigenes Modell. Fügen Sie stündliche Bursts hinzu, wenn der Traffic ansteigt. Und ziehen Sie Tokens aus der Token Factory für ein großes Modell, wenn Sie die GPU nicht selbst managen wollen. Alles im selben Cluster, alles souverän, jede Zeile getrennt abgerechnet, ohne Überraschungen.
€/Monat · dedizierte GPU
Feste Monatsgebühr für eine GPU oder MIG-Fraktion, 24/7 dediziert, mit garantierter Kapazität. Mindestens 6 Monate. Ideal für Dev-Teams und stabile Produktion.
Am besten für stabile Produktion
€/Stunde · zahlen Sie nach Nutzung
Starten Sie eine Fraktion oder eine volle GPU und zahlen Sie stundenweise, bis Sie sie abschalten. Ohne Bindung und ohne Reservierung; Kapazität je nach Verfügbarkeit im Cluster.
Am besten für Spitzen und POCs
€/1M Tokens · Token Factory
Zahlen Sie nur die Tokens, die das Modell generiert. Keine GPU-Verwaltung. Rufen Sie den privaten HTTPS-Endpoint aus Ihrer App auf. Perfekt für Produktionsinferenz mit variabler Skala.
Am besten für Produktinferenz
GPU Compute mit MIG
Von 1/8 GPU bis zum vollen 8-GPU-Knoten. Immer dediziert.
MIG-Fraktionen von 1/8, 1/4 und 1/2, volle GPUs und ein HGX-Knoten mit 8 B200 für Training und Enterprise-Workloads. Gleiche Plattform, gleicher Vertrag: vom Prototyp zur Produktion ohne Migration.
01 / Mini
1/8
B200
OCR, Sprache, Embeddings und kleine Modelle (bis ~14B) · Proofs of Concept. Der Einstiegspunkt.
Reserviert
1.095 €/Monat
On-Demand
1,50 €/Stunde
02 / Slice
1/4
B200
Coding-Assistent für 3-5 Devs · leichtes Fine-Tuning · Modelle bis ~30B mit großem Kontext.
Reserviert
2.190 €/Monat
On-Demand
3,00 €/Stunde
03 / Halb
1/2
B200
Echte Produktion für 8-12 Devs · 70B-Inferenz in nativer FP8-Präzision · Training kleiner bis mittlerer Modelle.
Reserviert
4.380 €/Monat
On-Demand
6,00 €/Stunde
04 / Volle B200
1 ×
B200
72B-Modelle in voller FP8-Präzision · Hochdurchsatz-Inferenz für Teams ab 15 Devs · verteiltes Training.
Reserviert
5.840 €/Monat
On-Demand
8,00 €/Stunde
05 / HGX-Cluster
8 ×B200
8× B200 mit NVLink 5 intra-Node und InfiniBand NDR inter-Node · Training von Foundation-Modellen · Inferenz im großen Maßstab · dedizierte Enterprise-Compliance.
Reserviert
46.720 €/Monat
64,00 €/Stunde
Preise zzgl. MwSt. On-Demand: stundenweise, ohne Bindung, je nach Verfügbarkeit. Reserviert: garantierte exklusive Kapazität, mindestens 6 Monate; der Monatspreis entspricht 730 Stunden.
Bindung über 12 Monate oder länger? Sprechen Sie uns an, wir erstellen Ihnen ein Angebot. →
Token Factory
Die neuesten Open-Source-Modelle. Schnell serviert.
Offene Modelle, betrieben auf unseren B200 in Spanien, viele in NVFP4, zu denselben Preisen wie auf GPU Flow (gpuflow.ai), unserer Self-Service-Plattform. Ihre Prompts und Ihr Kontext verlassen das Land nicht.
| Modell | Params | Kontext | Input / 1M | Output / 1M |
|---|---|---|---|---|
| Z.aiGLM 5.3 NVFP4Neu | 753B · MoE | 1M | 1,206 € | 3,789 € |
| QwenQwen3.8Coding | 27B | 96k | 0,10 € | 0,30 € |
| QwenQwen3 | 14B | 32k | 0,20 € | 1,00 € |
| QwenQwen3.5Schnell | 9B | 64k | 0,10 € | 0,15 € |
| BSCALIA Instruct | 40B | 160k | 0,20 € | 2,00 € |
| GoogleGemma 4 | 26B · MoE | 32k | 0,12 € | 0,30 € |
| NVIDIANemotron 3.5 LightningSchnell | 30B · MoE | 128k | 0,12 € | 0,30 € |
| NVIDIANemotron Nano VLVision | 12B | 128k | 0,06 € | 0,24 € |
| QwenQwen3-VL OCRVision | 32B | 64k | 0,10 € | 0,35 € |
Preise in Euro pro Million Tokens, zzgl. MwSt., nach Verbrauch. Sprache: Whisper large-v3 für 0,0015 € pro Audiominute und Sprachsynthese ab 5 € pro Million Zeichen. Hohes Volumen oder eigenes Modell? Wir deployen es auf einer dedizierten GPU; fragen Sie uns.
Sandboxes
Entwicklungsumgebungen, abgerechnet pro aktiver Stunde.
Container mit SSH, Python, PyTorch, Jupyter und Coding-Agenten, im selben Cluster wie die Inferenz. Pausiert automatisch, wenn Sie aufhören: Leerlaufstunden zählen nicht.
Starter
0,15 €
/aktive Stunde
4 vCPU · 8 GB RAM
Pro
0,30 €
/aktive Stunde
8 vCPU · 32 GB RAM
Team
0,55 €
/aktive Stunde
16 vCPU · 64 GB RAM
Persistenter Speicher wird separat berechnet, ab 5 €/Monat. Preise zzgl. MwSt.
Wo Ihr Code lebt
Drei Orte. Einer gibt Ihnen alle.
Es gibt keine immer richtige Option. Es gibt eine, die Geschwindigkeit, Datenschutz und Kapazität kombiniert, und zwei, die einen Trade-off erzwingen.
Lokal, auf Ihrer Maschine
Maximaler physischer Datenschutz (nichts verlässt das Gerät), aber begrenzt durch RAM und Bandbreite. Große Modelle passen nicht oder laufen langsam. Ihr Laptop ist während der Inferenz unbenutzbar.
Gewinnt Datenschutz · verliert Geschwindigkeit und Kapazität
Dritt-API
Schnell, mit leistungsstarken Modellen, aber jeder Prompt reist zu den Servern von jemand anderem, mit variablen Aufbewahrungsrichtlinien und einer Gerichtsbarkeit, die je nach Anbieter wechselt. Die interne Compliance wird Sie Stunden kosten.
Gewinnt Geschwindigkeit · verliert Datenschutz
Dediziertes Cluster in Madrid
Geschwindigkeit des B200-Clusters mit HBM3e, Modelle der neuesten Generation in nativer Präzision, Isolation auf VM-Ebene. Prompts und Code werden hier verarbeitet. Datenresidenz 100 % spanisch, ISO 27001 und ENS Media zertifiziert.
Geschwindigkeit · Datenschutz · Kapazität
Alle Pläne enthalten
Maßgeschneidertes Angebot
Jeder Use Case ist anders. Sagen Sie uns, was Sie tun möchten, und wir schicken Ihnen in unter 24 Stunden ein konkretes Angebot.