Tarifs · plateforme
GPU NVIDIA B200 dédiés, en Espagne. Vraiment souverains.
GPU complets ou fractions MIG, à l'heure ou réservés, et inférence sur modèles ouverts (GLM 5.3, Qwen3.8, Nemotron, ALIA) sur NVIDIA B200 à Madrid. Votre code et vos données ne quittent jamais le pays.
180 Go
HBM3e par GPU B200
1/8
La plus petite fraction, isolée matériellement par MIG
8,00 €
L'heure de B200 complet, sans engagement, HT
100 %
Données traitées et stockées en Espagne
Comment fonctionne la fraction
Votre fraction est la vôtre. Par matériel. En permanence.
Nous utilisons NVIDIA Multi-Instance GPU (MIG) : la B200 est partitionnée physiquement en instances isolées. Chaque fraction dispose de son propre calcul, mémoire HBM3e, cache et bande passante. Vous ne concourez avec personne pour des cycles. Votre 1/4 reste toujours votre 1/4, même lorsque le reste du GPU est saturé.
- Isolation matérielle (ni time-slicing, ni virtualisation) : SM, mémoire et cache sont physiquement séparés entre les fractions.
- Bande passante garantie : votre part de HBM3e ne ralentit pas si d'autres clients saturent leur fraction.
- Réservée 24/7 (6 mois minimum), ou à l'heure sans engagement lors de pics de trafic.
Chaque fraction = SM isolés + HBM3e + cache L2 + NVDEC/NVENC · pas de voisin bruyant
Pourquoi une fraction dédiée
Votre IA, à l'intérieur de votre périmètre. Sans exception.
Avec une API publique, vos prompts entraînent le prochain modèle et vos données traversent trois continents avant de revenir. Avec une fraction dédiée à Madrid, rien ne sort. Même modèle, environnement isolé, conformité by design.
Ce qui se passe dans votre fraction, reste dans votre fraction
Confidentialité, conformité et souveraineté intégrées. Pas en option.
Données en Espagne, 100 %
Prompts, embeddings et réponses ne quittent jamais Madrid. Aucune exposition au CLOUD Act, aucun sous-traitant américain, aucun transfert international à faire signer par le service juridique.
Modèle et contexte privés
Votre fraction de B200 est à vous avec isolation matérielle MIG. Vos entrées n'entraînent pas le prochain modèle, et votre débit ne dépend pas du locataire d'à côté. Personne d'autre ne touche à vos poids.
ISO 27001 + ENS Media inclus
Votre auditeur reçoit les certificats directement. Votre RSSI clôt la due diligence sans étendre le SoA. Pas d'audit supplémentaire, pas de DPA ambigu.
Endpoint dédié, pas partagé
HTTPS privé avec mTLS + VPN, accessible uniquement depuis vos IP. Pas de rate limits imposés, pas de files d'attente d'inférence. La latence est la vôtre, 24/7.
Colocation InfiniBand
Votre pod, votre stockage et vos tokens vivent dans le même rack, câblés en InfiniBand. Moins de sauts, moins de latence, zéro sortie inter-régions. Votre agent multi-étapes ne s'étouffe pas sur le réseau.
Et le temps se rentabilise aussi
L'économie opérationnelle est un effet de bord. Elle couvre tout de même la fraction 3×.
Équipe
10 devs
× 80 €/h
Temps mort
30 min/jour
× 220 jours ouvrés
Coût annuel perdu
88 000 €
1100 h/an perdues
Fraction 1/4 annuelle
26 280 €
fraction 1/4 réservée
Retour sur temps
+ 61 720 €/an
3× la fractionLa vraie raison de basculer, c'est la souveraineté et la conformité. Le temps récupéré, c'est le bonus qui convainc la finance.
Vos données, votre modèle, votre latence. Et votre équipe arrête d'attendre, elle aussi.
Combinez-les
Trois modes. Vous construisez la combinaison.
Réservez une fraction pour votre propre modèle. Ajoutez des bursts à l'heure quand le trafic monte. Et tirez des tokens de la Token Factory pour un gros modèle quand vous ne voulez pas gérer le GPU. Tout dans le même cluster, tout souverain, chaque ligne facturée séparément, sans surprise.
€/mois · GPU dédié
Forfait mensuel fixe pour un GPU ou une fraction MIG dédiés 24/7, avec capacité garantie. 6 mois minimum. Idéal pour les équipes dev et la production stable.
Idéal pour production stable
€/heure · payez à l'usage
Démarrez une fraction ou un GPU complet et payez à l'heure jusqu'à l'arrêt. Sans engagement ni réservation ; capacité selon la disponibilité du cluster.
Idéal pour pics et POC
€/1M tokens · Token Factory
Payez uniquement les tokens générés par le modèle. Pas de gestion GPU. Appelez l'endpoint HTTPS privé depuis votre application. Parfait pour l'inférence en production à échelle variable.
Idéal pour inférence produit
GPU Compute avec MIG
De 1/8 de GPU au nœud complet de 8. Toujours dédié.
Fractions MIG de 1/8, 1/4 et 1/2, GPU complets et nœud HGX de 8 B200 pour l'entraînement et les charges entreprise. Même plateforme, même contrat : du prototype à la production sans migration.
01 / Mini
1/8
B200
OCR, voix, embeddings et petits modèles (jusqu'à ~14B) · preuves de concept. Le point d'entrée.
Réservé
1 095 €/mois
À la demande
1,50 €/heure
02 / Fraction
1/4
B200
Assistant de code pour 3-5 devs · fine-tuning léger · modèles jusqu'à ~30B avec long contexte.
Réservé
2 190 €/mois
À la demande
3,00 €/heure
03 / Demi
1/2
B200
Vraie production pour 8-12 devs · inférence 70B en précision FP8 native · entraînement de modèles petits à moyens.
Réservé
4 380 €/mois
À la demande
6,00 €/heure
04 / B200 complet
1 ×
B200
Modèles 72B en FP8 pleine précision · inférence haut débit pour équipes de 15+ devs · entraînement distribué.
Réservé
5 840 €/mois
À la demande
8,00 €/heure
05 / Cluster HGX
8 ×B200
8× B200 avec NVLink 5 intra-nœud et InfiniBand NDR inter-nœud · entraînement de modèles de fondation · inférence à grande échelle · conformité entreprise dédiée.
Réservé
46 720 €/mois
64,00 €/heure
Prix HT. À la demande : à l'heure, sans engagement, selon disponibilité. Réservé : capacité exclusive garantie, 6 mois minimum ; le prix mensuel correspond à 730 heures.
Engagement de 12 mois ou plus ? Parlons-en, nous vous préparons une proposition. →
Token Factory
Les derniers modèles open source. Servis vite.
Modèles ouverts servis depuis nos B200 en Espagne, beaucoup en NVFP4, aux mêmes prix que sur GPU Flow (gpuflow.ai), notre plateforme en libre-service. Vos prompts et votre contexte ne quittent pas le pays.
| Modèle | Params | Contexte | Entrée / 1M | Sortie / 1M |
|---|---|---|---|---|
| Z.aiGLM 5.3 NVFP4Nouveau | 753B · MoE | 1M | 1,206 € | 3,789 € |
| QwenQwen3.8Coding | 27B | 96k | 0,10 € | 0,30 € |
| QwenQwen3 | 14B | 32k | 0,20 € | 1,00 € |
| QwenQwen3.5Rapide | 9B | 64k | 0,10 € | 0,15 € |
| BSCALIA Instruct | 40B | 160k | 0,20 € | 2,00 € |
| GoogleGemma 4 | 26B · MoE | 32k | 0,12 € | 0,30 € |
| NVIDIANemotron 3.5 LightningRapide | 30B · MoE | 128k | 0,12 € | 0,30 € |
| NVIDIANemotron Nano VLVision | 12B | 128k | 0,06 € | 0,24 € |
| QwenQwen3-VL OCRVision | 32B | 64k | 0,10 € | 0,35 € |
Prix en euros par million de tokens, HT, à l'usage. Voix : Whisper large-v3 à 0,0015 € la minute d'audio et synthèse vocale à partir de 5 € le million de caractères. Gros volume ou modèle propre ? Nous le déployons sur GPU dédié ; demandez-nous.
Sandboxes
Environnements de développement, à l'heure active.
Conteneur avec SSH, Python, PyTorch, Jupyter et agents de code, dans le même cluster que l'inférence. Il se met en pause tout seul quand vous arrêtez : les heures inactives ne comptent pas.
Starter
0,15 €
/heure active
4 vCPU · 8 Go de RAM
Pro
0,30 €
/heure active
8 vCPU · 32 Go de RAM
Team
0,55 €
/heure active
16 vCPU · 64 Go de RAM
Disque persistant facturé à part, à partir de 5 €/mois. Prix HT.
Là où vit votre code
Trois endroits. Un seul vous les offre tous.
Il n'y a pas d'option toujours juste. Il y en a une qui combine vitesse, confidentialité et capacité, et deux qui imposent un compromis.
Local, sur votre machine
Confidentialité physique maximale (rien ne quitte l'appareil), mais bornée par la RAM et la bande passante. Les gros modèles ne tiennent pas ou tournent lentement. Votre portable est inutilisable pendant l'inférence.
Gagne en confidentialité · perd en vitesse et capacité
API tierce
Rapide, avec des modèles puissants, mais chaque prompt voyage vers les serveurs de quelqu'un d'autre, avec des politiques de rétention variables et une juridiction qui change selon le fournisseur. La conformité interne va vous coûter des heures.
Gagne en vitesse · perd en confidentialité
Cluster dédié à Madrid
Vitesse du cluster B200 avec HBM3e, modèles dernière génération en précision native, isolation au niveau VM. Prompts et code traités ici. Résidence des données 100 % espagnole, certifié ISO 27001 et ENS Media.
Vitesse · confidentialité · capacité
Tous les plans incluent
Proposition sur mesure
Chaque cas d'usage est différent. Dites-nous ce que vous voulez faire et nous vous envoyons une proposition concrète en moins de 24 heures.