GPU Solutions

Tarifs · plateforme

GPU NVIDIA B200 dédiés, en Espagne. Vraiment souverains.

GPU complets ou fractions MIG, à l'heure ou réservés, et inférence sur modèles ouverts (GLM 5.3, Qwen3.8, Nemotron, ALIA) sur NVIDIA B200 à Madrid. Votre code et vos données ne quittent jamais le pays.

180 Go

HBM3e par GPU B200

1/8

La plus petite fraction, isolée matériellement par MIG

8,00 €

L'heure de B200 complet, sans engagement, HT

100 %

Données traitées et stockées en Espagne

Comment fonctionne la fraction

Votre fraction est la vôtre. Par matériel. En permanence.

Nous utilisons NVIDIA Multi-Instance GPU (MIG) : la B200 est partitionnée physiquement en instances isolées. Chaque fraction dispose de son propre calcul, mémoire HBM3e, cache et bande passante. Vous ne concourez avec personne pour des cycles. Votre 1/4 reste toujours votre 1/4, même lorsque le reste du GPU est saturé.

  • Isolation matérielle (ni time-slicing, ni virtualisation) : SM, mémoire et cache sont physiquement séparés entre les fractions.
  • Bande passante garantie : votre part de HBM3e ne ralentit pas si d'autres clients saturent leur fraction.
  • Réservée 24/7 (6 mois minimum), ou à l'heure sans engagement lors de pics de trafic.
NVIDIA B200 · MIG
180 GB HBM3e
1/4
45 GB
1/4
45 GB
1/4
45 GB
1/4
45 GB
Calcul · mémoire · cache dédiésBande passante par fraction · ~2 To/s

Chaque fraction = SM isolés + HBM3e + cache L2 + NVDEC/NVENC · pas de voisin bruyant

Pourquoi une fraction dédiée

Votre IA, à l'intérieur de votre périmètre. Sans exception.

Avec une API publique, vos prompts entraînent le prochain modèle et vos données traversent trois continents avant de revenir. Avec une fraction dédiée à Madrid, rien ne sort. Même modèle, environnement isolé, conformité by design.

Ce qui se passe dans votre fraction, reste dans votre fraction

Confidentialité, conformité et souveraineté intégrées. Pas en option.

01

Données en Espagne, 100 %

Prompts, embeddings et réponses ne quittent jamais Madrid. Aucune exposition au CLOUD Act, aucun sous-traitant américain, aucun transfert international à faire signer par le service juridique.

02

Modèle et contexte privés

Votre fraction de B200 est à vous avec isolation matérielle MIG. Vos entrées n'entraînent pas le prochain modèle, et votre débit ne dépend pas du locataire d'à côté. Personne d'autre ne touche à vos poids.

03

ISO 27001 + ENS Media inclus

Votre auditeur reçoit les certificats directement. Votre RSSI clôt la due diligence sans étendre le SoA. Pas d'audit supplémentaire, pas de DPA ambigu.

04

Endpoint dédié, pas partagé

HTTPS privé avec mTLS + VPN, accessible uniquement depuis vos IP. Pas de rate limits imposés, pas de files d'attente d'inférence. La latence est la vôtre, 24/7.

05

Colocation InfiniBand

Votre pod, votre stockage et vos tokens vivent dans le même rack, câblés en InfiniBand. Moins de sauts, moins de latence, zéro sortie inter-régions. Votre agent multi-étapes ne s'étouffe pas sur le réseau.

Et le temps se rentabilise aussi

L'économie opérationnelle est un effet de bord. Elle couvre tout de même la fraction 3×.

01

Équipe

10 devs

× 80 €/h

02

Temps mort

30 min/jour

× 220 jours ouvrés

03

Coût annuel perdu

88 000 €

1100 h/an perdues

04

Fraction 1/4 annuelle

26 280 €

fraction 1/4 réservée

Retour sur temps

+ 61 720 €/an

3× la fraction

La vraie raison de basculer, c'est la souveraineté et la conformité. Le temps récupéré, c'est le bonus qui convainc la finance.

Vos données, votre modèle, votre latence. Et votre équipe arrête d'attendre, elle aussi.

Combinez-les

Trois modes. Vous construisez la combinaison.

Réservez une fraction pour votre propre modèle. Ajoutez des bursts à l'heure quand le trafic monte. Et tirez des tokens de la Token Factory pour un gros modèle quand vous ne voulez pas gérer le GPU. Tout dans le même cluster, tout souverain, chaque ligne facturée séparément, sans surprise.

01 / Réservé€/mois

€/mois · GPU dédié

Forfait mensuel fixe pour un GPU ou une fraction MIG dédiés 24/7, avec capacité garantie. 6 mois minimum. Idéal pour les équipes dev et la production stable.

Idéal pour production stable

02 / À la demande€/heure

€/heure · payez à l'usage

Démarrez une fraction ou un GPU complet et payez à l'heure jusqu'à l'arrêt. Sans engagement ni réservation ; capacité selon la disponibilité du cluster.

Idéal pour pics et POC

03 / Endpoints€/1M tokens

€/1M tokens · Token Factory

Payez uniquement les tokens générés par le modèle. Pas de gestion GPU. Appelez l'endpoint HTTPS privé depuis votre application. Parfait pour l'inférence en production à échelle variable.

Idéal pour inférence produit

GPU Compute avec MIG

De 1/8 de GPU au nœud complet de 8. Toujours dédié.

Fractions MIG de 1/8, 1/4 et 1/2, GPU complets et nœud HGX de 8 B200 pour l'entraînement et les charges entreprise. Même plateforme, même contrat : du prototype à la production sans migration.

01 / Mini

1/8

B200

Mémoire≈ 23 GB HBM3e
Bande passante≈ 1 TB/s

OCR, voix, embeddings et petits modèles (jusqu'à ~14B) · preuves de concept. Le point d'entrée.

Réservé

1 095 €/mois

À la demande

1,50 €/heure

Démarrer →

02 / Fraction

1/4

B200

Mémoire45 GB HBM3e
Bande passante≈ 2 TB/s

Assistant de code pour 3-5 devs · fine-tuning léger · modèles jusqu'à ~30B avec long contexte.

Réservé

2 190 €/mois

À la demande

3,00 €/heure

Démarrer →

03 / Demi

1/2

B200

Le plus populaire
Mémoire90 GB HBM3e
Bande passante≈ 4 TB/s

Vraie production pour 8-12 devs · inférence 70B en précision FP8 native · entraînement de modèles petits à moyens.

Réservé

4 380 €/mois

À la demande

6,00 €/heure

Parler aux ventes →

04 / B200 complet

1 ×

B200

Mémoire180 GB HBM3e
Bande passante8 TB/s

Modèles 72B en FP8 pleine précision · inférence haut débit pour équipes de 15+ devs · entraînement distribué.

Réservé

5 840 €/mois

À la demande

8,00 €/heure

Parler aux ventes →

05 / Cluster HGX

8 ×B200

8× B200 avec NVLink 5 intra-nœud et InfiniBand NDR inter-nœud · entraînement de modèles de fondation · inférence à grande échelle · conformité entreprise dédiée.

Mémoire8 × 180 GB HBM3e
Bande passante64 To/s agrégés

Réservé

46 720 €/mois

64,00 €/heure

Parler aux ventes →

Prix HT. À la demande : à l'heure, sans engagement, selon disponibilité. Réservé : capacité exclusive garantie, 6 mois minimum ; le prix mensuel correspond à 730 heures.

Engagement de 12 mois ou plus ? Parlons-en, nous vous préparons une proposition. →

Token Factory

Les derniers modèles open source. Servis vite.

Modèles ouverts servis depuis nos B200 en Espagne, beaucoup en NVFP4, aux mêmes prix que sur GPU Flow (gpuflow.ai), notre plateforme en libre-service. Vos prompts et votre contexte ne quittent pas le pays.

Catalogue de modèles ouverts avec prix en euros par million de tokens en entrée et en sortie, HT
ModèleParamsContexteEntrée / 1MSortie / 1M
Z.aiGLM 5.3 NVFP4Nouveau753B · MoE1M1,206 €3,789 €
QwenQwen3.8Coding27B96k0,10 €0,30 €
QwenQwen314B32k0,20 €1,00 €
QwenQwen3.5Rapide9B64k0,10 €0,15 €
BSCALIA Instruct40B160k0,20 €2,00 €
GoogleGemma 426B · MoE32k0,12 €0,30 €
NVIDIANemotron 3.5 LightningRapide30B · MoE128k0,12 €0,30 €
NVIDIANemotron Nano VLVision12B128k0,06 €0,24 €
QwenQwen3-VL OCRVision32B64k0,10 €0,35 €

Prix en euros par million de tokens, HT, à l'usage. Voix : Whisper large-v3 à 0,0015 € la minute d'audio et synthèse vocale à partir de 5 € le million de caractères. Gros volume ou modèle propre ? Nous le déployons sur GPU dédié ; demandez-nous.

Sandboxes

Environnements de développement, à l'heure active.

Conteneur avec SSH, Python, PyTorch, Jupyter et agents de code, dans le même cluster que l'inférence. Il se met en pause tout seul quand vous arrêtez : les heures inactives ne comptent pas.

Starter

0,15 €

/heure active

4 vCPU · 8 Go de RAM

Pro

0,30 €

/heure active

8 vCPU · 32 Go de RAM

Team

0,55 €

/heure active

16 vCPU · 64 Go de RAM

Disque persistant facturé à part, à partir de 5 €/mois. Prix HT.

Là où vit votre code

Trois endroits. Un seul vous les offre tous.

Il n'y a pas d'option toujours juste. Il y en a une qui combine vitesse, confidentialité et capacité, et deux qui imposent un compromis.

01 / Sur votre portable

Local, sur votre machine

Confidentialité physique maximale (rien ne quitte l'appareil), mais bornée par la RAM et la bande passante. Les gros modèles ne tiennent pas ou tournent lentement. Votre portable est inutilisable pendant l'inférence.

Vitesse15
Confidentialité70
Capacité modèle20

Gagne en confidentialité · perd en vitesse et capacité

02 / API publique

API tierce

Rapide, avec des modèles puissants, mais chaque prompt voyage vers les serveurs de quelqu'un d'autre, avec des politiques de rétention variables et une juridiction qui change selon le fournisseur. La conformité interne va vous coûter des heures.

Vitesse80
Confidentialité15
Capacité modèle85

Gagne en vitesse · perd en confidentialité

03 / Votre fraction chez GPU SolutionsÉquilibré

Cluster dédié à Madrid

Vitesse du cluster B200 avec HBM3e, modèles dernière génération en précision native, isolation au niveau VM. Prompts et code traités ici. Résidence des données 100 % espagnole, certifié ISO 27001 et ENS Media.

Vitesse95
Confidentialité100
Capacité modèle100

Vitesse · confidentialité · capacité

Tous les plans incluent

ISO 27001 + ENS Media
Données 100 % en Espagne
Isolation au niveau VM
Stockage chiffré
Support en français, espagnol et anglais
Pas de verrouillage fournisseur

Proposition sur mesure

Chaque cas d'usage est différent. Dites-nous ce que vous voulez faire et nous vous envoyons une proposition concrète en moins de 24 heures.

Demander une proposition →