GPU Solutions

Services

Infrastructure, inférence et conseil en IA, depuis l'Espagne

Trois lignes de service sur la même plateforme NVIDIA B200, dans un centre de données Tier III à Madrid : GPU dédié, inférence de modèles ouverts et conseil. Vous pouvez commencer par n'importe laquelle et passer à une autre sans changer de fournisseur ni de contrat.

En bref
  • GPU NVIDIA B200 dédié à partir de 1,50 €/h (fraction 1/8) et 8,00 €/h le GPU complet.
  • Inférence de modèles ouverts à partir de 0,06 € le million de tokens d'entrée sur GPU Flow.
  • Première séance de conseil de 45 minutes gratuite, avec un ingénieur.
  • Données en Espagne, équipe interne et environnement dédié standard 72 heures après la signature.
A · GPU dédié

GPU NVIDIA B200 dédié

GPU complet, fractions isolées au niveau matériel ou nœuds entiers. À la demande et sans engagement pour valider, ou réservé avec capacité garantie pour la production. Votre environnement, votre image, votre accès. Toutes les configurations sont sur la page tarifs.

à partir de1,50 €/h

Idéal pour les équipes techniques qui veulent leurs propres GPU, isolés et en Espagne, d'un pilote à l'heure jusqu'à la production.

Voir les tarifs →

Fraction MIG

1/8 · 1/4 · 1/2

Une partie du GPU avec sa propre mémoire et sa propre puissance de calcul, isolée au niveau matériel grâce à MIG (Multi-Instance GPU) : aucun autre client n'utilise vos ressources. 1/8 avec environ 23 Go pour 1,50 €/h, 1/4 avec 45 Go pour 3,00 €/h et 1/2 avec 90 Go pour 6,00 €/h. Pour l'inférence, l'OCR, la voix et les modèles de taille moyenne.

Pod dédié

1 à 4 GPU · passthrough

D'un à quatre GPU B200 physiques complets dans notre cluster, attribués en passthrough : votre environnement accède directement au matériel, sans couche de virtualisation intermédiaire. Chaque GPU dispose de 180 Go de mémoire HBM3e à 8 To/s. Nous livrons une image configurée avec les bibliothèques de votre projet. 8,00 €/h par GPU.

Nœud bare-metal complet

8 × B200 · NVLink

Un serveur entier de huit B200 pour vous, hors du cluster partagé, livré monté et avec votre propre accès. Les GPU communiquent entre eux par NVLink 5 à 1,8 To/s chacun et le nœud est relié en InfiniBand NDR à 400 Gb/s. Pour l'entraînement, l'ajustement fin et les grands modèles, à 64,00 €/h.

Sandbox de développement

à partir de 0,15 €/h active

Un conteneur prêt à l'emploi avec SSH, Python, PyTorch, Jupyter et des agents de code. Vous ne payez que les heures d'utilisation, car il se met en pause quand vous arrêtez de travailler. Idéal pour que votre équipe teste des modèles, prépare des données ou développe avant de passer à un GPU dédié.

B · Inférence

Des modèles ouverts, servis depuis l'Espagne

Utilisez les meilleurs modèles ouverts sans gérer de GPU. Par une API compatible avec les SDK d'OpenAI et d'Anthropic, ou sur un endpoint privé réservé à votre organisation. Tout est traité à Madrid et rien de ce que vous envoyez ne sert à entraîner des modèles.

à partir de0,06 €/M tokens

Idéal si vous voulez intégrer l'IA à vos applications et processus sans vous occuper de l'infrastructure.

GPU Flow →

API au token sur GPU Flow

paiement à l'usage

Des modèles comme GLM 5.3, Qwen3.8, Gemma 4 26B, Nemotron 3.5 Lightning 30B ou ALIA 40B, du Barcelona Supercomputing Center, disponibles sur GPU Flow. Vous payez les tokens traités, à partir de 0,06 € le million en entrée. Si vous utilisez déjà les SDK d'OpenAI ou d'Anthropic, il suffit de changer l'adresse et la clé dans votre code.

Endpoint privé dédié

GPU réservé

Le modèle ouvert de votre choix, ou votre propre modèle ajusté, déployé sur des GPU réservés à votre organisation. Pas de file d'attente partagée avec d'autres clients, vos propres règles d'accès et une capacité dimensionnée pour votre volume. C'est la bonne option quand la confidentialité ou une charge soutenue l'exigent.

Voix et documents

Whisper · OCR · TTS

Transcription audio avec Whisper large-v3, lecture de documents numérisés avec des modèles de vision comme Qwen3-VL 32B et Nemotron Nano 12B VL, et synthèse vocale. Pour les procès-verbaux, les enregistrements de réunions, les dossiers papier ou l'accueil téléphonique, avec des données traitées en Espagne.

C · Conseil

Une infrastructure IA pensée avec méthode

Nous avons construit et exploitons notre propre infrastructure. Nous vous aidons à décider de la vôtre en mesurant votre charge sur notre cluster, avant d'engager un budget, puis nous vous accompagnons dans la conception, le déploiement et l'exploitation.

première séance45 min, sans frais

Idéal si vous devez choisir l'infrastructure IA de votre organisation et voulez le faire sur des données mesurées.

Demander la séance →

Dimensionnement

mémoire · calcul · réseau

Nous traduisons votre cas d'usage (modèles, longueur de contexte, utilisateurs simultanés et temps de réponse attendu) en configuration adaptée. Nous ne l'estimons pas sur le papier : nous le mesurons en exécutant votre charge sur notre cluster B200, pour que la décision repose sur des données réelles et non sur des fiches techniques.

Architecture de référence NVIDIA

DGX Spark → HGX B200

Le bon produit pour chaque étape, selon l'architecture de référence de NVIDIA : DGX Spark sur le bureau pour les pilotes et le développement, stations RTX PRO pour les départements et HGX B200 pour la production. Nous vous aidons à assembler chaque élément avec le réseau, le stockage et les logiciels nécessaires.

Conception de centre de données GPU

densité · refroidissement

Puissance par baie, refroidissement liquide direct sur puce, réseau InfiniBand haut débit et stockage parallèle. Nous appliquons ce que nous avons appris en déployant et en exploitant NVIDIA Blackwell sur notre propre cluster, pour que votre centre de données soit prêt pour la densité des GPU actuels.

Exploitation gérée

votre matériel, notre équipe

Si votre organisation dispose de sa propre infrastructure, nous l'exploitons pour vous : supervision, mises à jour, maintenance et support, avec NVIDIA Base Command Manager et notre équipe en Espagne. La propriété du matériel et des données reste la vôtre à tout moment.

Options

Ce que vous pouvez ajouter à tout environnement.

Nous les intégrons à la proposition selon votre cas. Interrogez-nous sur chacune d'elles.

Stockage Exascaler

Un système de fichiers parallèle pour les charges intensives en données, comme l'entraînement ou de grandes collections de documents. Chaque client dispose de son propre espace, avec quotas et contrôle d'accès indépendants.

espace propre · avec quotas

Haute disponibilité

Des GPU de remplacement dans le même cluster. Comme vos données résident sur le stockage Exascaler et non sur le GPU, l'environnement redémarre sur un autre GPU sans rien déplacer.

standard < 24 h · 24/7 < 4 h

Connectivité dédiée

Une liaison point à point chiffrée entre votre site ou votre centre de données et notre cluster à Madrid, via un partenaire de connectivité, pour que votre trafic ne passe jamais par l'internet public.

cryptographie post-quantique disponible

Que choisir

Votre besoin, la bonne option.

Un guide rapide. Si votre cas ne correspond à aucune ligne, parlez-nous-en et nous l'étudierons ensemble.

Votre besoin, la bonne option.
BesoinLigneModalitéÀ partir de
Tester un modèle ouvert cette semaineB · InférenceAPI au token sur GPU Flow0,06 €/M tokens
Développer et expérimenter avec des agents de codeA · GPU dédiéSandbox de développement0,15 €/h active
Servir un modèle moyen, de l'OCR ou de la voix en productionA · GPU dédiéFraction MIG de 1/8 à 1/21,50 €/h
Donner l'IA à tout le personnel avec des données sensiblesB · InférenceEndpoint privé dédiéSelon le volume
Ajuster ou entraîner un modèle sur vos donnéesA · GPU dédiéPod dédié ou nœud 8 × B2008,00 €/h
Choisir l'infrastructure IA de votre organisationC · ConseilDimensionnement45 min, sans frais

Questions fréquentes

Quelle différence entre GPU à la demande et GPU réservé ?

À la demande, vous payez à l'heure, sans engagement et selon la disponibilité ; en réservé, la capacité est garantie, avec un minimum de six mois. Un B200 complet coûte 8,00 €/h à la demande ou 5 840 € par mois en réservé (730 heures). Pour des engagements plus longs, parlons-en.

Qu'est-ce qu'une fraction MIG, et est-ce sûr ?

C'est une partie d'un GPU B200 isolée au niveau matériel, avec sa propre mémoire et sa propre puissance de calcul. MIG (Multi-Instance GPU) est une technologie NVIDIA qui sépare les fractions au niveau de la puce : aucun autre client ne peut voir ni utiliser vos ressources. Elle va de 1/8 (environ 23 Go) à 1/2 (90 Go).

Puis-je utiliser mon propre modèle ?

Oui. Vous pouvez le déployer sur un pod dédié avec votre propre image ou nous demander un endpoint privé qui le sert uniquement à votre organisation. Vos modèles et leurs poids restent les vôtres et vous pouvez les emporter quand vous le souhaitez.

En combien de temps mon environnement est-il prêt ?

Un environnement dédié standard est prêt 72 heures après la signature. L'API de GPU Flow est en libre-service : vous pouvez l'utiliser dès votre inscription.

Les prix incluent-ils la TVA ?

Non. Tous les prix publiés s'entendent hors TVA et figurent sur la page tarifs. Les options (stockage, haute disponibilité et connectivité dédiée) sont intégrées à la proposition selon votre cas.

Puis-je changer de modalité ou de ligne plus tard ?

Oui. Les trois lignes reposent sur la même plateforme : vous pouvez passer de l'API à un GPU dédié, ou d'une fraction à un pod, sans changer de fournisseur. Vos données, modèles et poids vous appartiennent à tout moment.

Prochaine étape

Parlez-nous de votre cas et nous vous proposerons la configuration.

Parler à un ingénieur →