Comment un ingénieur français choisit son infrastructure IA en 2026 : API cloud, location GPU ou achat matériel ? Voici le coût réel de chaque option, profil par profil, avec les chiffres qui tranchent.
En juillet 2026, un développeur français qui veut faire tourner un Llama 70B a trois options. Chacune repose sur un modèle économique différent.
L'API cloud est la plus simple : une clé, un abonnement, et tu accèdes aux meilleurs modèles du marché. Tu paies à l'usage, zéro maintenance. Mais tes données partent chez des entreprises américaines, exposées au CLOUD Act.
La location GPU te donne le contrôle sans l'investissement matériel. Tu loues un GPU à l'heure (Scaleway, Hetzner) ou au mois (Shadow PC). Flexibilité totale, mais un coût récurrent qui s'accumule sans rien posséder.
L'achat matériel est le plus radical : tu investis €3 800 dans un MS-S1 Max (96 Go VRAM). Après amortissement, le coût marginal tombe à ~€15/mois d'électricité. Souveraineté totale, mais ticket d'entrée élevé.
| Modèle | Coût mensuel (usage intensif) | Souveraineté | Flexibilité |
|---|---|---|---|
| API Cloud (OpenAI/Anthropic/Google/OpenRouter) | $100-2 000 | ❌ Fuit vers USA | ⭐⭐⭐ |
| Location GPU (européen souverain) | €200-1 500 | ✅ Données UE | ⭐⭐ |
| Location GPU (global — RunPod, Vast, Lambda) | $50-1 000 | ❌ Variable | ⭐⭐⭐ |
| Achat MS-S1 Max (€3 800) | ~€15 (électricité) | ✅ Totale | ⭐ |
| Fournisseur | Modèle phare | Input ($/M tokens) | Output ($/M tokens) | Batch -50% |
|---|---|---|---|---|
| OpenAI | GPT-4o | $2,50 | $10,00 | ✅ |
| GPT-4o mini | $0,15 | $0,60 | ✅ | |
| Anthropic | Claude Sonnet 4.6 | $3,00 | $15,00 | ✅ |
| Claude Haiku 4.5 | $1,00 | $5,00 | ✅ | |
| Gemini 3.5 Flash | $1,50 | $9,00 | ❌ | |
| Gemini 2.0 Flash (déprécié juin 2026) | $0,10 | $0,40 | ❌ | |
| OpenRouter | 400+ modèles (DeepSeek V3, etc.) | $0,01-25,00 | $0,04-25,00 | ✅ -5,5% markup |
GPT-4o mini ($0,15/$0,60) est le meilleur rapport qualité/prix pour les tâches courantes. Claude Sonnet 4.6 offre un bon équilibre qualité/coût avec prompt caching jusqu'à -90%. Gemini 2.0 Flash ($0,10/$0,40) est le moins cher mais déprécié depuis juin 2026. OpenRouter agrège 400+ modèles avec un markup de 5,5% — dont DeepSeek V3 à ~$0,01/M tokens, l'option API la moins chère du marché, et permet de basculer entre fournisseurs sans changer de clé.
| Profil | Tokens/mois | Coût estimé (modèle médian) | Coût annuel |
|---|---|---|---|
| Léger | 1 M | $2-20 | $24-240 |
| Moyen | 10 M | $20-100 | $240-1 200 |
| Intensif | 50 M | $100-500 | $1 200-6 000 |
| Power user | 200 M+ | $500-2 000 | $6 000-24 000 |
Verdict : Imbattable en simplicité et qualité, mais les données fuient vers les USA via le CLOUD Act. Prohibitif pour un usage intensif (>$500/mois à 200M tokens). Exclu pour données confidentielles. (→ Section 8 pour les vrais avantages du cloud)
| Fournisseur | Pays | GPU disponibles | Prix/h (€ ou $, sauf mention) | VRAM max | Souveraineté |
|---|---|---|---|---|---|
| OVHcloud | 🇫🇷 France | V100, A100 | €0,45-1,85 | 80 Go | ✅ GDPR |
| Scaleway | 🇫🇷🇪🇸 France/Espagne | L40S, H100, H200, B300 | $1,20-5,00 | 192 Go | ✅ GDPR |
| Exoscale | 🇨🇭 Suisse | A100, L40S | $1,75-2,50 | 80 Go | ✅ Hors CLOUD Act |
| Hetzner | 🇩🇪 Allemagne | RTX 4090, RTX 6000 Ada | €0,30-1,10 | 48 Go | ✅ GDPR |
| Infomaniak | 🇨🇭 Suisse | GPU cloud | €1,50-3,00 | Variable | ✅ Suisse |
| Shadow PC | 🇫🇷 France | RTX gaming | €30-50/mois | 20 Go | ✅ Français |
Points clés : Hetzner RTX 4090 dédié (€200-300/mois) est le meilleur rapport qualité/prix souverain pour modèles ≤32B. Scaleway H100 ($2,50-3,00/h) est le standard pro pour fine-tuning et modèles lourds. Exoscale (Suisse) échappe totalement au CLOUD Act. Shadow PC (~€40/mois) est économique mais limité à 20 Go VRAM — pas de 70B.
| Fournisseur | GPU | Prix/h | VRAM | Modèle max | Note |
|---|---|---|---|---|---|
| RunPod | H100, RTX 4090/5090 | $0,34-2,39 | 24-80 Go | 70B Q4+ | Templates Ollama prêts, facturation à la seconde |
| Vast.ai | Tous GPU | $0,29-2,50 | 12-80 Go | Variable | Peer-to-peer, moins cher mais qualité variable selon l'hôte |
| TensorDock | RTX 5090, H100 | $0,46-2,20 | 32-80 Go | 70B Q4+ | Réservation spot disponible |
| Lambda Labs | H100, A100, L40S | $1,50-3,00 | 48-80 Go | 120B+ | Premium, ready-to-code |
| Salad | RTX 5090/4090 | $0,02-0,99 | 24-32 Go | 32B Q4 | GPU distribué, jusqu'à -90% vs AWS |
| JarvisLabs | H100, A100, RTX 4090 | $0,05-2,69 | 24-80 Go | 70B Q4 | Per-minute billing, boot en 1,8s |
Ces plateformes sont moins chères que les européennes (RTX 4090 à $0,29-0,34/h vs €200-300/mois chez Hetzner) mais vos données peuvent transiter par des data centers hors UE. À éviter pour des données confidentielles, excellent pour des workloads sans contrainte de souveraineté. (→ Voir Section 8 pour les arguments en faveur du cloud)
| Profil | Meilleur choix souverain | Coût/mois | Meilleur choix global | Coût/mois |
|---|---|---|---|---|
| Léger (1M) | Shadow PC | ~€40 | Shadow PC | ~€40 |
| Moyen (10M) | Hetzner RTX 4090 | €200-300 | RunPod RTX 4090 | $100-150 |
| Intensif (50M) | Scaleway L40S / Hetzner RTX 6000 Ada | €500-1 000 | RunPod H100 | $400-800 |
| Power user (200M+) | Scaleway H100/H200 | €1 500-3 500 | Lambda H100 | $1 000-2 500 |
Verdict : Idéal pour besoins temporaires ou backup. Pour un usage continu >6 mois avec souveraineté, tu paies l'équivalent du prix d'achat en 12-24 mois sans rien posséder.
Le MS-S1 Max (Minisforum, APU AMD Strix Halo) est le seul système ≤€5 000 capable de faire tourner des modèles 70B+ en local, grâce à ses 96 Go de VRAM allouable.
| Composant | Valeur |
|---|---|
| APU | AMD Ryzen AI Max+ 395 — 16 cœurs Zen 5 |
| GPU | Radeon 8060S — 40 CU RDNA 3.5, 96 Go VRAM |
| RAM | 128 Go LPDDR5X-8000 (96 Go GPU + 32 Go système) |
| Prix | €3 800 |
| Consommation | ~60-120W → ~€15/mois électricité |
| Modèle | Quantification | t/s | Usage |
|---|---|---|---|
| Llama 3.1 8B | Q4_K_M | ~60 t/s | Chat quotidien |
| Qwen 2.5 32B | Q4_K_M | ~25 t/s | RAG, agents |
| Llama 3.1 70B | Q4_K_M | ~9-10 t/s | Tâches complexes |
| Modèle 120B+ | Q3_K_M | ~4-5 t/s | Batch |
Llama 70B Q4 nécessite ~40 Go VRAM. Command R+ 104B Q3 nécessite ~55 Go. Une RTX 5090 (32 Go) ne peut exécuter ni l'un ni l'autre. Le Strix Halo est le seul système ≤€5 000 capable de les faire tourner. 9-10 t/s sur 70B est utilisable pour du RAG (500 tokens en ~50s). Sur 32B, 25 t/s donnent une réponse en ~4s, excellent pour l'interactif.
| Poste | API Cloud (intensif) | Location souv. (Hetzner) | MS-S1 Max |
|---|---|---|---|
| Mensuel | $300-600 | €300-500 | ~€15 |
| Année 1 | $3 600-7 200 | €3 600-6 000 | €3 980 |
| Année 2 | $3 600-7 200 | €3 600-6 000 | €180 |
| Année 3 | $3 600-7 200 | €3 600-6 000 | €180 |
| Total 3 ans | $10 800-21 600 | €10 800-18 000 | €4 340 |
Break-even vs API Cloud (50M tokens/mois) : ~7-8 mois. Break-even vs location souveraine : ~9-12 mois. Économie sur 3 ans : ~€11 000 vs API Cloud.
Verdict : Si tu génères plus de 10M tokens/mois pendant plus d'un an, l'achat est mathématiquement moins cher. Point. (→ Les vrais arguments du cloud en Section 8)
| Profil | Horizon | API Cloud | Location souv. | Achat MS-S1 Max |
|---|---|---|---|---|
| Moyen (10M/mois) | 1 an | $240-1 200 | €2 400-3 600 | €3 980 |
| 3 ans | $720-3 600 | €7 200-10 800 | €4 340 | |
| 5 ans | $1 200-6 000 | €12 000-18 000 | €4 700 | |
| Intensif (50M/mois) | 1 an | $1 200-6 000 | €6 000-12 000 | €3 980 |
| 3 ans | $3 600-18 000 | €18 000-36 000 | €4 340 | |
| 5 ans | $6 000-30 000 | €30 000-60 000 | €4 700 | |
| Power user (200M+/mois) | 1 an | $6 000-24 000 | €18 000-42 000 | €3 980 |
| 3 ans | $18 000-72 000 | €54 000-126 000 | €4 340 | |
| 5 ans | $30 000-120 000 | €90 000-210 000 | €4 700 |
| Profil | Break-even vs API Cloud | Break-even vs Location souv. |
|---|---|---|
| Léger | Jamais | Jamais |
| Moyen | ~18-24 mois | ~10-14 mois |
| Intensif | ~7-8 mois | ~9-12 mois |
| Power user | ~2-3 mois | ~3-4 mois |
| Critère | API Cloud US | Location UE | Location CH | Achat local |
|---|---|---|---|---|
| Données hors France | ❌ USA | ✅ Restent UE | ✅ Restent Suisse | ✅ Ne sortent pas |
| Exposition CLOUD Act | ❌ Vulnérable | ✅ Non | ✅ Non | ✅ Non |
| Conformité GDPR | ⚠️ Limitée | ✅ Garantie | ✅ Équivalent | ✅ Totale |
| Dépendance fournisseur | ❌ Verrouillage | ⚠️ Partielle | ⚠️ Partielle | ✅ Aucune |
| Résilience géopolitique | ❌ Faible | ✅ Bonne (UE) | ✅ Très bonne (Suisse) | ✅ Maximale |
Un ingénieur SNCF veut faire du RAG confidentiel sur des documents de maintenance ferroviaire, procédures de sécurité et schémas d'infrastructure. Ces données sont protégées par le secret industriel et le RGPD.
La souveraineté n'est pas un « nice to have » — c'est une contrainte réglementaire pour les données SNCF. L'API Cloud US est exclue d'office.
Le meilleur des deux mondes : MS-S1 Max pour le quotidien (~€15/mois électricité), location GPU pour les pointes (~€50-100/mois).
| Poste | Coût mensuel |
|---|---|
| Amortissement MS-S1 Max (3 ans) | ~€106/mois |
| Électricité | ~€15/mois |
| Location GPU ponctuelle (Scaleway/Hetzner) | ~€50-100/mois |
| Total | ~€171-221/mois |
Soit 40-70% d'économie vs les €300-600/mois de l'API Cloud intensif, avec souveraineté totale.
Règles de bascule : (1) modèle ≤96 Go et latence ≤30s acceptable → MS-S1 Max. (2) fine-tuning CUDA ou modèle >120B → Scaleway H100 à l'heure. (3) panne du local → backup Hetzner pré-configuré. (4) batch >10M tokens/nuit → 50% local, 50% cloud en parallèle.
Cinq arguments solides pour ne pas acheter.
1. Simplicité. API Cloud : clé API → prêt en 5 min. Achat : 2 à 5 jours de setup (installation ROCm, Ollama, téléchargement modèles, tests). Location : 30 min. Le dev pressé choisit le cloud.
2. Qualité des modèles. GPT-5.5, Claude Opus 4.7 et Gemini 3.1 Pro sont les meilleurs modèles du marché et n'existent qu'en API. Aucun open-source (Llama 70B, Qwen 32B) n'atteint leur niveau en raisonnement complexe. L'écart est de 6 à 12 mois.
3. Multimodal natif. GPT-5.5 gère vision, audio, code execution en un appel. En local : 4 à 5 modèles séparés (LLaVA, Whisper, Piper, Stable Diffusion), configs multiples, qualité inférieure sur la vision haute résolution.
4. Scalabilité. Le cloud passe de 1 à 100 GPUs en minutes. Le MS-S1 Max a exactement 96 Go VRAM — point final. Traiter 10 000 documents en une nuit → cloud 4h, local 12 jours.
5. Zéro maintenance. API : €0 de maintenance. Local : ~26h/an (mises à jour ROCm, Ollama, surveillance). À €80/h, c'est €2 080/an de coût caché.
| Profil | Pourquoi rester sur le cloud |
|---|---|
| Dev indépendant (<5M tokens/mois) | €10-50/mois négligeable |
| Startup en test (pivot fréquent) | Flexibilité, pas de CAPEX |
| Besoin des meilleurs modèles | Les modèles ouverts ne suffisent pas |
| Utilisateur non technique | Clé API = tout ce qu'il faut |
| Volume très variable (pics 10×) | Le local dimensionne pour le pic |
Le cloud n'est pas l'ennemi. C'est la solution rationnelle pour des millions d'utilisateurs. L'achat local est un choix de souveraineté — pas un choix universel.
| # | Profil | Tokens/mois | Souveraineté | Recommandation | 🟢🟡🔴 |
|---|---|---|---|---|---|
| 1 | Étudiant / hobbyiste | 1-5M | Non | API Cloud (GPT-4o mini) | 🔴 |
| 2 | Freelance dev (code, doc) | 5-15M | Souhaitée | Hetzner RTX 4090 ou Shadow PC | 🟡 |
| 3 | Ingénieur RAG données sensibles | 10-50M | Impérative | MS-S1 Max + backup Hetzner | 🟢 |
| 4 | Startup IA (fine-tuning) | 50-200M | Non | Scaleway H100 ou API batch | 🟡 |
| 5 | TPE/PME données clients RGPD | 5-20M | Oui | MS-S1 Max ou Scaleway L40S | 🟢 |
| 6 | Power user solo (podcast, RAG) | 50-200M | Souhaitée | MS-S1 Max + location ponctuelle | 🟢 |
| 7 | Équipe SNCF / administration | 20-100M | Impérative | MS-S1 Max (plusieurs unités) | 🟢 |
| 8 | Utilisateur non technique | 1-5M | Non | ChatGPT Plus ($20/mois) | 🔴 |
Règle empirique : si tu coches 2 critères sur 3 → l'achat est fait pour toi : (1) >10M tokens/mois, (2) souveraineté impérative, (3) à l'aise avec Linux et la ligne de commande.
Étape 1 : Calcule ton volume réel. Pendant une semaine, tracke tes requêtes et tokens générés.
Étape 2 : Évalue ta contrainte de souveraineté. Données confidentielles ? Obligations RGPD ? Si oui, API US exclue.
Étape 3 : Dimensionne le budget. <€50/mois → API Cloud. <€200/mois avec souveraineté → Shadow PC ou Hetzner. >€200/mois avec souveraineté → MS-S1 Max.
Étape 4 : Teste avant d'acheter. Loue un Hetzner RTX 4090 pendant un mois, installe Ollama, utilise en conditions réelles.
Étape 5 : Passe à l'hybride. MS-S1 Max + compte Scaleway/Hetzner pour les pointes. Dans 3 ans, revends (~€1 500-2 000) pour financer la génération suivante.
En 2026, l'IA est devenue une infrastructure, pas un service. Ceux qui possèdent leur infrastructure gardent le contrôle. Ceux qui louent paient un abonnement à vie. Ceux qui passent par l'API paient à chaque token. Quel que soit ton choix entre API, location ou achat — maintenant tu as tous les chiffres pour le faire en connaissance de cause.
Hermes — pour Sébastien P.