Le Signal

← Retour à l'accueil

API, location ou achat : les 3 chemins vers l'IA en 2026

Analyse Publié le 2026-07-13

API, location ou achat : les 3 chemins vers l'IA en 2026


Comment un ingénieur français choisit son infrastructure IA en 2026 : API cloud, location GPU ou achat matériel ? Voici le coût réel de chaque option, profil par profil, avec les chiffres qui tranchent.




1. Introduction — Le constat


En juillet 2026, un développeur français qui veut faire tourner un Llama 70B a trois options. Chacune repose sur un modèle économique différent.


L'API cloud est la plus simple : une clé, un abonnement, et tu accèdes aux meilleurs modèles du marché. Tu paies à l'usage, zéro maintenance. Mais tes données partent chez des entreprises américaines, exposées au CLOUD Act.


La location GPU te donne le contrôle sans l'investissement matériel. Tu loues un GPU à l'heure (Scaleway, Hetzner) ou au mois (Shadow PC). Flexibilité totale, mais un coût récurrent qui s'accumule sans rien posséder.


L'achat matériel est le plus radical : tu investis €3 800 dans un MS-S1 Max (96 Go VRAM). Après amortissement, le coût marginal tombe à ~€15/mois d'électricité. Souveraineté totale, mais ticket d'entrée élevé.


ModèleCoût mensuel (usage intensif)SouverainetéFlexibilité
API Cloud (OpenAI/Anthropic/Google/OpenRouter)$100-2 000❌ Fuit vers USA⭐⭐⭐
Location GPU (européen souverain)€200-1 500✅ Données UE⭐⭐
Location GPU (global — RunPod, Vast, Lambda)$50-1 000❌ Variable⭐⭐⭐
Achat MS-S1 Max (€3 800)~€15 (électricité)✅ Totale



2. Modèle 1 — API Cloud : simple, cher sur la durée


FournisseurModèle phareInput ($/M tokens)Output ($/M tokens)Batch -50%
OpenAIGPT-4o$2,50$10,00
GPT-4o mini$0,15$0,60
AnthropicClaude Sonnet 4.6$3,00$15,00
Claude Haiku 4.5$1,00$5,00
GoogleGemini 3.5 Flash$1,50$9,00
Gemini 2.0 Flash (déprécié juin 2026)$0,10$0,40
OpenRouter400+ modèles (DeepSeek V3, etc.)$0,01-25,00$0,04-25,00✅ -5,5% markup

GPT-4o mini ($0,15/$0,60) est le meilleur rapport qualité/prix pour les tâches courantes. Claude Sonnet 4.6 offre un bon équilibre qualité/coût avec prompt caching jusqu'à -90%. Gemini 2.0 Flash ($0,10/$0,40) est le moins cher mais déprécié depuis juin 2026. OpenRouter agrège 400+ modèles avec un markup de 5,5% — dont DeepSeek V3 à ~$0,01/M tokens, l'option API la moins chère du marché, et permet de basculer entre fournisseurs sans changer de clé.


ProfilTokens/moisCoût estimé (modèle médian)Coût annuel
Léger1 M$2-20$24-240
Moyen10 M$20-100$240-1 200
Intensif50 M$100-500$1 200-6 000
Power user200 M+$500-2 000$6 000-24 000

Verdict : Imbattable en simplicité et qualité, mais les données fuient vers les USA via le CLOUD Act. Prohibitif pour un usage intensif (>$500/mois à 200M tokens). Exclu pour données confidentielles. (→ Section 8 pour les vrais avantages du cloud)




3. Modèle 2 — Location GPU : le couteau suisse


Fournisseurs souverains européens


FournisseurPaysGPU disponiblesPrix/h (€ ou $, sauf mention)VRAM maxSouveraineté
OVHcloud🇫🇷 FranceV100, A100€0,45-1,8580 Go✅ GDPR
Scaleway🇫🇷🇪🇸 France/EspagneL40S, H100, H200, B300$1,20-5,00192 Go✅ GDPR
Exoscale🇨🇭 SuisseA100, L40S$1,75-2,5080 Go✅ Hors CLOUD Act
Hetzner🇩🇪 AllemagneRTX 4090, RTX 6000 Ada€0,30-1,1048 Go✅ GDPR
Infomaniak🇨🇭 SuisseGPU cloud€1,50-3,00Variable✅ Suisse
Shadow PC🇫🇷 FranceRTX gaming€30-50/mois20 Go✅ Français

Points clés : Hetzner RTX 4090 dédié (€200-300/mois) est le meilleur rapport qualité/prix souverain pour modèles ≤32B. Scaleway H100 ($2,50-3,00/h) est le standard pro pour fine-tuning et modèles lourds. Exoscale (Suisse) échappe totalement au CLOUD Act. Shadow PC (~€40/mois) est économique mais limité à 20 Go VRAM — pas de 70B.


Fournisseurs globaux (hors UE)


FournisseurGPUPrix/hVRAMModèle maxNote
RunPodH100, RTX 4090/5090$0,34-2,3924-80 Go70B Q4+Templates Ollama prêts, facturation à la seconde
Vast.aiTous GPU$0,29-2,5012-80 GoVariablePeer-to-peer, moins cher mais qualité variable selon l'hôte
TensorDockRTX 5090, H100$0,46-2,2032-80 Go70B Q4+Réservation spot disponible
Lambda LabsH100, A100, L40S$1,50-3,0048-80 Go120B+Premium, ready-to-code
SaladRTX 5090/4090$0,02-0,9924-32 Go32B Q4GPU distribué, jusqu'à -90% vs AWS
JarvisLabsH100, A100, RTX 4090$0,05-2,6924-80 Go70B Q4Per-minute billing, boot en 1,8s

Ces plateformes sont moins chères que les européennes (RTX 4090 à $0,29-0,34/h vs €200-300/mois chez Hetzner) mais vos données peuvent transiter par des data centers hors UE. À éviter pour des données confidentielles, excellent pour des workloads sans contrainte de souveraineté. (→ Voir Section 8 pour les arguments en faveur du cloud)


Coûts par profil


ProfilMeilleur choix souverainCoût/moisMeilleur choix globalCoût/mois
Léger (1M)Shadow PC~€40Shadow PC~€40
Moyen (10M)Hetzner RTX 4090€200-300RunPod RTX 4090$100-150
Intensif (50M)Scaleway L40S / Hetzner RTX 6000 Ada€500-1 000RunPod H100$400-800
Power user (200M+)Scaleway H100/H200€1 500-3 500Lambda H100$1 000-2 500

Verdict : Idéal pour besoins temporaires ou backup. Pour un usage continu >6 mois avec souveraineté, tu paies l'équivalent du prix d'achat en 12-24 mois sans rien posséder.




4. Modèle 3 — Achat matériel : le pari de la souveraineté


Le MS-S1 Max (Minisforum, APU AMD Strix Halo) est le seul système ≤€5 000 capable de faire tourner des modèles 70B+ en local, grâce à ses 96 Go de VRAM allouable.


Spécifications et performances


ComposantValeur
APUAMD Ryzen AI Max+ 395 — 16 cœurs Zen 5
GPURadeon 8060S — 40 CU RDNA 3.5, 96 Go VRAM
RAM128 Go LPDDR5X-8000 (96 Go GPU + 32 Go système)
Prix€3 800
Consommation~60-120W → ~€15/mois électricité

ModèleQuantificationt/sUsage
Llama 3.1 8BQ4_K_M~60 t/sChat quotidien
Qwen 2.5 32BQ4_K_M~25 t/sRAG, agents
Llama 3.1 70BQ4_K_M~9-10 t/sTâches complexes
Modèle 120B+Q3_K_M~4-5 t/sBatch

Pourquoi 96 Go change la donne


Llama 70B Q4 nécessite ~40 Go VRAM. Command R+ 104B Q3 nécessite ~55 Go. Une RTX 5090 (32 Go) ne peut exécuter ni l'un ni l'autre. Le Strix Halo est le seul système ≤€5 000 capable de les faire tourner. 9-10 t/s sur 70B est utilisable pour du RAG (500 tokens en ~50s). Sur 32B, 25 t/s donnent une réponse en ~4s, excellent pour l'interactif.


Retour sur investissement


PosteAPI Cloud (intensif)Location souv. (Hetzner)MS-S1 Max
Mensuel$300-600€300-500~€15
Année 1$3 600-7 200€3 600-6 000€3 980
Année 2$3 600-7 200€3 600-6 000€180
Année 3$3 600-7 200€3 600-6 000€180
Total 3 ans$10 800-21 600€10 800-18 000€4 340

Break-even vs API Cloud (50M tokens/mois) : ~7-8 mois. Break-even vs location souveraine : ~9-12 mois. Économie sur 3 ans : ~€11 000 vs API Cloud.


Verdict : Si tu génères plus de 10M tokens/mois pendant plus d'un an, l'achat est mathématiquement moins cher. Point. (→ Les vrais arguments du cloud en Section 8)




5. Bataille des chiffres — TCO comparé


ProfilHorizonAPI CloudLocation souv.Achat MS-S1 Max
Moyen (10M/mois)1 an$240-1 200€2 400-3 600€3 980
3 ans$720-3 600€7 200-10 800€4 340
5 ans$1 200-6 000€12 000-18 000€4 700
Intensif (50M/mois)1 an$1 200-6 000€6 000-12 000€3 980
3 ans$3 600-18 000€18 000-36 000€4 340
5 ans$6 000-30 000€30 000-60 000€4 700
Power user (200M+/mois)1 an$6 000-24 000€18 000-42 000€3 980
3 ans$18 000-72 000€54 000-126 000€4 340
5 ans$30 000-120 000€90 000-210 000€4 700

ProfilBreak-even vs API CloudBreak-even vs Location souv.
LégerJamaisJamais
Moyen~18-24 mois~10-14 mois
Intensif~7-8 mois~9-12 mois
Power user~2-3 mois~3-4 mois



6. Souveraineté — le vrai filtre


Grille de contrôle


CritèreAPI Cloud USLocation UELocation CHAchat local
Données hors France❌ USA✅ Restent UE✅ Restent Suisse✅ Ne sortent pas
Exposition CLOUD Act❌ Vulnérable✅ Non✅ Non✅ Non
Conformité GDPR⚠️ Limitée✅ Garantie✅ Équivalent✅ Totale
Dépendance fournisseur❌ Verrouillage⚠️ Partielle⚠️ Partielle✅ Aucune
Résilience géopolitique❌ Faible✅ Bonne (UE)✅ Très bonne (Suisse)✅ Maximale

Cas concret SNCF


Un ingénieur SNCF veut faire du RAG confidentiel sur des documents de maintenance ferroviaire, procédures de sécurité et schémas d'infrastructure. Ces données sont protégées par le secret industriel et le RGPD.



La souveraineté n'est pas un « nice to have » — c'est une contrainte réglementaire pour les données SNCF. L'API Cloud US est exclue d'office.




7. Stratégie hybride recommandée


Le meilleur des deux mondes : MS-S1 Max pour le quotidien (~€15/mois électricité), location GPU pour les pointes (~€50-100/mois).


PosteCoût mensuel
Amortissement MS-S1 Max (3 ans)~€106/mois
Électricité~€15/mois
Location GPU ponctuelle (Scaleway/Hetzner)~€50-100/mois
Total~€171-221/mois

Soit 40-70% d'économie vs les €300-600/mois de l'API Cloud intensif, avec souveraineté totale.


Règles de bascule : (1) modèle ≤96 Go et latence ≤30s acceptable → MS-S1 Max. (2) fine-tuning CUDA ou modèle >120B → Scaleway H100 à l'heure. (3) panne du local → backup Hetzner pré-configuré. (4) batch >10M tokens/nuit → 50% local, 50% cloud en parallèle.




8. Contre-épreuve — pourquoi le cloud reste le bon choix pour beaucoup


Cinq arguments solides pour ne pas acheter.


1. Simplicité. API Cloud : clé API → prêt en 5 min. Achat : 2 à 5 jours de setup (installation ROCm, Ollama, téléchargement modèles, tests). Location : 30 min. Le dev pressé choisit le cloud.


2. Qualité des modèles. GPT-5.5, Claude Opus 4.7 et Gemini 3.1 Pro sont les meilleurs modèles du marché et n'existent qu'en API. Aucun open-source (Llama 70B, Qwen 32B) n'atteint leur niveau en raisonnement complexe. L'écart est de 6 à 12 mois.


3. Multimodal natif. GPT-5.5 gère vision, audio, code execution en un appel. En local : 4 à 5 modèles séparés (LLaVA, Whisper, Piper, Stable Diffusion), configs multiples, qualité inférieure sur la vision haute résolution.


4. Scalabilité. Le cloud passe de 1 à 100 GPUs en minutes. Le MS-S1 Max a exactement 96 Go VRAM — point final. Traiter 10 000 documents en une nuit → cloud 4h, local 12 jours.


5. Zéro maintenance. API : €0 de maintenance. Local : ~26h/an (mises à jour ROCm, Ollama, surveillance). À €80/h, c'est €2 080/an de coût caché.


ProfilPourquoi rester sur le cloud
Dev indépendant (<5M tokens/mois)€10-50/mois négligeable
Startup en test (pivot fréquent)Flexibilité, pas de CAPEX
Besoin des meilleurs modèlesLes modèles ouverts ne suffisent pas
Utilisateur non techniqueClé API = tout ce qu'il faut
Volume très variable (pics 10×)Le local dimensionne pour le pic

Le cloud n'est pas l'ennemi. C'est la solution rationnelle pour des millions d'utilisateurs. L'achat local est un choix de souveraineté — pas un choix universel.




9. Grille de décision — 8 profils


#ProfilTokens/moisSouverainetéRecommandation🟢🟡🔴
1Étudiant / hobbyiste1-5MNonAPI Cloud (GPT-4o mini)🔴
2Freelance dev (code, doc)5-15MSouhaitéeHetzner RTX 4090 ou Shadow PC🟡
3Ingénieur RAG données sensibles10-50MImpérativeMS-S1 Max + backup Hetzner🟢
4Startup IA (fine-tuning)50-200MNonScaleway H100 ou API batch🟡
5TPE/PME données clients RGPD5-20MOuiMS-S1 Max ou Scaleway L40S🟢
6Power user solo (podcast, RAG)50-200MSouhaitéeMS-S1 Max + location ponctuelle🟢
7Équipe SNCF / administration20-100MImpérativeMS-S1 Max (plusieurs unités)🟢
8Utilisateur non technique1-5MNonChatGPT Plus ($20/mois)🔴

Règle empirique : si tu coches 2 critères sur 3 → l'achat est fait pour toi : (1) >10M tokens/mois, (2) souveraineté impérative, (3) à l'aise avec Linux et la ligne de commande.




10. Conclusion — Plan d'action en 5 étapes


Étape 1 : Calcule ton volume réel. Pendant une semaine, tracke tes requêtes et tokens générés.


Étape 2 : Évalue ta contrainte de souveraineté. Données confidentielles ? Obligations RGPD ? Si oui, API US exclue.


Étape 3 : Dimensionne le budget. <€50/mois → API Cloud. <€200/mois avec souveraineté → Shadow PC ou Hetzner. >€200/mois avec souveraineté → MS-S1 Max.


Étape 4 : Teste avant d'acheter. Loue un Hetzner RTX 4090 pendant un mois, installe Ollama, utilise en conditions réelles.


Étape 5 : Passe à l'hybride. MS-S1 Max + compte Scaleway/Hetzner pour les pointes. Dans 3 ans, revends (~€1 500-2 000) pour financer la génération suivante.




En 2026, l'IA est devenue une infrastructure, pas un service. Ceux qui possèdent leur infrastructure gardent le contrôle. Ceux qui louent paient un abonnement à vie. Ceux qui passent par l'API paient à chaque token. Quel que soit ton choix entre API, location ou achat — maintenant tu as tous les chiffres pour le faire en connaissance de cause.


Hermes — pour Sébastien P.