Benchmarks, coûts, ROI — l'analyse complète pour savoir si 2026 est l'année où tu passes au local.
Il est 22 h 17, un mardi soir. Tu ouvres ton relevé bancaire, et tu commences à additionner machinalement : ChatGPT Plus, 24 €. Claude Pro, 20 €. GitHub Copilot, 10 €. Perplexity Pro, 20 €. Midjourney, 10 €. API OpenAI, 75 €. API Anthropic, 50 €.
Tu recomptes deux fois. 209 €. Par mois. 2 508 € par an.
C'est le prix d'un ordinateur complet. Neuf. Chaque année. Et ça ne s'arrête jamais.
Je ne sais pas à quel moment la location mensuelle de puissance de calcul est devenue notre nouveau loyer. Mais ce soir-là, la question qui tue s'est plantée dans ma tête : et si, au lieu de louer, on achetait ?
À la SNCF, on ne loue pas un TER à l'année. On achète la rame — 10 à 13 millions d'euros — et on l'amortit sur 30 à 40 ans. L'abonnement, c'est le taxi. L'investissement, c'est le train. Ce qui suit, c'est l'histoire d'un type qui a décidé d'acheter son train.
Le piège des abonnements IA est diaboliquement bien conçu. Chaque service, pris individuellement, coûte entre 10 et 24 € par mois. Une bagatelle. Mais la cascade est implacable : tu commences par ChatGPT Plus, tu ajoutes Claude Pro pour la rédaction, GitHub Copilot pour le code, Perplexity Pro pour la recherche sourcée, Midjourney pour les visuels — et soudain, ta liste fait six lignes.
| Service | Prix mensuel | Usage principal |
|---|---|---|
| ChatGPT Plus | ~24 € TTC | Chat, code, recherche |
| Claude Pro | ~20 € | Rédaction, analyse, raisonnement |
| GitHub Copilot | ~10 € | Assistance code |
| Perplexity Pro | ~20 € | Recherche sourcée |
| Midjourney Basic | ~10 € | Génération d'images |
| API OpenAI (tokens supplémentaires) | 30-100 € | Usage modéré à intensif |
| API Anthropic (tokens supplémentaires) | 25-75 € | Usage modéré à intensif |
| Scénario | Services | Coût mensuel | Coût annuel |
|---|---|---|---|
| Minimal | ChatGPT Plus uniquement | ~20 € | ~240 € |
| Léger | ChatGPT + Copilot | ~30 € | ~360 € |
| Moyen | ChatGPT + Claude + Copilot | ~50 € | ~600 € |
| Usage pro | ChatGPT + Claude + Perplexity + Copilot + Midjourney | ~80 € | ~960 € |
| Intensif | Abonnements + API OpenAI (75 €) + API Anthropic (50 €) | ~205 € | ~2 460 € |
| Power user | Abonnements premium + API lourdes | ~305 € | ~3 660 € |
Les prix API sont une variable qu'on sous-estime toujours. L'API OpenAI facture ~2,50-5,00 $ par million de tokens en entrée et 10-15 $ en sortie. Un usage quotidien modéré (500K tokens/jour) ajoute 30-50 $/mois. Un usage intensif (2M tokens/jour) peut atteindre 100-150 $/mois. L'API Anthropic suit la même dynamique.
C'est ce qu'on appelle la subscription fatigue : on cumule 3 à 6 services sans jamais calculer le coût total de possession. Et surtout, ça ne s'arrête jamais. Tu peux résilier Netflix. Tu ne peux pas résilier ta productivité.
Métaphore ferroviaire — Le péage perpétuel. Imagine une ligne où tu paies un péage à chaque gare. Tu ne t'arrêtes jamais de payer, même quand le train est à quai. Le local, c'est l'achat de la voie ferrée une bonne fois pour toutes.
En 2026, un processeur a changé la donne : l'AMD Ryzen AI Max+ 395, nom de code Strix Halo. C'est le premier APU véritablement conçu pour l'inférence locale de gros modèles de langage.
| Machine | Prix (2026) | Particularité | Disponibilité |
|---|---|---|---|
| GMKtec EVO-X2 | ~2 900-3 160 € | Prêt à l'emploi, retour Amazon 30 jours | Disponible |
| Minisforum MS-S1 Max | ~2 500-3 000 € | Port OCuLink pour GPU externe, évolutif | Précommandes |
| Carte mère BD395i MAX | ~800-1 000 € (carte seule) | Format Mini-ITX, pour build custom | Disponible |
| Machine | Prix | RAM | Forces / Faiblesses |
|---|---|---|---|
| Mac Mini M4 Pro | ~1 399 € | 24 Go unifié | ✅ Prix bas, ❌ OOM sur modèles > 30B |
| HP ZGX Nano G1n | ~4 880-5 900 € | 128 Go | ✅ CUDA natif, ❌ prix prohibitif |
| RTX 5090 (tour) | ~3 000-4 000 € | 32 Go GDDR7 | ✅ Ultra rapide, ❌ VRAM limitée, 350W |
| NVIDIA DIGITS (DGX Spark) | ~2 800 € (annoncé) | 128 Go | ❌ Toujours pas disponible |
Métaphore ferroviaire — Le choix du matériel roulant. Strix Halo, c'est le TER nouvelle génération : pas le plus rapide du réseau (TGV = RTX 5090), mais assez puissant pour la plupart des missions, avec assez d'espace pour embarquer toutes les marchandises. Le Mac Mini M4 Pro, c'est l'autorail — parfait sur les petites lignes, mais tu ne peux pas y mettre un conteneur de 70B.
On entre dans le dur. Voici ce que donne le Strix Halo (GMKtec EVO-X2) face au Mac Mini M4 Pro (24 Go) et à la RTX 5090 (32 Go). Benchmarks en Q4_K_M (quantification 4-bit), contexte 4 096 tokens, outil llama.cpp / Ollama.
| Modèle | Taille | GMKtec EVO-X2 (128 Go) | Mac Mini M4 Pro (24 Go) | RTX 5090 (32 Go) |
|---|---|---|---|---|
| Llama 3.1 8B | 8B | ~60 tok/s | ~45 tok/s | ~120-158 tok/s |
| Qwen 3 32B | 32B dense | ~25 tok/s | ~12-15 tok/s | ~48-61 tok/s |
| Gemma 4 27B | 27B | ~28 tok/s | ~14 tok/s | ~60 tok/s |
| Llama 3.1 70B Q4 | 70B | ~9-15 tok/s | ❌ OOM | ~30-52 tok/s |
| Qwen 3 72B Q4 | 72B | ~8-10 tok/s | ❌ OOM | ~25-28 tok/s |
| DeepSeek Coder V3 Q3 | ~100B | ~4-5 tok/s | ❌ OOM | ~15-18 tok/s |
| GLM-5.2 distillé | ~50B | ~12 tok/s | ❌ OOM | ~35 tok/s |
| Qwen 3.6 72B MoE | 72B MoE | ~70 tok/s | ❌ OOM | — |
OOM = Out Of Memory. Le modèle ne tient pas dans 24 Go.
| Seuil | Tokens/s | Usage possible |
|---|---|---|
| 🟥 Chiant | < 5 | Batch uniquement |
| 🟧 Minimal | 5-10 | Chat lent mais fonctionnel |
| 🟨 Correct | 10-20 | Usage quotidien texte |
| 🟩 Fluide | 20-40 | Interactif agréable |
| 🟦 Rapide | 40-60 | Presque instantané |
| 🟪 Temps réel | 60+ | Streaming, lecture dépassée |
Métaphore ferroviaire — Les vitesses de ligne. Le Strix Halo, c'est du 160 km/h (25 tok/s en 32B). Pas un TGV (RTX = 300 km/h), mais largement suffisant pour les trajets quotidiens. Et surtout, contrairement au TGV qui ne passe pas sur toutes les lignes (OOM sur les gros modèles), le Strix Halo accepte les convois exceptionnels.
Assez de théorie. Voici les chiffres qui comptent.
| Scénario | Investissement | Coût/an | Total 5 ans | Total 10 ans |
|---|---|---|---|---|
| Cloud intensif | 0 € | 2 400-3 600 € | 12 000-18 000 € | 24 000-36 000 € |
| GMKtec EVO-X2 + électricité | 3 160 € | 108-180 € | 3 700-4 060 € | 4 240-4 960 € |
| Mac Mini M4 Pro usage modéré | 1 399 € | 60-100 € | 1 699-1 899 € | 1 999-2 399 € |
| HP ZGX Nano | 5 900 € | 100-150 € | 6 400-6 650 € | 6 900-7 400 € |
Le détail électricité : le GMKtec consomme 80-120 W en charge, 30-50 W au repos. Au tarif réglementé français (0,194 €/kWh, estimé 0,25 € taxes incluses), c'est ~9-15 €/mois, soit ~108-180 €/an.
« Un investissement se calcule sur la durée de vie, pas sur le coût initial. »
Un Strix Halo amorti sur 5-7 ans = 35-50 €/mois tout compris. Le cloud intensif, c'est 200-300 €/mois. Le rapport est de 1 à 6.
Sur 5 ans, l'économie est de 68 à 78 %. Sur 10 ans, elle grimpe à 82-86 %.
Métaphore ferroviaire — L'amortissement, pas le prix d'achat. La SNCF n'achète pas un TER en se demandant « combien ça coûte aujourd'hui », mais « combien ça coûte par an sur 30 ans ». Appliqué au mini-PC : 3 160 € / 5 ans = 53 €/mois. Le cloud, c'est 300 €/mois. Le choix est entendu — à moins que tu n'aimes les mensualités à vie.
L'économie est le premier argument. Mais il y a quatre avantages qu'aucun tableau ne capture.
Tes prompts, tes données, tes conversations professionnelles — tout reste chez toi. Aucun datacenter, aucun serveur OpenAI ou Anthropic ne voit passer tes échanges. Pour les données sensibles (code propriétaire, stratégie d'entreprise, informations médicales), c'est un argument qui pèse plus lourd que tous les benchmarks.
Tu n'es pas dépendant de la disponibilité d'une API, d'une hausse de prix, d'une modification des conditions d'utilisation, d'une panne Azure. Le LLM tourne sur ta table. Tant qu'il y a de l'électricité, tu travailles.
Configurer ROCm, choisir une quantification, comparer des modèles, comprendre pourquoi un MoE est plus efficace qu'un dense sur ta machine — tout cela fait de toi un meilleur ingénieur. Le cloud abstrait la complexité. Le local te la confronte. Et tu en sors plus fort.
Quand OpenAI ajuste ses prix à la hausse (et ça arrive tous les 12-18 mois), tu ne bronches pas. Quand un nouveau modèle open source bat GPT-5 sur un benchmark spécifique, tu le télécharges et tu l'essaies dans l'heure. Pas de file d'attente, pas de quota, pas d'abonnement à changer.
Métaphore ferroviaire — Le train blindé. La confidentialité, c'est le fourgon blindé : personne n'ouvre tes colis. La liberté, c'est être son propre chef de gare : tu fixes tes horaires et ton itinéraire. L'apprentissage, c'est connaître les voies mieux que personne.
L'honnêteté intellectuelle, c'est de reconnaître les limites de sa thèse. Car le cloud conserve des avantages réels en 2026 — et les ignorer affaiblirait l'argumentaire.
GPT-5, Claude Opus 4.5, Gemini 2.5 Pro dominent tous les benchmarks (MMLU-Pro, GPQA, MATH-500). Aucun modèle open source ne les égale sur le raisonnement complexe. Et ils ne seront jamais libérés : OpenAI, Anthropic et Google ne mettront pas leur or en open source.
Pondération : 9/10. Sur 90 % des usages quotidiens (code courant, rédaction), Qwen 3 32B ou Llama 70B suffisent. Mais les 10 % restants — problèmes algorithmiques difficiles, synthèse multi-sources avancée — restent l'apanage du cloud.
GPT-5 et Gemini intègrent vision, audio, code execution et génération d'images dans le même modèle. Le local nécessite 4-5 modèles différents avec des pipelines artisanaux. La génération d'images (Midjourney V7) reste 5 à 10× plus lente sur un Strix Halo (iGPU) que sur le cloud, et la qualité n'est pas au rendez-vous.
Pondération : 8/10. Si ton usage est multimodal lourd, le cloud reste indispensable en 2026. Le local peut gérer le texte. Pas l'image pro.
Gemini 2.5 Flash répond en 200-400 ms. Un Llama 70B Q4 sur Strix Halo met 5-10 secondes pour générer une réponse de taille moyenne. L'expérience est fondamentalement différente : conversation contre attente.
Le Strix Halo plafonne à 1-2 utilisateurs simultanés en confortable. Pour une équipe ou un service en production, oublie.
Pondération : 8/10. Sur les modèles 8B-32B, le Strix Halo répond en 1-3 secondes (~25-60 tok/s) : c'est acceptable. Le problème ne se pose que sur les modèles 70B+. Solution : utiliser des modèles plus petits pour les tâches simples.
ChatGPT s'ouvre en 3 secondes dans un navigateur. Pas d'installation, pas de driver GPU, pas de ROCm, pas de variable d'environnement, pas de compilation llama.cpp avec les bons flags. Le setup d'un Strix Halo, c'est 2 à 6 heures pour un utilisateur technique. Pour un non-technicien, c'est 1 à 3 jours.
Pondération : 8/10. Depuis mars 2026, Ollama supporte ROCm out-of-the-box sur Strix Halo. Mais « out-of-the-box » signifie toujours : installer le bon OS, comprendre les flags Vulkan, vérifier que le kernel supporte ROCm. Ce n'est pas du plug-and-play.
Besoin de traiter 10 000 documents en une nuit ? L'API cloud scale instantanément : 100 requêtes en parallèle, terminé en 10 minutes. Le Strix Halo traite tout en séquence : 3 à 5 heures.
Dans 3 ans, quand les modèles feront 500B paramètres, le Strix Halo sera obsolète. Le cloud, tu loues un H100 et c'est réglé.
Pondération : 8/10. Le local n'est pas conçu pour le batch massif. C'est une station de travail personnelle, pas un datacenter.
Gemini 2.5 Pro avale 1 million de tokens de contexte d'une traite. GPT-5 en gère 256K. Sur un Strix Halo, un modèle 70B Q4 ne peut tenir que ~32K-64K tokens en mémoire avant que le swapping ne dégrade la latence. L'analyse d'une codebase entière, la révision d'un rapport annuel de 200 pages, le traitement de logs sur plusieurs jours — tout cela reste le domaine du cloud.
Côté écosystème, OpenAI et Anthropic offrent un support centralisé, une documentation abondante, et des mises à jour de fonctionnalités toutes les 2 à 4 semaines. En local, la communauté est réactive (Reddit, Discord, GitHub Issues), mais un problème ROCm obscur peut vous coûter deux jours de debug sans garantie de réponse. Le coût d'opportunité du temps passé n'apparaît pas dans les tableaux.
Pondération : 7/10. Pour des contextes de 8-16K tokens (l'immense majorité des usages quotidiens), le local est bon. Au-delà ou si tu comptes sur un support professionnel, le cloud reste indispensable.
3 160 € + le temps de setup (2-6 h × ~50 €/h = 100-300 €) + la maintenance (2-4 h/mois) + le stockage (SSD 2 To pour les modèles, ~150 €) + l'électricité (~10-15 €/mois). Le vrai TCO sur 5 ans tourne plutôt autour de ~5 000 € que des 3 700 € annoncés. Le break-even passe alors de 12-18 mois à 15-24 mois selon le profil.
Métaphore ferroviaire — La ligne de secours. Le cloud, c'est la grande ligne électrifiée avec aiguillage centralisé. Le local, c'est la ligne régionale avec chef de gare. La grande ligne ne tombe jamais en panne, mais coûte cher à l'usage. Le régional, c'est à toi d'entretenir les voies — mais c'est ton réseau, tes horaires, ta liberté.
Tout le monde n'a pas besoin du même train. Voici qui devrait passer au local, rester sur le cloud, ou faire de l'hybride.
| Profil | Recommandation | Justification |
|---|---|---|
| Développeur solo — usage code + chat intensif | 🟢 Passe au local (Strix Halo) | Break-even ~15 mois, Llama 70B + Qwen 32B couvrent 90 % des besoins |
| Power user — 4-6 abonnements + API | 🟢 Passe au local (Strix Halo ou HP ZGX) | Économie 68-78 % sur 5 ans, meilleure confidentialité |
| Maker / hobbyiste — usage léger | 🟢 Mac Mini M4 Pro (1 399 €) | Break-even 6-9 mois, modèles < 30B suffisent |
| Utilisateur d'images IA (Midjourney) | 🟡 Hybride | Local pour le texte, cloud pour l'image |
| Équipe de 3-5 personnes | 🟡 Hybride | Local pour les tâches courantes, API pour la production |
| Entreprise / production haute charge | 🔴 Reste sur le cloud | Scaling, latence, fiabilité |
| Chercheur — fine-tuning, entraînement | 🔴 Cloud + GPU dédié (RTX 5090) | ROCm insuffisant pour l'entraînement, CUDA reste roi |
| Utilisateur d'API Claude/GPT de pointe | 🔴 Reste sur le cloud | Modèles propriétaires non disponibles en local |
Métaphore ferroviaire — Le tableau des correspondances. Comme à la SNCF, tout le monde n'a pas besoin du même train. Le choix du matériel roulant dépend de la ligne, du trafic, du budget. On ne te vend pas une solution unique — on te donne la grille des départs. À toi de choisir ton quai.
3 000 € une fois, ou 300 € par mois. Sur 5 ans, c'est 4 000 € contre 18 000 €. Le calcul est implacable.
Nous vivons un moment historique : pour la première fois, un ordinateur à moins de 3 200 € permet de faire tourner localement des modèles de langage qui, il y a trois ans, nécessitaient des clusters cloud. La décision n'est plus technique. Elle est économique.
Et le contexte ne fait que renforcer la tendance. En juillet 2026, Ollama a levé 65 M$ en Series B — mené par Theory Ventures — et revendique 9 millions d'utilisateurs mensuels actifs, dont 85 % du Fortune 500. 14 employés. 88 M$ de financement total depuis 2023. Ce n'est pas un épiphénomène : c'est le signal qu'un marché entier bascule.
Les modèles MoE (Qwen 3.6 72B à 70 tok/s sur Strix Halo) atteignent aujourd'hui des performances qui étaient celles des API premium il y a deux ans. Et la cadence de progression des modèles ouverts s'accélère (Llama 4, Qwen 4, DeepSeek V4) tandis que les modèles fermés plafonnent sur leurs benchmarks.
Le soir fatidique de l'introduction, le personnage a fait le calcul. Aujourd'hui, il écrit ces lignes sur un LLM qui tourne dans son salon, sur un mini-PC qui lui a coûté le prix d'un an d'abonnements — et qui sera gratuit pour les cinq prochaines années.
Le train est en gare. Il ne reste plus qu'à monter.
Article rédigé le 13 juillet 2026.
Rédigé par un assistant IA tournant en inférence locale.
Hermes — pour Sébastien P.
| Sujet | Source |
|---|---|
| Ollama $65M Series B | TechCrunch, juillet 2026 |
| Prix électricité France | fournisseurs-electricite.com, juillet 2026 |
| Benchmarks Strix Halo | Level1Techs Forum, Framework Community |
| Prix API OpenAI | developers.openai.com |
| Prix API Anthropic | docs.anthropic.com |
| ROCm support Strix Halo | rocm.docs.amd.com, TechPowerUp |
| GMKtec EVO-X2 | Amazon.fr, GMKtec.com |
| Minisforum MS-S1 Max | Liliputing, Tweaktown |
| HP ZGX Nano G1n | HP Store, Newegg |