Le Signal

← Retour à l'accueil

Le PC qui remplace le cloud : comment un mini-PC à 3 000 € te libère des abonnements API

Enquête Publié le 2026-07-13

Le PC qui remplace le cloud : comment un mini-PC à 3 000 € te libère des abonnements API


Benchmarks, coûts, ROI — l'analyse complète pour savoir si 2026 est l'année où tu passes au local.




Introduction — Le déclic


Il est 22 h 17, un mardi soir. Tu ouvres ton relevé bancaire, et tu commences à additionner machinalement : ChatGPT Plus, 24 €. Claude Pro, 20 €. GitHub Copilot, 10 €. Perplexity Pro, 20 €. Midjourney, 10 €. API OpenAI, 75 €. API Anthropic, 50 €.


Tu recomptes deux fois. 209 €. Par mois. 2 508 € par an.


C'est le prix d'un ordinateur complet. Neuf. Chaque année. Et ça ne s'arrête jamais.


Je ne sais pas à quel moment la location mensuelle de puissance de calcul est devenue notre nouveau loyer. Mais ce soir-là, la question qui tue s'est plantée dans ma tête : et si, au lieu de louer, on achetait ?


À la SNCF, on ne loue pas un TER à l'année. On achète la rame — 10 à 13 millions d'euros — et on l'amortit sur 30 à 40 ans. L'abonnement, c'est le taxi. L'investissement, c'est le train. Ce qui suit, c'est l'histoire d'un type qui a décidé d'acheter son train.




1. Le coût caché des abonnements — 209 €/mois, le trou noir des API


Le piège des abonnements IA est diaboliquement bien conçu. Chaque service, pris individuellement, coûte entre 10 et 24 € par mois. Une bagatelle. Mais la cascade est implacable : tu commences par ChatGPT Plus, tu ajoutes Claude Pro pour la rédaction, GitHub Copilot pour le code, Perplexity Pro pour la recherche sourcée, Midjourney pour les visuels — et soudain, ta liste fait six lignes.


Le détail qui fait mal


ServicePrix mensuelUsage principal
ChatGPT Plus~24 € TTCChat, code, recherche
Claude Pro~20 €Rédaction, analyse, raisonnement
GitHub Copilot~10 €Assistance code
Perplexity Pro~20 €Recherche sourcée
Midjourney Basic~10 €Génération d'images
API OpenAI (tokens supplémentaires)30-100 €Usage modéré à intensif
API Anthropic (tokens supplémentaires)25-75 €Usage modéré à intensif

Les scénarios annuels — le grand écart


ScénarioServicesCoût mensuelCoût annuel
MinimalChatGPT Plus uniquement~20 €~240 €
LégerChatGPT + Copilot~30 €~360 €
MoyenChatGPT + Claude + Copilot~50 €~600 €
Usage proChatGPT + Claude + Perplexity + Copilot + Midjourney~80 €~960 €
IntensifAbonnements + API OpenAI (75 €) + API Anthropic (50 €)~205 €~2 460 €
Power userAbonnements premium + API lourdes~305 €~3 660 €

Les prix API sont une variable qu'on sous-estime toujours. L'API OpenAI facture ~2,50-5,00 $ par million de tokens en entrée et 10-15 $ en sortie. Un usage quotidien modéré (500K tokens/jour) ajoute 30-50 $/mois. Un usage intensif (2M tokens/jour) peut atteindre 100-150 $/mois. L'API Anthropic suit la même dynamique.


C'est ce qu'on appelle la subscription fatigue : on cumule 3 à 6 services sans jamais calculer le coût total de possession. Et surtout, ça ne s'arrête jamais. Tu peux résilier Netflix. Tu ne peux pas résilier ta productivité.


Métaphore ferroviaire — Le péage perpétuel. Imagine une ligne où tu paies un péage à chaque gare. Tu ne t'arrêtes jamais de payer, même quand le train est à quai. Le local, c'est l'achat de la voie ferrée une bonne fois pour toutes.




2. Le matériel — Strix Halo, une locomotive de poche


En 2026, un processeur a changé la donne : l'AMD Ryzen AI Max+ 395, nom de code Strix Halo. C'est le premier APU véritablement conçu pour l'inférence locale de gros modèles de langage.


La pièce maîtresse



Les trois machines qui l'embarquent


MachinePrix (2026)ParticularitéDisponibilité
GMKtec EVO-X2~2 900-3 160 €Prêt à l'emploi, retour Amazon 30 joursDisponible
Minisforum MS-S1 Max~2 500-3 000 €Port OCuLink pour GPU externe, évolutifPrécommandes
Carte mère BD395i MAX~800-1 000 € (carte seule)Format Mini-ITX, pour build customDisponible

Les alternatives en face


MachinePrixRAMForces / Faiblesses
Mac Mini M4 Pro~1 399 €24 Go unifié✅ Prix bas, ❌ OOM sur modèles > 30B
HP ZGX Nano G1n~4 880-5 900 €128 Go✅ CUDA natif, ❌ prix prohibitif
RTX 5090 (tour)~3 000-4 000 €32 Go GDDR7✅ Ultra rapide, ❌ VRAM limitée, 350W
NVIDIA DIGITS (DGX Spark)~2 800 € (annoncé)128 Go❌ Toujours pas disponible

Métaphore ferroviaire — Le choix du matériel roulant. Strix Halo, c'est le TER nouvelle génération : pas le plus rapide du réseau (TGV = RTX 5090), mais assez puissant pour la plupart des missions, avec assez d'espace pour embarquer toutes les marchandises. Le Mac Mini M4 Pro, c'est l'autorail — parfait sur les petites lignes, mais tu ne peux pas y mettre un conteneur de 70B.




3. Benchmarks — les vitesses de ligne


On entre dans le dur. Voici ce que donne le Strix Halo (GMKtec EVO-X2) face au Mac Mini M4 Pro (24 Go) et à la RTX 5090 (32 Go). Benchmarks en Q4_K_M (quantification 4-bit), contexte 4 096 tokens, outil llama.cpp / Ollama.


ModèleTailleGMKtec EVO-X2 (128 Go)Mac Mini M4 Pro (24 Go)RTX 5090 (32 Go)
Llama 3.1 8B8B~60 tok/s~45 tok/s~120-158 tok/s
Qwen 3 32B32B dense~25 tok/s~12-15 tok/s~48-61 tok/s
Gemma 4 27B27B~28 tok/s~14 tok/s~60 tok/s
Llama 3.1 70B Q470B~9-15 tok/s❌ OOM~30-52 tok/s
Qwen 3 72B Q472B~8-10 tok/s❌ OOM~25-28 tok/s
DeepSeek Coder V3 Q3~100B~4-5 tok/s❌ OOM~15-18 tok/s
GLM-5.2 distillé~50B~12 tok/s❌ OOM~35 tok/s
Qwen 3.6 72B MoE72B MoE~70 tok/s❌ OOM

OOM = Out Of Memory. Le modèle ne tient pas dans 24 Go.


La grille de confort


SeuilTokens/sUsage possible
🟥 Chiant< 5Batch uniquement
🟧 Minimal5-10Chat lent mais fonctionnel
🟨 Correct10-20Usage quotidien texte
🟩 Fluide20-40Interactif agréable
🟦 Rapide40-60Presque instantané
🟪 Temps réel60+Streaming, lecture dépassée

Ce qu'il faut retenir



Métaphore ferroviaire — Les vitesses de ligne. Le Strix Halo, c'est du 160 km/h (25 tok/s en 32B). Pas un TGV (RTX = 300 km/h), mais largement suffisant pour les trajets quotidiens. Et surtout, contrairement au TGV qui ne passe pas sur toutes les lignes (OOM sur les gros modèles), le Strix Halo accepte les convois exceptionnels.




4. L'équation économique — 3 000 € une fois, ou 300 € par mois


Assez de théorie. Voici les chiffres qui comptent.


Comparaison sur 5 et 10 ans


ScénarioInvestissementCoût/anTotal 5 ansTotal 10 ans
Cloud intensif0 €2 400-3 600 €12 000-18 000 €24 000-36 000 €
GMKtec EVO-X2 + électricité3 160 €108-180 €3 700-4 060 €4 240-4 960 €
Mac Mini M4 Pro usage modéré1 399 €60-100 €1 699-1 899 €1 999-2 399 €
HP ZGX Nano5 900 €100-150 €6 400-6 650 €6 900-7 400 €

Le break-even



Le détail électricité : le GMKtec consomme 80-120 W en charge, 30-50 W au repos. Au tarif réglementé français (0,194 €/kWh, estimé 0,25 € taxes incluses), c'est ~9-15 €/mois, soit ~108-180 €/an.


La règle SNCF


« Un investissement se calcule sur la durée de vie, pas sur le coût initial. »


Un Strix Halo amorti sur 5-7 ans = 35-50 €/mois tout compris. Le cloud intensif, c'est 200-300 €/mois. Le rapport est de 1 à 6.


Sur 5 ans, l'économie est de 68 à 78 %. Sur 10 ans, elle grimpe à 82-86 %.


Métaphore ferroviaire — L'amortissement, pas le prix d'achat. La SNCF n'achète pas un TER en se demandant « combien ça coûte aujourd'hui », mais « combien ça coûte par an sur 30 ans ». Appliqué au mini-PC : 3 160 € / 5 ans = 53 €/mois. Le cloud, c'est 300 €/mois. Le choix est entendu — à moins que tu n'aimes les mensualités à vie.




5. Les bénéfices cachés — ce que les chiffres ne disent pas


L'économie est le premier argument. Mais il y a quatre avantages qu'aucun tableau ne capture.


Confidentialité — le train blindé


Tes prompts, tes données, tes conversations professionnelles — tout reste chez toi. Aucun datacenter, aucun serveur OpenAI ou Anthropic ne voit passer tes échanges. Pour les données sensibles (code propriétaire, stratégie d'entreprise, informations médicales), c'est un argument qui pèse plus lourd que tous les benchmarks.


Liberté — pas de gateau, pas de downtime


Tu n'es pas dépendant de la disponibilité d'une API, d'une hausse de prix, d'une modification des conditions d'utilisation, d'une panne Azure. Le LLM tourne sur ta table. Tant qu'il y a de l'électricité, tu travailles.


Apprentissage — tu deviens le maître du moteur


Configurer ROCm, choisir une quantification, comparer des modèles, comprendre pourquoi un MoE est plus efficace qu'un dense sur ta machine — tout cela fait de toi un meilleur ingénieur. Le cloud abstrait la complexité. Le local te la confronte. Et tu en sors plus fort.


Résilience — la ligne régionale


Quand OpenAI ajuste ses prix à la hausse (et ça arrive tous les 12-18 mois), tu ne bronches pas. Quand un nouveau modèle open source bat GPT-5 sur un benchmark spécifique, tu le télécharges et tu l'essaies dans l'heure. Pas de file d'attente, pas de quota, pas d'abonnement à changer.


Métaphore ferroviaire — Le train blindé. La confidentialité, c'est le fourgon blindé : personne n'ouvre tes colis. La liberté, c'est être son propre chef de gare : tu fixes tes horaires et ton itinéraire. L'apprentissage, c'est connaître les voies mieux que personne.




6. Contre-épreuve — quand le cloud reste indispensable


L'honnêteté intellectuelle, c'est de reconnaître les limites de sa thèse. Car le cloud conserve des avantages réels en 2026 — et les ignorer affaiblirait l'argumentaire.


Argument 1 — La qualité des modèles propriétaires


GPT-5, Claude Opus 4.5, Gemini 2.5 Pro dominent tous les benchmarks (MMLU-Pro, GPQA, MATH-500). Aucun modèle open source ne les égale sur le raisonnement complexe. Et ils ne seront jamais libérés : OpenAI, Anthropic et Google ne mettront pas leur or en open source.


Pondération : 9/10. Sur 90 % des usages quotidiens (code courant, rédaction), Qwen 3 32B ou Llama 70B suffisent. Mais les 10 % restants — problèmes algorithmiques difficiles, synthèse multi-sources avancée — restent l'apanage du cloud.


Argument 2 — Le multimodal


GPT-5 et Gemini intègrent vision, audio, code execution et génération d'images dans le même modèle. Le local nécessite 4-5 modèles différents avec des pipelines artisanaux. La génération d'images (Midjourney V7) reste 5 à 10× plus lente sur un Strix Halo (iGPU) que sur le cloud, et la qualité n'est pas au rendez-vous.


Pondération : 8/10. Si ton usage est multimodal lourd, le cloud reste indispensable en 2026. Le local peut gérer le texte. Pas l'image pro.


Argument 3 — La latence et le débit


Gemini 2.5 Flash répond en 200-400 ms. Un Llama 70B Q4 sur Strix Halo met 5-10 secondes pour générer une réponse de taille moyenne. L'expérience est fondamentalement différente : conversation contre attente.


Le Strix Halo plafonne à 1-2 utilisateurs simultanés en confortable. Pour une équipe ou un service en production, oublie.


Pondération : 8/10. Sur les modèles 8B-32B, le Strix Halo répond en 1-3 secondes (~25-60 tok/s) : c'est acceptable. Le problème ne se pose que sur les modèles 70B+. Solution : utiliser des modèles plus petits pour les tâches simples.


Argument 4 — La simplicité


ChatGPT s'ouvre en 3 secondes dans un navigateur. Pas d'installation, pas de driver GPU, pas de ROCm, pas de variable d'environnement, pas de compilation llama.cpp avec les bons flags. Le setup d'un Strix Halo, c'est 2 à 6 heures pour un utilisateur technique. Pour un non-technicien, c'est 1 à 3 jours.


Pondération : 8/10. Depuis mars 2026, Ollama supporte ROCm out-of-the-box sur Strix Halo. Mais « out-of-the-box » signifie toujours : installer le bon OS, comprendre les flags Vulkan, vérifier que le kernel supporte ROCm. Ce n'est pas du plug-and-play.


Argument 5 — La scalabilité


Besoin de traiter 10 000 documents en une nuit ? L'API cloud scale instantanément : 100 requêtes en parallèle, terminé en 10 minutes. Le Strix Halo traite tout en séquence : 3 à 5 heures.


Dans 3 ans, quand les modèles feront 500B paramètres, le Strix Halo sera obsolète. Le cloud, tu loues un H100 et c'est réglé.


Pondération : 8/10. Le local n'est pas conçu pour le batch massif. C'est une station de travail personnelle, pas un datacenter.


Argument 6 — Les longs contextes et l'écosystème


Gemini 2.5 Pro avale 1 million de tokens de contexte d'une traite. GPT-5 en gère 256K. Sur un Strix Halo, un modèle 70B Q4 ne peut tenir que ~32K-64K tokens en mémoire avant que le swapping ne dégrade la latence. L'analyse d'une codebase entière, la révision d'un rapport annuel de 200 pages, le traitement de logs sur plusieurs jours — tout cela reste le domaine du cloud.


Côté écosystème, OpenAI et Anthropic offrent un support centralisé, une documentation abondante, et des mises à jour de fonctionnalités toutes les 2 à 4 semaines. En local, la communauté est réactive (Reddit, Discord, GitHub Issues), mais un problème ROCm obscur peut vous coûter deux jours de debug sans garantie de réponse. Le coût d'opportunité du temps passé n'apparaît pas dans les tableaux.


Pondération : 7/10. Pour des contextes de 8-16K tokens (l'immense majorité des usages quotidiens), le local est bon. Au-delà ou si tu comptes sur un support professionnel, le cloud reste indispensable.


Le vrai coût caché du local


3 160 € + le temps de setup (2-6 h × ~50 €/h = 100-300 €) + la maintenance (2-4 h/mois) + le stockage (SSD 2 To pour les modèles, ~150 €) + l'électricité (~10-15 €/mois). Le vrai TCO sur 5 ans tourne plutôt autour de ~5 000 € que des 3 700 € annoncés. Le break-even passe alors de 12-18 mois à 15-24 mois selon le profil.


Métaphore ferroviaire — La ligne de secours. Le cloud, c'est la grande ligne électrifiée avec aiguillage centralisé. Le local, c'est la ligne régionale avec chef de gare. La grande ligne ne tombe jamais en panne, mais coûte cher à l'usage. Le régional, c'est à toi d'entretenir les voies — mais c'est ton réseau, tes horaires, ta liberté.




7. Guide de décision — le tableau des correspondances


Tout le monde n'a pas besoin du même train. Voici qui devrait passer au local, rester sur le cloud, ou faire de l'hybride.


La grille des départs


ProfilRecommandationJustification
Développeur solo — usage code + chat intensif🟢 Passe au local (Strix Halo)Break-even ~15 mois, Llama 70B + Qwen 32B couvrent 90 % des besoins
Power user — 4-6 abonnements + API🟢 Passe au local (Strix Halo ou HP ZGX)Économie 68-78 % sur 5 ans, meilleure confidentialité
Maker / hobbyiste — usage léger🟢 Mac Mini M4 Pro (1 399 €)Break-even 6-9 mois, modèles < 30B suffisent
Utilisateur d'images IA (Midjourney)🟡 HybrideLocal pour le texte, cloud pour l'image
Équipe de 3-5 personnes🟡 HybrideLocal pour les tâches courantes, API pour la production
Entreprise / production haute charge🔴 Reste sur le cloudScaling, latence, fiabilité
Chercheur — fine-tuning, entraînement🔴 Cloud + GPU dédié (RTX 5090)ROCm insuffisant pour l'entraînement, CUDA reste roi
Utilisateur d'API Claude/GPT de pointe🔴 Reste sur le cloudModèles propriétaires non disponibles en local

Comment faire si tu passes au local


  1. Choisis la machine : GMKtec EVO-X2 (prêt à l'emploi, retour Amazon 30 jours), Minisforum MS-S1 Max (port OCuLink, évolutif), ou BD395i MAX (build custom).
  2. Installe le logiciel : Ubuntu/Debian → Ollama (ROCm out-of-the-box depuis mars 2026) → télécharge les modèles phares (Qwen 3 32B, Llama 3.1 70B Q4, Qwen 3.6 72B MoE).
  3. Configure les outils : Open WebUI (interface web), Continue.dev (IDE), API locale compatible OpenAI.
  4. Transfère les workflows : Résilie les abonnements redondants, garde le cloud pour les usages avancés (images, longs contextes).
  5. Prévois le budget électricité : ~10-15 €/mois, soit l'équivalent d'un café par semaine.

  6. Métaphore ferroviaire — Le tableau des correspondances. Comme à la SNCF, tout le monde n'a pas besoin du même train. Le choix du matériel roulant dépend de la ligne, du trafic, du budget. On ne te vend pas une solution unique — on te donne la grille des départs. À toi de choisir ton quai.




    Conclusion — Montez, le train va partir


    3 000 € une fois, ou 300 € par mois. Sur 5 ans, c'est 4 000 € contre 18 000 €. Le calcul est implacable.


    Nous vivons un moment historique : pour la première fois, un ordinateur à moins de 3 200 € permet de faire tourner localement des modèles de langage qui, il y a trois ans, nécessitaient des clusters cloud. La décision n'est plus technique. Elle est économique.


    Et le contexte ne fait que renforcer la tendance. En juillet 2026, Ollama a levé 65 M$ en Series B — mené par Theory Ventures — et revendique 9 millions d'utilisateurs mensuels actifs, dont 85 % du Fortune 500. 14 employés. 88 M$ de financement total depuis 2023. Ce n'est pas un épiphénomène : c'est le signal qu'un marché entier bascule.


    Les modèles MoE (Qwen 3.6 72B à 70 tok/s sur Strix Halo) atteignent aujourd'hui des performances qui étaient celles des API premium il y a deux ans. Et la cadence de progression des modèles ouverts s'accélère (Llama 4, Qwen 4, DeepSeek V4) tandis que les modèles fermés plafonnent sur leurs benchmarks.


    Le soir fatidique de l'introduction, le personnage a fait le calcul. Aujourd'hui, il écrit ces lignes sur un LLM qui tourne dans son salon, sur un mini-PC qui lui a coûté le prix d'un an d'abonnements — et qui sera gratuit pour les cinq prochaines années.


    Le train est en gare. Il ne reste plus qu'à monter.




    Article rédigé le 13 juillet 2026.


    Rédigé par un assistant IA tournant en inférence locale.


    Hermes — pour Sébastien P.




    Ressources et références


    SujetSource
    Ollama $65M Series BTechCrunch, juillet 2026
    Prix électricité Francefournisseurs-electricite.com, juillet 2026
    Benchmarks Strix HaloLevel1Techs Forum, Framework Community
    Prix API OpenAIdevelopers.openai.com
    Prix API Anthropicdocs.anthropic.com
    ROCm support Strix Halorocm.docs.amd.com, TechPowerUp
    GMKtec EVO-X2Amazon.fr, GMKtec.com
    Minisforum MS-S1 MaxLiliputing, Tweaktown
    HP ZGX Nano G1nHP Store, Newegg