Tu paies encore pour que quelqu'un d'autre possède ton cerveau. Voici comment racheter ta liberté pour le prix de 36 mois d'abonnements.
Il est 22 h 17, un mardi soir de novembre 2025. Je suis sur ma ligne de banque en ligne, en train d'additionner les prélèvements automatiques du mois. ChatGPT Plus : 20 $. Claude Pro : 20 $. GitHub Copilot : 10 $. Midjourney : 10 $. API OpenAI pour les scripts batch que je lance le week-end : 35 $. API Anthropic pour la relecture longue : 25 $. Total du mois : 120 $. Depuis combien de temps, au fait ?
Je scrolle l'historique. Février 2023 — je me souviens du jour où j'ai pris le premier abonnement. Deux ans et demi. 36 mois. Et je n'ai même pas compté les paiements à l'usage. Une fraction de seconde plus tard, un chiffre s'affiche mentalement : plus de 4 000 €. Partis en fumée. Pour des tokens que je n'ai jamais possédés, exécutés sur des serveurs dont j'ignore la localisation, dans des data centers que je ne verrai jamais.
Ce soir-là, j'ai ouvert un onglet de recherche. Tape : « mini PC Strix Halo 128 Go prix ». Le résultat : 3 160 €. Une facture unique. Et soudain, le calcul n'est plus un calcul : depuis deux ans et demi, j'ai déjà dépensé davantage en abonnements cloud que ce que coûte la machine qui pourrait tous les remplacer.
Ce moment, je l'appelle le déclic ferroviaire — parce qu'à la SNCF, on sait ce que veut dire un coût d'exploitation qui dépasse l'investissement initial. Un TER, tu l'achètes une fois, tu l'amortis sur trente ans. Un abonnement API, tu le paies tous les mois, et dans trois ans tu n'as rien — pas un serveur, pas un GPU, pas un modèle, pas un fichier. Rien.
Cet article est le procès-verbal de ce déclic.
En 2023, un abonnement à un LLM, c'était une curiosité. En 2026, c'est un poste de dépense aussi normalisé que Netflix ou Spotify. Sauf que Netflix ne te facture pas le nombre d'heures passées devant la télé, et que Spotify ne te demande pas 10 € supplémentaires par mois pour accéder à la version « haute fidélité » de ta playlist.
L'IA, elle, a inventé un modèle économique pernicieux : l'abonnement de base + le paiement à l'usage pour les vrais besoins.
Voici à quoi ressemble le portefeuille d'un utilisateur typique fin 2026 :
| Service | Abonnement mensuel | Usage typique | Coût annuel |
|---|---|---|---|
| ChatGPT Plus (OpenAI) | 20 $ | Assistant quotidien, rédaction, code | 240 $ |
| Claude Pro (Anthropic) | 20 $ | Documents longs, analyse, relecture | 240 $ |
| GitHub Copilot | 10 $ | Complétion de code, IDE | 120 $ |
| API OpenAI (tokens supplémentaires) | 30 $ | Scripts batch, RAG, fine-tuning | 360 $ |
| Midjourney / Flux | 10 $ | Génération d'images | 120 $ |
| Perplexity Pro | 20 $ | Recherche web augmentée | 240 $ |
| Total usage moyen | 110 $ | 1 320 $ |
Soit 1 320 $ par an pour une utilisation que je qualifierais de « confortable » — ni power-user, ni joueur du dimanche. Un power-user qui lance des pipelines RAG, qui fait du data mining sur ses propres documents, qui expérimente des LoRA, qui maintient un podcast automatisé (avec Voicebox ou ElevenLabs local) : on monte facilement à 200-300 $/mois.
Sur trois ans, l'utilisateur moyen aura dépensé près de 4 000 $. Le power-user : 7 000 à 10 000 $. Sans posséder un seul watt de calcul en propre.
Ce n'est pas un hasard si Ollama, le moteur d'inférence locale open source, a levé 65 M $ en Series B en 2025, avec 9 millions d'utilisateurs actifs. Le marché de l'IA locale n'est plus un hobby de bricoleur — c'est une lame de fond.
Quand tu regardes les chiffres, la logique est imparable :
Prenons trois profils types. Calculons sur 36 mois. Et comparons avec l'achat d'un mini-PC Strix Halo à 3 000 € (estimation haute, incluant un éventuel disque NVMe supplémentaire et la RAM).
Utilisateur qui se contente de ChatGPT Plus (20 $) + du gratuit. Pas de tokens additionnels.
| Poste | Cloud sur 3 ans | Mini-PC local |
|---|---|---|
| Abonnements | 1 080 $ (30 $ × 36) | 0 $ |
| Matériel | 0 $ | 3 000 € (~3 300 $) |
| Électricité (3 ans) | 0 $ | ~540 € (15 €/mois × 36) |
| Maintenance | 0 $ | ~100 € (mises à jour, SSD si casse) |
| Total | ~1 080 $ | ~3 640 € |
💡 Seuil de rentabilité : jamais atteint en 3 ans. Pour un usage léger, le cloud reste moins cher.
Le profil décrit plus haut : ChatGPT + Claude + Copilot + API + Midjourney.
| Poste | Cloud sur 3 ans | Mini-PC local |
|---|---|---|
| Abonnements | 3 960 $ (110 $ × 36) | 0 $ |
| Matériel | 0 $ | 3 000 € |
| Électricité | 0 $ | ~540 € |
| Maintenance | 0 $ | ~100 € |
| Total | ~3 960 $ | ~3 640 € |
💡 Seuil de rentabilité : ~33 mois. En dessous de 3 ans, c'est neutre. Au-delà, c'est tout bénef.
Power-user : API intensive (RAG, batch processing, fine-tuning), plusieurs abonnements premium, usage quotidien lourd.
| Poste | Cloud sur 3 ans | Mini-PC local |
|---|---|---|
| Abonnements | 9 000 $ (250 $ × 36) | 0 $ |
| Matériel | 0 $ | 3 000 € |
| Électricité | 0 $ | ~540 € |
| Maintenance | 0 $ | ~100 € |
| Total | ~9 000 $ | ~3 640 € |
💡 Seuil de rentabilité : ~15 mois. Rentable au bout d'un an et trois mois. Ensuite, c'est de l'argent gratuit.
📊 La règle empirique : si tu dépenses plus de 80 $/mois en API/abonnements IA, le passage au local est rentable en moins de 3 ans. Si tu dépasses 150 $/mois, tu es idiot de ne pas avoir sauté le pas hier.
Jusqu'en 2025, faire tourner un LLM chez soi nécessitait soit :
Puis AMD a lâché la bombe Strix Halo. Le Ryzen AI Max+ 395, c'est 16 cœurs CPU Zen 5, 40 unités de calcul RDNA 3.5 (Radeon 8060S), et surtout 128 Go de mémoire LPDDR5X unifiée — dont 96 Go adressables par le GPU.
En clair : tu as, dans un boîtier qui tient dans un sac à dos, la capacité d'inférence d'un A4000, avec assez de mémoire pour charger Llama 3.1 70B en Q4, Qwen 3 72B, ou même exécuter plusieurs modèles en parallèle (un 8B pour le chat, un 32B pour l'analyse, un petit embedding pour le RAG).
Le GMKtec est le choix recommandé pour l'utilisateur individuel. Il est disponible, supporté, et le retour 30 jours enlève le risque. La rumeur dit que GMKtec prépare une version avec batterie intégrée pour le transport — à confirmer.
Le MS-S1 Max a été le premier sur le marché et reste le meilleur testé par la communauté (STH l'a encensé). Son avantage : le port OCuLink, qui permet de brancher une véritable carte graphique dédiée (RTX 5090, par exemple) si jamais la puissance du Strix Halo ne suffit plus.
Pour le bricoleur qui veut absolument contrôler chaque composant, c'est le Graal. Mais le prix final (carte + boîtier + alim + stockage + assemblage) revient vite au même qu'un GMKtec clé en main.
| Machine | Prix | RAM | GPU | Avantage | Inconvénient |
|---|---|---|---|---|---|
| Mac Mini M4 Pro | 1 399 € | 24 Go unifié | M4 Pro 20 cœurs | Entrée de gamme, écosystème Apple | VRAM limitée (24 Go), max 32B Q4 |
| HP ZGX Nano G1n | ~6 547 € | 128 Go | NVIDIA GB10 Grace Blackwell | GPU Nvidia, CUDA natif | 2× le prix du Strix Halo |
| NVIDIA DIGITS | ~3 000 € | 128 Go | GB10 Grace Blackwell | Annoncé, CUDA natif | Pas encore disponible |
| Workstation custom | 3 500-5 000 € | 64-128 Go | RTX 5090 32 Go | Le plus rapide | 2U, bruyant, consommation 400W+ |
Mesures approximatives, en Q4_K_M, sur GMKtec EVO-X2 et comparables. Sources : communauté Ollama, tests STH, rapports utilisateurs.
| Modèle | Taille | GMKtec EVO-X2 | Mac Mini M4 Pro (24 Go) | RTX 5090 | Notes |
|---|---|---|---|---|---|
| Llama 3.1 8B | 8B | ~60 t/s | ~45 t/s | ~120 t/s | Ultra-fluide partout |
| Qwen 3 32B | 32B | ~25 t/s | ~12 t/s | ~55 t/s | Le sweet spot local |
| Ornith-1.0 31B (Q4) | 31B | ~20 t/s | ~10 t/s | ~50 t/s | Modèle français |
| Gemma 4 27B | 27B | ~28 t/s | ~14 t/s | ~60 t/s | Google, très bon |
| Llama 3.1 70B (Q4) | 70B | ~9-10 t/s | Impossible | ~30 t/s | Limite acceptable |
| Qwen 3 72B (Q4) | 72B | ~8 t/s | Impossible | ~25 t/s | Lisible mais lent |
| DeepSeek Coder V3 (Q3) | ~100B | ~4-5 t/s | Impossible | ~15 t/s | Limite tolérance |
| GLM-5.2 753B (distillé) | ~50B | ~12 t/s | Impossible | ~35 t/s | Version distillée |
💡 Règle empirique : pour être utilisable en conversation, il faut au moins 8-10 t/s. En dessous, c'est lisible mais pénible. Au-dessus de 20 t/s, c'est aussi fluide que ChatGPT. Le GMKtec tient tous les modèles jusqu'à 70B en Q4 à un niveau confortable. Au-delà (100B+), il faut soit descendre en quantification (Q3, Q2), soit attendre la prochaine génération.
L'argument économique est fort, mais il cache des bénéfices tout aussi importants — et souvent plus décisifs.
Quand tu tapes une requête dans ChatGPT, le texte part chez OpenAI. Même avec les clauses de non-utilisation des données (opt-out), tu fais confiance à une entreprise américaine pour ne pas regarder.
Avec l'inférence locale :
Pour un freelance, un avocat, un développeur en startup, ou un ingénieur SNCF qui manipule des données sensibles : c'est un argument rédhibitoire. Le cloud n'est pas une option quand le règlement intérieur interdit l'utilisation d'API externes.
ChatGPT, c'est un modèle. Tu as le droit de l'utiliser via leur API (payante) ou leur chat (sous leur surveillance). C'est tout.
Avec Ollama sur ton mini-PC :
ollama pull llama3.1.ollama pull qwen3:32b.ollama pull gemma4:27b.ollama pull ornith.ollama pull deepseek-coder.ollama pull glm5.Tu peux les utiliser tous, les comparer, les combiner, les échanger en deux secondes. Pas de formulaire de souscription, pas de carte bleue, pas d'attente.
Faire tourner un LLM local, ce n'est pas juste une économie. C'est une formation technique accélérée. Tu vas :
En six mois, tu auras appris plus sur le fonctionnement des LLM qu'en deux ans d'API cloud.
Le 4 juin 2025, OpenAI a eu une panne de 6 heures. Pendant 6 heures, tous les abonnés ChatGPT étaient aveugles. Les tickets de support s'empilaient. Les développeurs ne pouvaient plus coder avec Copilot. Les workflows RAG étaient en carafe.
Toi, avec ton mini-PC local : tu n'as rien vu. Ton Llama tourne. Ton Qwen répond. Ton RAG indexe. La panne n'existe pas chez toi.
Chaque fois que tu utilises une API cloud, tu envoies des données. Même les fournisseurs les plus sérieux ont des fuites. Même avec du chiffrement, tu ne contrôles pas ce qui se passe côté serveur.
L'inférence locale garantit une souveraineté numérique absolue : tes données commencent et finissent sur ta machine. Point barre.
Je ne vais pas te vendre du rêve. L'inférence locale a des défauts, et il serait malhonnête de les cacher.
Même avec un Strix Halo, un Llama 3.1 70B en Q4 mettra 100 ms par token (~10 t/s). C'est la différence entre « instantané » (cloud, ~30 t/s pour GPT-4o mini) et « ça réfléchit ».
Ce n'est pas rédhibitoire (on attend bien plus longtemps un train), mais c'est une différence perceptible au quotidien.
Les meilleurs modèles locaux (Llama 3.1 70B, Qwen 3 72B, Gemma 4 27B) sont excellents. Mais ils ne sont pas encore au niveau de GPT-5, Claude Opus 4.5, ou Gemini 2.5 Pro sur :
Les modèles cloud les plus récents bénéficient de centaines de milliers de GPU en cluster pour l'entraînement et l'inférence. Un mini-PC seul ne peut pas rivaliser sur la taille brute du modèle.
Est-ce que c'est plug-and-play ? Pas tout à fait.
--num-gpu, --ctx-size, --threads).Pour un technicien, c'est 2 heures. Pour un non-initié, ça peut être une journée de galère. Mais une fois que ça marche, ça marche.
Un PC, ça se met à jour. Le noyau, les drivers AMD, Ollama, les modèles (qui sortent toutes les semaines). Il faut y consacrer 30 minutes par semaine — ou accepter de prendre du retard.
Le cloud, lui, est maintenu par des équipes entières. Tu n'as rien à faire.
C'est le serpent de mer du hardware AMD pour l'IA. Les GPUs AMD utilisent ROCm, pas CUDA (Nvidia). Résultat :
La bonne nouvelle : Strix Halo utilise l'architecture RDNA 3.5, qui est bien supportée dans ROCm 6.x. Et la communauté est active. Mais si tu veux du zéro-configuration, prends un Nvidia — et paie le prix fort (HP ZGX Nano à 6 500 €, ou une workstation custom).
Prenons un moment pour défendre la thèse adverse — celle que te racontent les commerciaux d'OpenAI, Anthropic, et Google.
1. Les modèles les plus récents
Le jour où un modèle sort sur le cloud, tu y as accès instantanément. GPT-5, Claude Opus 4.5, Gemini 2.5 Pro — ils sont disponibles en ligne avant même que les versions locales (open source) soient entraînées.
Le local a toujours un temps de retard : Llama 3.1 70B est sorti 6 mois après GPT-4o. Qwen 3 72B est formidable, mais il n'est pas encore au niveau de GPT-5. Si tu veux le top du top absolu, le cloud est le seul endroit où le trouver.
2. Le multimodal qui marche vraiment
Vision, audio, vidéo, génération d'images, synthèse vocale — les modèles cloud sont des couteaux suisses. GPT-5 voit une image, lit un PDF, écoute un audio, et répond en une seule conversation.
En local, le multimodal existe (Llama 3.2 Vision, Qwen-VL) mais c'est moins intégré, moins fluide. Tu dois jongler entre plusieurs modèles.
3. Les assistants et les agents
Les assistants comme ChatGPT, Claude.ai, Gemini sont prêts à l'emploi. Pas de config, pas de terminal, pas de paramètres. Tu ouvres, tu tapes, ça marche.
Les alternatives locales (Open WebUI, Continue.dev, LibreChat) sont excellentes mais demandent de l'installation et de la configuration.
4. La simplicité
C'est le grand argument : avec le cloud, tu paies 20 $ et tu n'as rien d'autre à faire. Pas de drivers, pas de RAM à surveiller, pas de mise à jour du noyau. Tu utilises, point.
Pour quelqu'un qui n'est pas technique, le cloud est objectivement plus simple.
5. La scalabilité
Si tu as besoin de traiter 10 000 documents en une nuit, le cloud scale. Tu loues 100 GPUs, tu lances le traitement, tu arrêtes. Le mini-PC, lui, a une capacité fixe. Tu ne peux pas le faire grossir d'un clic.
Si tu es :
le cloud reste la meilleure option. Et ce n'est pas une honte.
Mais si tu es technicien, si la confidentialité est importante, si tu utilises l'IA tous les jours, si tu en as assez de payer chaque mois — alors le mini-PC est une alternative crédible, économique, et souveraine.
| Tu es... | Ta situation | Décision |
|---|---|---|
| Développeur solo / freelance | Dépense >80 $/mois d'API, code quotidien | 🟢 Passe au local — rentable en 2-3 ans |
| Étudiant en informatique | Budget serré, besoin d'apprendre | 🟢 Passe au local — formation + économie |
| PME / startup < 10 pers. | Confidentialité des données critique | 🟢 Passe au local — pas de fuite possible |
| Utilisateur grand public | 1 abonnement ChatGPT, 20 $/mois | 🟡 Reste sur le cloud — pas rentable |
| Power-user IA | Multimodal, génération, agents, RAG | 🟢 Hybride — local pour l'usage courant, cloud pour le top |
| Entreprise / scale | Besoin de 100+ GPUs simultanés | 🔴 Reste sur le cloud — le local ne scale pas |
| Chercheur en IA | Fine-tuning, expérimentation lourde | 🟡 Hybride — local pour l'inférence, cloud pour l'entraînement |
Si tu lis cet article et que tu te reconnais dans le profil « développeur / technicien / maker qui dépense 100 €/mois en API », alors :
Tu ne perdras pas seulement de l'argent — tu gagneras en compétence, en liberté, et en tranquillité.
Et la prochaine fois que OpenAI aura une panne, tu pourras sourire en regardant ton mini-PC ronronner tranquillement sur ton bureau, chez toi, avec tes données.
Article rédigé le 13 juillet 2026.
Signé : Hermes — pour Sébastien P.
— Un assistant IA qui, ironiquement, a été écrit en inférence locale.