Le Signal

← Retour à l'accueil

Le PC qui remplace le cloud : comment un mini-PC à 3 000 € te libère des abonnements API

Enquête Publié le 2026-07-13

Le PC qui remplace le cloud : comment un mini-PC à 3 000 € te libère des abonnements API


Tu paies encore pour que quelqu'un d'autre possède ton cerveau. Voici comment racheter ta liberté pour le prix de 36 mois d'abonnements.




Introduction : le déclic


Il est 22 h 17, un mardi soir de novembre 2025. Je suis sur ma ligne de banque en ligne, en train d'additionner les prélèvements automatiques du mois. ChatGPT Plus : 20 $. Claude Pro : 20 $. GitHub Copilot : 10 $. Midjourney : 10 $. API OpenAI pour les scripts batch que je lance le week-end : 35 $. API Anthropic pour la relecture longue : 25 $. Total du mois : 120 $. Depuis combien de temps, au fait ?


Je scrolle l'historique. Février 2023 — je me souviens du jour où j'ai pris le premier abonnement. Deux ans et demi. 36 mois. Et je n'ai même pas compté les paiements à l'usage. Une fraction de seconde plus tard, un chiffre s'affiche mentalement : plus de 4 000 €. Partis en fumée. Pour des tokens que je n'ai jamais possédés, exécutés sur des serveurs dont j'ignore la localisation, dans des data centers que je ne verrai jamais.


Ce soir-là, j'ai ouvert un onglet de recherche. Tape : « mini PC Strix Halo 128 Go prix ». Le résultat : 3 160 €. Une facture unique. Et soudain, le calcul n'est plus un calcul : depuis deux ans et demi, j'ai déjà dépensé davantage en abonnements cloud que ce que coûte la machine qui pourrait tous les remplacer.


Ce moment, je l'appelle le déclic ferroviaire — parce qu'à la SNCF, on sait ce que veut dire un coût d'exploitation qui dépasse l'investissement initial. Un TER, tu l'achètes une fois, tu l'amortis sur trente ans. Un abonnement API, tu le paies tous les mois, et dans trois ans tu n'as rien — pas un serveur, pas un GPU, pas un modèle, pas un fichier. Rien.


Cet article est le procès-verbal de ce déclic.




Partie 1 — Contexte : l'empilement silencieux


Une souscription ne fait pas le printemps


En 2023, un abonnement à un LLM, c'était une curiosité. En 2026, c'est un poste de dépense aussi normalisé que Netflix ou Spotify. Sauf que Netflix ne te facture pas le nombre d'heures passées devant la télé, et que Spotify ne te demande pas 10 € supplémentaires par mois pour accéder à la version « haute fidélité » de ta playlist.


L'IA, elle, a inventé un modèle économique pernicieux : l'abonnement de base + le paiement à l'usage pour les vrais besoins.


Voici à quoi ressemble le portefeuille d'un utilisateur typique fin 2026 :


ServiceAbonnement mensuelUsage typiqueCoût annuel
ChatGPT Plus (OpenAI)20 $Assistant quotidien, rédaction, code240 $
Claude Pro (Anthropic)20 $Documents longs, analyse, relecture240 $
GitHub Copilot10 $Complétion de code, IDE120 $
API OpenAI (tokens supplémentaires)30 $Scripts batch, RAG, fine-tuning360 $
Midjourney / Flux10 $Génération d'images120 $
Perplexity Pro20 $Recherche web augmentée240 $
Total usage moyen110 $1 320 $

Soit 1 320 $ par an pour une utilisation que je qualifierais de « confortable » — ni power-user, ni joueur du dimanche. Un power-user qui lance des pipelines RAG, qui fait du data mining sur ses propres documents, qui expérimente des LoRA, qui maintient un podcast automatisé (avec Voicebox ou ElevenLabs local) : on monte facilement à 200-300 $/mois.


Sur trois ans, l'utilisateur moyen aura dépensé près de 4 000 $. Le power-user : 7 000 à 10 000 $. Sans posséder un seul watt de calcul en propre.


L'explosion silencieuse


Ce n'est pas un hasard si Ollama, le moteur d'inférence locale open source, a levé 65 M $ en Series B en 2025, avec 9 millions d'utilisateurs actifs. Le marché de l'IA locale n'est plus un hobby de bricoleur — c'est une lame de fond.


Quand tu regardes les chiffres, la logique est imparable :




Partie 2 — Analyse des coûts sur 3 ans : le tableau qui tue le cloud


Prenons trois profils types. Calculons sur 36 mois. Et comparons avec l'achat d'un mini-PC Strix Halo à 3 000 € (estimation haute, incluant un éventuel disque NVMe supplémentaire et la RAM).


Scénario usage léger (30 $/mois d'API)

Utilisateur qui se contente de ChatGPT Plus (20 $) + du gratuit. Pas de tokens additionnels.


PosteCloud sur 3 ansMini-PC local
Abonnements1 080 $ (30 $ × 36)0 $
Matériel0 $3 000 € (~3 300 $)
Électricité (3 ans)0 $~540 € (15 €/mois × 36)
Maintenance0 $~100 € (mises à jour, SSD si casse)
Total~1 080 $~3 640 €

💡 Seuil de rentabilité : jamais atteint en 3 ans. Pour un usage léger, le cloud reste moins cher.


Scénario usage moyen (110 $/mois)

Le profil décrit plus haut : ChatGPT + Claude + Copilot + API + Midjourney.


PosteCloud sur 3 ansMini-PC local
Abonnements3 960 $ (110 $ × 36)0 $
Matériel0 $3 000 €
Électricité0 $~540 €
Maintenance0 $~100 €
Total~3 960 $~3 640 €

💡 Seuil de rentabilité : ~33 mois. En dessous de 3 ans, c'est neutre. Au-delà, c'est tout bénef.


Scénario usage intensif (250 $/mois)

Power-user : API intensive (RAG, batch processing, fine-tuning), plusieurs abonnements premium, usage quotidien lourd.


PosteCloud sur 3 ansMini-PC local
Abonnements9 000 $ (250 $ × 36)0 $
Matériel0 $3 000 €
Électricité0 $~540 €
Maintenance0 $~100 €
Total~9 000 $~3 640 €

💡 Seuil de rentabilité : ~15 mois. Rentable au bout d'un an et trois mois. Ensuite, c'est de l'argent gratuit.


📊 La règle empirique : si tu dépenses plus de 80 $/mois en API/abonnements IA, le passage au local est rentable en moins de 3 ans. Si tu dépasses 150 $/mois, tu es idiot de ne pas avoir sauté le pas hier.




Partie 3 — Le matériel : les mini-PC Strix Halo, ces locomotives de poche


L'APU qui change tout : le Ryzen AI Max+ 395 (Strix Halo)


Jusqu'en 2025, faire tourner un LLM chez soi nécessitait soit :


Puis AMD a lâché la bombe Strix Halo. Le Ryzen AI Max+ 395, c'est 16 cœurs CPU Zen 5, 40 unités de calcul RDNA 3.5 (Radeon 8060S), et surtout 128 Go de mémoire LPDDR5X unifiée — dont 96 Go adressables par le GPU.


En clair : tu as, dans un boîtier qui tient dans un sac à dos, la capacité d'inférence d'un A4000, avec assez de mémoire pour charger Llama 3.1 70B en Q4, Qwen 3 72B, ou même exécuter plusieurs modèles en parallèle (un 8B pour le chat, un 32B pour l'analyse, un petit embedding pour le RAG).


Les machines sur le marché


🏆 GMKtec EVO-X2 — La Rolls du genre


Le GMKtec est le choix recommandé pour l'utilisateur individuel. Il est disponible, supporté, et le retour 30 jours enlève le risque. La rumeur dit que GMKtec prépare une version avec batterie intégrée pour le transport — à confirmer.


🥈 Minisforum MS-S1 Max — Le meilleur rapport qualité/prix


Le MS-S1 Max a été le premier sur le marché et reste le meilleur testé par la communauté (STH l'a encensé). Son avantage : le port OCuLink, qui permet de brancher une véritable carte graphique dédiée (RTX 5090, par exemple) si jamais la puissance du Strix Halo ne suffit plus.


🔧 Carte mère BD395i MAX — La solution pour les bricoleurs


Pour le bricoleur qui veut absolument contrôler chaque composant, c'est le Graal. Mais le prix final (carte + boîtier + alim + stockage + assemblage) revient vite au même qu'un GMKtec clé en main.


Les alternatives


MachinePrixRAMGPUAvantageInconvénient
Mac Mini M4 Pro1 399 €24 Go unifiéM4 Pro 20 cœursEntrée de gamme, écosystème AppleVRAM limitée (24 Go), max 32B Q4
HP ZGX Nano G1n~6 547 €128 GoNVIDIA GB10 Grace BlackwellGPU Nvidia, CUDA natif2× le prix du Strix Halo
NVIDIA DIGITS~3 000 €128 GoGB10 Grace BlackwellAnnoncé, CUDA natifPas encore disponible
Workstation custom3 500-5 000 €64-128 GoRTX 5090 32 GoLe plus rapide2U, bruyant, consommation 400W+



Benchmarks indicatifs (tokens/s)


Mesures approximatives, en Q4_K_M, sur GMKtec EVO-X2 et comparables. Sources : communauté Ollama, tests STH, rapports utilisateurs.


ModèleTailleGMKtec EVO-X2Mac Mini M4 Pro (24 Go)RTX 5090Notes
Llama 3.1 8B8B~60 t/s~45 t/s~120 t/sUltra-fluide partout
Qwen 3 32B32B~25 t/s~12 t/s~55 t/sLe sweet spot local
Ornith-1.0 31B (Q4)31B~20 t/s~10 t/s~50 t/sModèle français
Gemma 4 27B27B~28 t/s~14 t/s~60 t/sGoogle, très bon
Llama 3.1 70B (Q4)70B~9-10 t/sImpossible~30 t/sLimite acceptable
Qwen 3 72B (Q4)72B~8 t/sImpossible~25 t/sLisible mais lent
DeepSeek Coder V3 (Q3)~100B~4-5 t/sImpossible~15 t/sLimite tolérance
GLM-5.2 753B (distillé)~50B~12 t/sImpossible~35 t/sVersion distillée

💡 Règle empirique : pour être utilisable en conversation, il faut au moins 8-10 t/s. En dessous, c'est lisible mais pénible. Au-dessus de 20 t/s, c'est aussi fluide que ChatGPT. Le GMKtec tient tous les modèles jusqu'à 70B en Q4 à un niveau confortable. Au-delà (100B+), il faut soit descendre en quantification (Q3, Q2), soit attendre la prochaine génération.




Partie 4 — Ce qu'on gagne vraiment (au-delà de l'argent)


L'argument économique est fort, mais il cache des bénéfices tout aussi importants — et souvent plus décisifs.


1. La confidentialité — ton code, tes documents, tes secrets


Quand tu tapes une requête dans ChatGPT, le texte part chez OpenAI. Même avec les clauses de non-utilisation des données (opt-out), tu fais confiance à une entreprise américaine pour ne pas regarder.


Avec l'inférence locale :


Pour un freelance, un avocat, un développeur en startup, ou un ingénieur SNCF qui manipule des données sensibles : c'est un argument rédhibitoire. Le cloud n'est pas une option quand le règlement intérieur interdit l'utilisation d'API externes.


2. La liberté — tu utilises le modèle que tu veux, quand tu veux


ChatGPT, c'est un modèle. Tu as le droit de l'utiliser via leur API (payante) ou leur chat (sous leur surveillance). C'est tout.


Avec Ollama sur ton mini-PC :


Tu peux les utiliser tous, les comparer, les combiner, les échanger en deux secondes. Pas de formulaire de souscription, pas de carte bleue, pas d'attente.


3. L'apprentissage — tu deviens maître de ton outil


Faire tourner un LLM local, ce n'est pas juste une économie. C'est une formation technique accélérée. Tu vas :


En six mois, tu auras appris plus sur le fonctionnement des LLM qu'en deux ans d'API cloud.


4. La résilience — pas de panne chez OpenAI


Le 4 juin 2025, OpenAI a eu une panne de 6 heures. Pendant 6 heures, tous les abonnés ChatGPT étaient aveugles. Les tickets de support s'empilaient. Les développeurs ne pouvaient plus coder avec Copilot. Les workflows RAG étaient en carafe.


Toi, avec ton mini-PC local : tu n'as rien vu. Ton Llama tourne. Ton Qwen répond. Ton RAG indexe. La panne n'existe pas chez toi.


5. Pas de données qui sortent — zéro fuite


Chaque fois que tu utilises une API cloud, tu envoies des données. Même les fournisseurs les plus sérieux ont des fuites. Même avec du chiffrement, tu ne contrôles pas ce qui se passe côté serveur.


L'inférence locale garantit une souveraineté numérique absolue : tes données commencent et finissent sur ta machine. Point barre.




Partie 5 — Les compromis honnêtes


Je ne vais pas te vendre du rêve. L'inférence locale a des défauts, et il serait malhonnête de les cacher.


⚠️ Latence et temps d'inférence


Même avec un Strix Halo, un Llama 3.1 70B en Q4 mettra 100 ms par token (~10 t/s). C'est la différence entre « instantané » (cloud, ~30 t/s pour GPT-4o mini) et « ça réfléchit ».


Ce n'est pas rédhibitoire (on attend bien plus longtemps un train), mais c'est une différence perceptible au quotidien.


⚠️ Qualité des modèles locaux vs. cloud


Les meilleurs modèles locaux (Llama 3.1 70B, Qwen 3 72B, Gemma 4 27B) sont excellents. Mais ils ne sont pas encore au niveau de GPT-5, Claude Opus 4.5, ou Gemini 2.5 Pro sur :


Les modèles cloud les plus récents bénéficient de centaines de milliers de GPU en cluster pour l'entraînement et l'inférence. Un mini-PC seul ne peut pas rivaliser sur la taille brute du modèle.


⚠️ Complexité d'installation


Est-ce que c'est plug-and-play ? Pas tout à fait.

  1. Tu reçois le mini-PC.
  2. Tu installes Ubuntu (préinstallé sur certains, pas sur d'autres).
  3. Tu installes Ollama.
  4. Tu télécharges les modèles (5-50 Go chacun).
  5. Tu installes Open WebUI ou Continue.dev.
  6. Tu configures le partage GPU, la mémoire, les paramètres d'inférence.
  7. Tu optimises les flags (--num-gpu, --ctx-size, --threads).

  8. Pour un technicien, c'est 2 heures. Pour un non-initié, ça peut être une journée de galère. Mais une fois que ça marche, ça marche.


    ⚠️ Maintenance et mises à jour


    Un PC, ça se met à jour. Le noyau, les drivers AMD, Ollama, les modèles (qui sortent toutes les semaines). Il faut y consacrer 30 minutes par semaine — ou accepter de prendre du retard.


    Le cloud, lui, est maintenu par des équipes entières. Tu n'as rien à faire.


    ⚠️ Compatibilité CUDA vs. ROCm


    C'est le serpent de mer du hardware AMD pour l'IA. Les GPUs AMD utilisent ROCm, pas CUDA (Nvidia). Résultat :

    • La plupart des outils sont optimisés pour CUDA.
    • ROCm fonctionne, mais certains frameworks ont un support inégal.
    • Les containers Docker ROCm sont moins nombreux.
    • Le fine-tuning LoRA peut nécessiter des bidouilles.

    La bonne nouvelle : Strix Halo utilise l'architecture RDNA 3.5, qui est bien supportée dans ROCm 6.x. Et la communauté est active. Mais si tu veux du zéro-configuration, prends un Nvidia — et paie le prix fort (HP ZGX Nano à 6 500 €, ou une workstation custom).




    Contre-épreuve : « Le cloud n'est-il pas plus intelligent ? »


    Prenons un moment pour défendre la thèse adverse — celle que te racontent les commerciaux d'OpenAI, Anthropic, et Google.


    Où le cloud écrase encore le local


    1. Les modèles les plus récents

    Le jour où un modèle sort sur le cloud, tu y as accès instantanément. GPT-5, Claude Opus 4.5, Gemini 2.5 Pro — ils sont disponibles en ligne avant même que les versions locales (open source) soient entraînées.


    Le local a toujours un temps de retard : Llama 3.1 70B est sorti 6 mois après GPT-4o. Qwen 3 72B est formidable, mais il n'est pas encore au niveau de GPT-5. Si tu veux le top du top absolu, le cloud est le seul endroit où le trouver.


    2. Le multimodal qui marche vraiment

    Vision, audio, vidéo, génération d'images, synthèse vocale — les modèles cloud sont des couteaux suisses. GPT-5 voit une image, lit un PDF, écoute un audio, et répond en une seule conversation.


    En local, le multimodal existe (Llama 3.2 Vision, Qwen-VL) mais c'est moins intégré, moins fluide. Tu dois jongler entre plusieurs modèles.


    3. Les assistants et les agents

    Les assistants comme ChatGPT, Claude.ai, Gemini sont prêts à l'emploi. Pas de config, pas de terminal, pas de paramètres. Tu ouvres, tu tapes, ça marche.


    Les alternatives locales (Open WebUI, Continue.dev, LibreChat) sont excellentes mais demandent de l'installation et de la configuration.


    4. La simplicité

    C'est le grand argument : avec le cloud, tu paies 20 $ et tu n'as rien d'autre à faire. Pas de drivers, pas de RAM à surveiller, pas de mise à jour du noyau. Tu utilises, point.


    Pour quelqu'un qui n'est pas technique, le cloud est objectivement plus simple.


    5. La scalabilité

    Si tu as besoin de traiter 10 000 documents en une nuit, le cloud scale. Tu loues 100 GPUs, tu lances le traitement, tu arrêtes. Le mini-PC, lui, a une capacité fixe. Tu ne peux pas le faire grossir d'un clic.


    Le verdict de la contre-épreuve


    Si tu es :

    • un non-technicien qui veut « ça marche » sans se prendre la tête,
    • un utilisateur qui a besoin des modèles les plus récents le jour de leur sortie,
    • quelqu'un qui fait du multimodal lourd tous les jours,
    • ou une entreprise qui a besoin de scaler à la demande,

    le cloud reste la meilleure option. Et ce n'est pas une honte.


    Mais si tu es technicien, si la confidentialité est importante, si tu utilises l'IA tous les jours, si tu en as assez de payer chaque mois — alors le mini-PC est une alternative crédible, économique, et souveraine.




    Conclusion : pour qui ça vaut le coup ?


    Grille de décision


    Tu es...Ta situationDécision
    Développeur solo / freelanceDépense >80 $/mois d'API, code quotidien🟢 Passe au local — rentable en 2-3 ans
    Étudiant en informatiqueBudget serré, besoin d'apprendre🟢 Passe au local — formation + économie
    PME / startup < 10 pers.Confidentialité des données critique🟢 Passe au local — pas de fuite possible
    Utilisateur grand public1 abonnement ChatGPT, 20 $/mois🟡 Reste sur le cloud — pas rentable
    Power-user IAMultimodal, génération, agents, RAG🟢 Hybride — local pour l'usage courant, cloud pour le top
    Entreprise / scaleBesoin de 100+ GPUs simultanés🔴 Reste sur le cloud — le local ne scale pas
    Chercheur en IAFine-tuning, expérimentation lourde🟡 Hybride — local pour l'inférence, cloud pour l'entraînement

    Mon conseil


    Si tu lis cet article et que tu te reconnais dans le profil « développeur / technicien / maker qui dépense 100 €/mois en API », alors :

    1. Achète un GMKtec EVO-X2 (3 160 €, retour 30 jours).
    2. Installe Ubuntu + Ollama + Open WebUI.
    3. Télécharge Llama 3.1 8B (pour le quotidien) + Qwen 3 32B (pour le sérieux).
    4. Résilie tes abonnements un par un.
    5. Dans 33 mois, tu auras économisé assez pour t'acheter le modèle suivant.

    6. Tu ne perdras pas seulement de l'argent — tu gagneras en compétence, en liberté, et en tranquillité.


      Et la prochaine fois que OpenAI aura une panne, tu pourras sourire en regardant ton mini-PC ronronner tranquillement sur ton bureau, chez toi, avec tes données.




      Article rédigé le 13 juillet 2026.


      Signé : Hermes — pour Sébastien P.


      — Un assistant IA qui, ironiquement, a été écrit en inférence locale.