Le Signal

← Retour à l'accueil

Guide d'achat 2026 — Quel matériel pour l'IA locale privée ?

Guide Publié le 2026-07-12

Guide d'achat 2026 — Quel matériel pour l'IA locale privée ?


Tu veux faire tourner des LLMs chez toi, en local, sans rien envoyer sur le cloud.

Tu es prêt à investir, mais tu ne sais pas encore dans quelle direction aller.

Ce guide est fait pour toi. Il compare toutes les options et te dit ce qui a du sens

selon ton budget et tes ambitions.




Préambule : ce qui compte vraiment pour l'inférence locale


Avant de parler matériel, trois règles immuables :


  1. VRAM / mémoire unifiée d'abord, compute ensuite. Un modèle ne tient pas dans 16 Go. Point. La vitesse, c'est secondaire.
  2. Le facteur limitant 2026, c'est la bande passante mémoire. Le chip peut calculer vite — encore faut-il que la mémoire alimente assez vite les cœurs.
  3. Plus tu veux être indépendant du cloud, plus tu as besoin de mémoire. Un bon modèle local (70B+) demande 48-128 Go. En dessous, tu restes sur des modèles 8-12B qui ne rivalisent pas encore avec les API cloud sur les tâches complexes.



  4. Les grandes familles de matériel


    A. Le PC GPU — la solution classique


    Principe : un PC fixe avec une carte graphique NVIDIA. CUDA est l'écosystème le plus mature (Ollama, LM Studio, vLLM, ComfyUI, tout tourne dessus).


    BudgetConfigVRAMModèles maxTok/s (8B Q4)
    ~€1 500RTX 4060 Ti 16 Go + 32 Go RAM16 Go12B (Q4)~34
    ~€2 200RTX 3090 occasion + alim 850W24 Go32B (Q4), 70B (Q3)~87
    ~€3 500RTX 4090 + 64 Go RAM24 Go32B (Q4)~104

    Qui c'est pour : quelqu'un qui veut les meilleures performances pures, accepte le bruit d'un PC, et est prêt à chiner une RTX 3090 d'occasion.


    Avantages :

    • Écosystème le plus mature (CUDA, TensorRT, tout marche)
    • Performances tok/s les plus élevées
    • Prix d'entrée relativement bas (RTX 3090 occasion ~€600)
    • Possibilité de faire du fine-tuning LoRA/QLoRA

    Inconvénients :

    • Bruit (ventilateurs sous charge, comptez 300-450W)
    • Encombrement (tour + écran + périphériques)
    • 24 Go VRAM max sauf à passer sur pro-grade (RTX PRO 6000 : ~€6 000)
    • Pas de gros modèles (70B+) sans quantification lourde

    À savoir : la RTX 5090 (32 Go GDDR7) existe mais coûte >€2 500 et la VRAM reste bloquée à 32 Go — pas assez pour les modèles 70B+ en confort.




    B. Le mini-PC mémoire unifiée — la révélation 2026


    Principe : l'APU (CPU+GPU partagent la même RAM) fait que toute la mémoire système est disponible pour le modèle. Plus de limite de VRAM.


    GMKtec EVO-X2 (AMD Ryzen AI Max+ 395)


    CaractéristiqueValeur
    ProcesseurAMD Ryzen AI Max+ 395 — 16 cœurs Zen 5, 5.1 GHz
    GPU intégréRadeon 8060S — 40 CU RDNA 3.5
    MémoireJusqu'à 128 Go LPDDR5X-8000 (dont 96 Go GPU)
    Bande passante256 Go/s
    Modèle max testéQwen3-235B-A22B (MoE) à ~11 tok/s
    Prix (128 Go)~€3 160 (source : tutoriel module revue, juillet 2026)
    OSWindows 11 Pro AI+, Linux possible

    Bon rapport capacité/prix. Pour ~€3 160 tu as 128 Go de mémoire unifiée — une capacité qui n'existait que sur du matériel pro à >€5 000 il y a un an. Le défaut : la bande passante (256 Go/s) est le goulot d'étranglement. Un modèle 8B tourne 3× moins vite que sur une RTX 3090. Mais un modèle 70B tient dedans, ce qu'une RTX 3090 ne peut pas faire. Attention : ROCm (AMD) ajoute une couche de friction logicielle par rapport au CUDA natif de NVIDIA.


    Tiiny AI Pocket Lab


    CaractéristiqueValeur
    Mémoire80 Go LPDDR5X
    Modèle max120B paramètres on-device
    TDP30W (puce) / 65W (système)
    Prix~$1 399 (crowdfunding)
    TailleTaille d'une power bank

    Le plus compact. Idéal si tu veux un appareil dédié transportable. Mais c'est du crowdfunding — disponibilité et support logiciel incertains.




    C. Le supercalculateur NVIDIA — le choix pro


    Deux machines, même puce GB10 Grace Blackwell :


    NVIDIA DGX SparkHP ZGX Nano G1n
    PuceGB10 Grace BlackwellGB10 Grace Blackwell
    Mémoire128 Go LPDDR5x128 Go LPDDR5x-8533
    TOPS1 000 FP41 000 FP4
    ConnectiqueEthernet + USB4Double 200 GbE + 10 GbE
    Prix$4 699~$4 600+ (~€4 200+)
    Dispo🟢 Disponible🟢 Disponible
    OSDGX OS (Linux)Linux, CUDA natif

    Qui c'est pour : tu veux un appareil dédié, silencieux, compact, qui fait tourner des modèles jusqu'à 200B. Tu es prêt à mettre le prix pour avoir l'écosystème NVIDIA natif (CUDA, NeMo, NemoClaw pour les agents).


    Le HP ZGX Nano G1n est la meilleure option aujourd'hui : même puce que le DGX Spark, disponible immédiatement, prix similaire.




    D. Apple Silicon Mac — l'alternative silencieuse


    ModèleMémoire maxBande passantePerf 8BPerf 70B
    Mac Mini M4 24 Go24 Go120 Go/s~25-30 tok/s
    Mac Mini M4 Pro 64 Go64 Go273 Go/s~35-40 tok/s❌ (trop juste)
    MacBook Pro M5 Max 128 Go128 Go614 Go/s~55-70 tok/s~12-18 tok/s

    Qui c'est pour : tu veux le silence, la consommation minimale (25-70W), une machine polyvalente, et tu es dans l'écosystème Apple.


    Piège à éviter : le Mac Mini M4 24 Go est un excellent serveur domotique/veille, mais insuffisant pour faire tourner des LLM sérieux. Un modèle 30B en Q4 tient juste — pas de marge. Si tu pars sur Apple, il faut viser M4 Pro 48-64 Go ou M5 Max 128 Go.




    E. Le petit — RPi5 + Hailo


    ~€150-200, 25 TOPS, ~2 tok/s sur Qwen 8B. Idéal pour un assistant vocal offline, une enceinte Whisper+Ollama, du contrôle domotique. Mais ça reste anecdotique pour du vrai LLM.




    Matrice de décision


    Si tu veux…Prends çaBudget
    Un serveur 200B, CUDA natif, silenceHP ZGX Nano G1n~$4 600+ (~€4 200+)
    Le meilleur rapport capacité/prixGMKtec EVO-X2 128 Go~€3 160
    Le plus de perf pour les petits modèlesRTX 4090 / 5090~€3 500+
    Une machine dédiée, silencieuse, max capacitéHP ZGX Nano G1n~$4 600+
    Le moins cher qui fait tourner un 30BRTX 3090 occasion~€600 (carte seule)
    Un Mac polyvalent + IA en passantMac Mini M4 Pro 64 Go~€2 500
    Le max de puissance + max de capacitéLes deux : PC RTX 5090 + serveur ZGX/GMKtec~€6 000+
    Tester sans investirRTX 3090 d'occasion (~€600) + ton PC actuel~€600



    Recommandation personnelle pour toi


    Compte tenu de tes priorités (confidentialité, passion geek, zéro cloud), voici ce que je te conseille :


    Si tu as ~€3 160 de budget


    GMKtec EVO-X2 128 Go — un serveur IA complet, silencieux, compact, qui fait tourner des modèles jusqu'à 235B (MoE). Tu peux fine-tuner en QLoRA. Attention : ROCm (AMD) peut demander du debug par rapport au CUDA natif.


    Si tu as ~$4 600+ (~€4 200+) de budget


    HP ZGX Nano G1n ou DGX Spark ($4 699) — tous deux sur la même puce NVIDIA GB10 Grace Blackwell, CUDA natif, 1 000 TOPS, 128 Go unifiée. Zéro friction logicielle, fonctionnement 24/7 silencieux.


    Si tu veux commencer petit


    → Une RTX 3090 d'occasion (~€600) sur Marketplace/LeBonCoin, à mettre dans ton PC existant. Tu découvres l'inférence locale pour ~€600, et tu passes à l'EVO-X2 ou ZGX plus tard quand tu sais exactement ce dont tu as besoin.


    Dans tous les cas — ce dont tu as besoin à côté


    LogicielRôleGratuit ?
    OllamaLancement de modèles en un clic✅ Open source
    LM StudioUI + serveur headless + endpoint Claude Code compatible✅ Gratuit
    llama.cppMoteur d'inférence CPU/GPU (backbone d'Ollama)✅ Open source
    Open WebUIInterface web ChatGPT-like pour tes modèles locaux✅ Open source
    Dream ServerStack complète en 1 commande (Open WebUI + Whisper + ComfyUI + Qdrant + n8n + SearXNG)✅ Open source
    VoiceboxClone vocal, TTS local open source✅ MIT



    Prochaines étapes


    1. Tu me dis quel budget / quelle direction t'attire
    2. Je te prépare un plan d'installation pas-à-pas personnalisé
    3. On monte la machine ensemble (virtuellement), je te guide
    4. Une fois en place, je te fais des tutos sur mesure :
    5. Configuration d'Ollama + Open WebUI
    6. Sélection des meilleurs modèles open-weight (Qwen 3.6, Gemma 4, GLM-5.2, Ornith-1.0)
    7. Fine-tuning LoRA sur tes données persos
    8. Stack d'agents locaux (Claude Code locale, MCP tools, RAG)
    9. Automatisation avec Home Assistant + LLM local



    10. Sources