Tu veux faire tourner des LLMs chez toi, en local, sans rien envoyer sur le cloud.
Tu es prêt à investir, mais tu ne sais pas encore dans quelle direction aller.
Ce guide est fait pour toi. Il compare toutes les options et te dit ce qui a du sens
selon ton budget et tes ambitions.
Avant de parler matériel, trois règles immuables :
Principe : un PC fixe avec une carte graphique NVIDIA. CUDA est l'écosystème le plus mature (Ollama, LM Studio, vLLM, ComfyUI, tout tourne dessus).
| Budget | Config | VRAM | Modèles max | Tok/s (8B Q4) |
|---|---|---|---|---|
| ~€1 500 | RTX 4060 Ti 16 Go + 32 Go RAM | 16 Go | 12B (Q4) | ~34 |
| ~€2 200 | RTX 3090 occasion + alim 850W | 24 Go | 32B (Q4), 70B (Q3) | ~87 |
| ~€3 500 | RTX 4090 + 64 Go RAM | 24 Go | 32B (Q4) | ~104 |
Qui c'est pour : quelqu'un qui veut les meilleures performances pures, accepte le bruit d'un PC, et est prêt à chiner une RTX 3090 d'occasion.
Avantages :
Inconvénients :
À savoir : la RTX 5090 (32 Go GDDR7) existe mais coûte >€2 500 et la VRAM reste bloquée à 32 Go — pas assez pour les modèles 70B+ en confort.
Principe : l'APU (CPU+GPU partagent la même RAM) fait que toute la mémoire système est disponible pour le modèle. Plus de limite de VRAM.
| Caractéristique | Valeur |
|---|---|
| Processeur | AMD Ryzen AI Max+ 395 — 16 cœurs Zen 5, 5.1 GHz |
| GPU intégré | Radeon 8060S — 40 CU RDNA 3.5 |
| Mémoire | Jusqu'à 128 Go LPDDR5X-8000 (dont 96 Go GPU) |
| Bande passante | 256 Go/s |
| Modèle max testé | Qwen3-235B-A22B (MoE) à ~11 tok/s |
| Prix (128 Go) | ~€3 160 (source : tutoriel module revue, juillet 2026) |
| OS | Windows 11 Pro AI+, Linux possible |
Bon rapport capacité/prix. Pour ~€3 160 tu as 128 Go de mémoire unifiée — une capacité qui n'existait que sur du matériel pro à >€5 000 il y a un an. Le défaut : la bande passante (256 Go/s) est le goulot d'étranglement. Un modèle 8B tourne 3× moins vite que sur une RTX 3090. Mais un modèle 70B tient dedans, ce qu'une RTX 3090 ne peut pas faire. Attention : ROCm (AMD) ajoute une couche de friction logicielle par rapport au CUDA natif de NVIDIA.
| Caractéristique | Valeur |
|---|---|
| Mémoire | 80 Go LPDDR5X |
| Modèle max | 120B paramètres on-device |
| TDP | 30W (puce) / 65W (système) |
| Prix | ~$1 399 (crowdfunding) |
| Taille | Taille d'une power bank |
Le plus compact. Idéal si tu veux un appareil dédié transportable. Mais c'est du crowdfunding — disponibilité et support logiciel incertains.
Deux machines, même puce GB10 Grace Blackwell :
| NVIDIA DGX Spark | HP ZGX Nano G1n | |
|---|---|---|
| Puce | GB10 Grace Blackwell | GB10 Grace Blackwell |
| Mémoire | 128 Go LPDDR5x | 128 Go LPDDR5x-8533 |
| TOPS | 1 000 FP4 | 1 000 FP4 |
| Connectique | Ethernet + USB4 | Double 200 GbE + 10 GbE |
| Prix | $4 699 | ~$4 600+ (~€4 200+) |
| Dispo | 🟢 Disponible | 🟢 Disponible |
| OS | DGX OS (Linux) | Linux, CUDA natif |
Qui c'est pour : tu veux un appareil dédié, silencieux, compact, qui fait tourner des modèles jusqu'à 200B. Tu es prêt à mettre le prix pour avoir l'écosystème NVIDIA natif (CUDA, NeMo, NemoClaw pour les agents).
Le HP ZGX Nano G1n est la meilleure option aujourd'hui : même puce que le DGX Spark, disponible immédiatement, prix similaire.
| Modèle | Mémoire max | Bande passante | Perf 8B | Perf 70B |
|---|---|---|---|---|
| Mac Mini M4 24 Go | 24 Go | 120 Go/s | ~25-30 tok/s | ❌ |
| Mac Mini M4 Pro 64 Go | 64 Go | 273 Go/s | ~35-40 tok/s | ❌ (trop juste) |
| MacBook Pro M5 Max 128 Go | 128 Go | 614 Go/s | ~55-70 tok/s | ~12-18 tok/s |
Qui c'est pour : tu veux le silence, la consommation minimale (25-70W), une machine polyvalente, et tu es dans l'écosystème Apple.
Piège à éviter : le Mac Mini M4 24 Go est un excellent serveur domotique/veille, mais insuffisant pour faire tourner des LLM sérieux. Un modèle 30B en Q4 tient juste — pas de marge. Si tu pars sur Apple, il faut viser M4 Pro 48-64 Go ou M5 Max 128 Go.
~€150-200, 25 TOPS, ~2 tok/s sur Qwen 8B. Idéal pour un assistant vocal offline, une enceinte Whisper+Ollama, du contrôle domotique. Mais ça reste anecdotique pour du vrai LLM.
| Si tu veux… | Prends ça | Budget |
|---|---|---|
| Un serveur 200B, CUDA natif, silence | HP ZGX Nano G1n | ~$4 600+ (~€4 200+) |
| Le meilleur rapport capacité/prix | GMKtec EVO-X2 128 Go | ~€3 160 |
| Le plus de perf pour les petits modèles | RTX 4090 / 5090 | ~€3 500+ |
| Une machine dédiée, silencieuse, max capacité | HP ZGX Nano G1n | ~$4 600+ |
| Le moins cher qui fait tourner un 30B | RTX 3090 occasion | ~€600 (carte seule) |
| Un Mac polyvalent + IA en passant | Mac Mini M4 Pro 64 Go | ~€2 500 |
| Le max de puissance + max de capacité | Les deux : PC RTX 5090 + serveur ZGX/GMKtec | ~€6 000+ |
| Tester sans investir | RTX 3090 d'occasion (~€600) + ton PC actuel | ~€600 |
Compte tenu de tes priorités (confidentialité, passion geek, zéro cloud), voici ce que je te conseille :
→ GMKtec EVO-X2 128 Go — un serveur IA complet, silencieux, compact, qui fait tourner des modèles jusqu'à 235B (MoE). Tu peux fine-tuner en QLoRA. Attention : ROCm (AMD) peut demander du debug par rapport au CUDA natif.
→ HP ZGX Nano G1n ou DGX Spark ($4 699) — tous deux sur la même puce NVIDIA GB10 Grace Blackwell, CUDA natif, 1 000 TOPS, 128 Go unifiée. Zéro friction logicielle, fonctionnement 24/7 silencieux.
→ Une RTX 3090 d'occasion (~€600) sur Marketplace/LeBonCoin, à mettre dans ton PC existant. Tu découvres l'inférence locale pour ~€600, et tu passes à l'EVO-X2 ou ZGX plus tard quand tu sais exactement ce dont tu as besoin.
| Logiciel | Rôle | Gratuit ? |
|---|---|---|
| Ollama | Lancement de modèles en un clic | ✅ Open source |
| LM Studio | UI + serveur headless + endpoint Claude Code compatible | ✅ Gratuit |
| llama.cpp | Moteur d'inférence CPU/GPU (backbone d'Ollama) | ✅ Open source |
| Open WebUI | Interface web ChatGPT-like pour tes modèles locaux | ✅ Open source |
| Dream Server | Stack complète en 1 commande (Open WebUI + Whisper + ComfyUI + Qdrant + n8n + SearXNG) | ✅ Open source |
| Voicebox | Clone vocal, TTS local open source | ✅ MIT |