Guide Llm Local Ms1Max Hy4 2026
1. L’annonce : une ouverture importante, mais un périmètre à nommer
Tencent présente Hy4 preview comme un modèle ouvert et en publie les poids. Les éléments établis dans le dossier sont précis : une architecture Mixture-of-Experts, 770 milliards de paramètres au total, 49 milliards activés par token, une fenêtre de contexte annoncée supérieure à un million de tokens et une variante FP8 disponible sur Hugging Face [1][2][3][4]. Le dépôt officiel associe le modèle à des travaux d’ingénierie logicielle, de développement de jeux, d’analyse financière et de sécurité [5].
C’est une annonce significative par son échelle et son périmètre d’usage. Elle ne constitue pas, à elle seule, une démonstration de supériorité. Le mot preview signale un objet à qualifier. Il faut distinguer le fait publié, le positionnement revendiqué et ce qu’un utilisateur peut reproduire avec un runtime, une machine et un budget donnés.
| Élément | Ce que le dossier établit | Ce que cela ne prouve pas |
|---|---|---|
| Statut | Tencent annonce Hy4 preview | Une maturité équivalente à un modèle stabilisé |
| Architecture | MoE | Une mémoire ou un débit précis |
| Paramètres | 770B totaux, 49B activés par token | Une exécution équivalente à un dense 49B |
| Contexte | Supérieur à 1M annoncé par Tencent/Hy Research | Une récupération exacte à 1M |
| Licence publiée | Apache License 2.0 pour les poids référencés | L’ouverture des données et de l’entraînement |
| Format associé | Une variante FP8 est publiée | Une exécution confortable sur tout poste |
| Usages visés | Code, documents, recherche et tâches expertes | Une autonomie agentique démontrée |
2. Lire correctement le « 770B/49B » du MoE
Dans un modèle dense, chaque token traverse en principe l’ensemble du réseau paramétrique prévu par l’architecture. Dans un MoE, les experts sont répartis et un routeur sélectionne une partie d’entre eux pour chaque token. « 49B actifs par token » décrit donc principalement le volume de paramètres mobilisés dans le calcul d’un token, tandis que « 770B au total » décrit l’ensemble des paramètres que le système doit pouvoir utiliser au fil des tokens.
Cette distinction est utile pour comprendre la promesse de calcul parcimonieux. Elle n’autorise pas à appeler Hy4 « un modèle de 49B ». Les experts non sélectionnés à un instant donné ne disparaissent pas. Ils doivent être stockés, accessibles et, selon le runtime, déplacés ou synchronisés. Le coût réel dépendra aussi du routage, des kernels, de la topologie mémoire, de l’offload et du format numérique. Le dossier ne fournit pas de mesure qui permettrait de convertir proprement ces éléments en RAM, VRAM ou tokens par seconde.
La contre-épreuve est immédiate : si les 49B actifs suffisaient à déduire la faisabilité, toute machine capable de charger un dense de taille voisine pourrait exécuter le modèle dans les mêmes conditions. Ce raisonnement est trop court. Un MoE peut économiser du calcul par token et rester exigeant pour les poids, le cache et les transferts ; son bénéfice sur une machine précise reste expérimental.
| Notion | Définition opérationnelle | Interprétation prudente |
|---|---|---|
| 770B totaux | Ensemble des paramètres du checkpoint | Échelle globale du modèle et charge potentielle de stockage |
| 49B actifs/token | Sous-ensemble sollicité pour un token | Indice de calcul parcimonieux, pas taille mémoire du checkpoint |
| Expert | Bloc spécialisé sélectionné par le routeur | Peut rester nécessairement disponible pendant l’inférence |
| Routeur | Mécanisme de sélection des experts | Son comportement influence calcul et trafic |
| Offload | Déplacement d’une partie des données entre mémoires | Peut rendre l’exécution possible mais augmenter la latence |
| Quantification | Réduction de précision et de taille numérique | Compromis à mesurer, jamais une garantie uniforme |
3. Le contexte supérieur à 1M : capacité annoncée, qualité à vérifier
Un contexte supérieur à un million de tokens ouvre des usages sur des dépôts logiciels, corpus documentaires ou dossiers de recherche volumineux. Tencent/Hy Research associe Hy4 à l’ingénierie logicielle longue, aux tâches documentaires et à la recherche scientifique [2]. C’est un positionnement cohérent avec une grande fenêtre.
Mais une fenêtre maximale n’est pas une mesure de compréhension. Quatre propriétés doivent être séparées : l’acceptation technique de la séquence, la récupération d’une information à une position donnée, la fidélité de la réponse et le coût de l’opération. Un modèle peut accepter une longue entrée mais perdre un détail situé au milieu, suivre imparfaitement des instructions dispersées ou produire une réponse trop lente pour le workflow visé.
L’offre OpenRouter consultée dans le rapport affiche 1 048 576 tokens de contexte et 64 000 tokens de sortie [6]. Cette fiche est une information sur un fournisseur API, susceptible d’évoluer ; elle ne doit pas être reformulée en annonce Tencent ni en validation indépendante. Elle peut servir à définir un scénario d’accès, pas à conclure sur la qualité ni sur l’inférence locale.
| Dimension du long contexte | État dans le dossier | Mesure nécessaire |
|---|---|---|
| Longueur annoncée | >1M côté Tencent/Hy Research | Longueur effectivement acceptée par version et runtime |
| Longueur API | 1 048 576 selon OpenRouter | Vérification à la date du test |
| Sortie API | 64 000 selon OpenRouter | Vérification, puis distinction entrée/sortie |
| Récupération | Non établie | Exactitude par position et avec distracteurs |
| Fidélité | Non établie | Contrôle des citations, omissions et contradictions |
| Latence | Non fournie | Premier token et débit à chaque palier |
| Coût | Tarification tierce susceptible d’évoluer | Coût du prompt, de la sortie et des répétitions |
Le KV cache est la réserve la plus facile à oublier. À mesure que l’entrée s’allonge, le système conserve de l’état pour générer la suite. La forme exacte de cette croissance, les méthodes de pagination, la précision du cache et les stratégies d’éviction doivent être documentées par le runtime testé. Sans cela, annoncer un million de tokens comme une expérience locale serait abusif.
4. Coding et agents : un positionnement expert n’est pas une autonomie prouvée
Le dépôt officiel indique un entraînement orienté vers des tâches réalisées par des experts internes, notamment l’ingénierie logicielle, le développement de jeux, l’analyse financière et la sécurité [5]. Tencent indique aussi une intégration ou un accès dans WorkBuddy, CodeBuddy, Yuanbao, ima et d’autres produits [1]. Ces éléments montrent un positionnement métier et une voie de déploiement produit. Ils ne constituent pas une évaluation indépendante du modèle seul.
Dans cet article, « agentique » désigne une séquence observable : planifier une tâche, appeler des outils bornés, lire leur résultat, corriger une erreur, poursuivre plusieurs étapes puis s’arrêter selon une contrainte. Un bon agent de code ne se résume pas à produire une fonction plausible. Il doit modifier un dépôt, respecter ses conventions, lancer les tests, interpréter un échec et éviter d’élargir la tâche sans autorisation.
La contre-épreuve consiste à retirer l’effet de démonstration. Même modèle, mêmes outils, mêmes permissions, même dépôt et même budget d’actions : on compare une tâche simple, une tâche avec tests cassés et une tâche comportant une instruction contradictoire. On compte les appels, les interventions humaines, les commandes refusées, les boucles et les modifications non demandées. Une intégration dans un produit Tencent peut bénéficier d’une orchestration, d’un contexte système et d’outils que l’on ne retrouve pas dans un checkpoint nu.
| Capacité agentique | Indice disponible | Test à conduire | Critère de réussite |
|---|---|---|---|
| Planification | Positionnement métier communiqué | Décomposer une tâche sans exécution immédiate | Étapes pertinentes et bornées |
| Usage d’outils | Intégration produit annoncée | Outils simulés, journalisés et limités | Appels valides, arguments corrects |
| Coding | Domaine d’entraînement revendiqué | Modifier un dépôt et lancer les tests | Patch minimal et tests passants |
| Reprise après erreur | Non mesurée | Introduire un échec contrôlé | Correction sans boucle indéfinie |
| Contraintes | Non mesurées | Instruction contradictoire et fichiers interdits | Respect des limites explicites |
| Supervision | Non mesurée | Compter les interventions humaines | Niveau de supervision publié |
Le verdict raisonnable est donc « modèle positionné pour des workflows agentiques », pas « agent autonome ». Pour le lecteur développeur, la question utile n’est pas de savoir si Hy4 sait écrire du code en général, mais dans quelles conditions il produit un changement vérifiable, réversible et compatible avec les tests.
5. Apache 2.0 et open source : l’ouverture a plusieurs périmètres
Les dépôts Hugging Face référencés indiquent une publication des poids sous Apache License 2.0, ainsi qu’une variante FP8 [3][4]. C’est un élément concret et important. Une licence permissive sur ce qui est distribué peut faciliter l’hébergement par des tiers, l’intégration dans un service, l’audit du fichier de poids et certaines adaptations, sous réserve de respecter les obligations applicables.
Elle ne signifie pas que toute la chaîne est ouverte. Le dossier ne confirme pas que le code d’entraînement, les données, la recette de reproduction, les évaluations et tous les composants nécessaires sont disponibles dans les mêmes conditions. « Open source » peut aussi être employé dans la communication courante comme raccourci pour « poids téléchargeables et utilisables sous une licence donnée ». Pour éviter l’ambiguïté, il faut nommer le périmètre.
Cette précision ne diminue pas la portée de l’annonce. Elle évite de faire porter à une licence des garanties qu’elle ne contient pas. La souveraineté technique est un continuum : pouvoir télécharger les poids est différent de pouvoir reconstruire l’entraînement ; pouvoir lancer un checkpoint est différent de pouvoir inspecter les données ; pouvoir modifier un service est différent de pouvoir reproduire les résultats.
| Composant | Établi dans le dossier | Question de souveraineté |
|---|---|---|
| Poids | Dépôt public référencé | Version, intégrité et conditions d’usage |
| Licence des poids | Apache License 2.0 | Portée exacte de la licence et avis associés |
| Variante FP8 | Disponible sur Hugging Face | Compatibilité et qualité à mesurer |
| Code d’entraînement | Non établi | Peut-on reconstruire la chaîne ? |
| Données | Non établies | Provenance, droits et reproductibilité |
| Recette | Non établie | Hyperparamètres, filtrage, infrastructure |
| Runtime | À vérifier | Peut-on exécuter sans service propriétaire ? |
| Services Tencent | Accès/intégrations annoncés | Expérience équivalente reproductible localement ? |
6. Inférence locale : la question des 128 Go ne se résout pas avec « 49B actifs »
Sur une machine dotée de 128 Go de mémoire unifiée, le scénario est tentant : un modèle qui n’active que 49B par token semblerait proche d’une cible individuelle. Le dossier ne permet pourtant pas d’affirmer que Hy4 complet, non quantifié, est une cible réaliste sur cette machine. Il ne fournit ni mesure de chargement, ni débit, ni mémoire de travail, ni configuration minimale validée. Il serait donc incorrect de donner une taille de RAM ou un nombre de tokens par seconde inventés.
La faisabilité dépend au minimum du format de poids, de la quantification, de la mémoire réellement disponible pour le processus, de l’offload, du runtime, des kernels et de la longueur du contexte. La variante FP8 est un fait de disponibilité, pas une preuve qu’elle s’exécute confortablement sur un Mac Studio ou une autre machine de 128 Go. Une quantification communautaire pourrait réduire la charge, mais elle ajouterait une variable de compatibilité et de qualité ; ses résultats ne seraient pas automatiquement ceux du checkpoint officiel.
| Format ou voie | Disponibilité | Ce qu’il faut mesurer sur 128 Go | Verdict avant mesure |
|---|---|---|---|
| Checkpoint non quantifié | À documenter précisément | Chargement, marge mémoire, premier token, débit | Non démontré |
| FP8 officiel | Variante publiée | Compatibilité, mémoire, qualité, vitesse | Point de départ, pas garantie |
| Quantification tierce | À identifier par fichier et commit | Intégrité, qualité, runtime, débit | À traiter comme expérience distincte |
| Offload CPU/mémoire unifiée | Dépend du runtime | Transferts, latence, stabilité | Hypothèse à tester |
| API distante | Offre tierce possible | Coût, latence, confidentialité, limites | Alternative au local, pas preuve du local |
La matrice de test doit consigner le nom exact du fichier, son format, le commit du runtime, le pilote ou système utilisé, la mémoire au repos et en charge, le temps de chargement, le délai du premier token, le débit, les erreurs et la longueur de contexte. Si le modèle ne démarre pas, cela doit apparaître comme un résultat reproductible. « Poids disponibles » et « faisabilité locale non démontrée » peuvent être simultanément vrais.
Pour le propriétaire d’un MS-S1 Max de 128 Go, la recommandation immédiate est de ne pas acheter d’accessoires ni de conclure à partir du seul chiffre 49B. Vérifier d’abord les artefacts publiés et le support réel du runtime ; tester à contexte court ; observer la mémoire ; augmenter par paliers ; arrêter si le système swap, échoue ou devient trop lent ; publier la configuration. L’optimisme est permis comme hypothèse, pas comme résultat.
7. Performances : ce que l’on peut affirmer et ce qu’il faut suspendre
Les sources du dossier établissent une annonce, une architecture, un positionnement, une licence, un format FP8 et une fenêtre de contexte. Elles n’établissent pas un classement général face à Qwen, DeepSeek, GLM ou Hy3. Les résultats qui circulent ne doivent pas être repris sans lecture de l’appendice officiel, identification de la version et séparation entre résultats Tencent et évaluations indépendantes.
Un score n’a de sens qu’avec son protocole. Le prompt, le nombre de tokens générés, le système de notation, la température, les outils, le format et le matériel peuvent modifier le résultat. Comparer Hy4 via une API à un modèle quantifié local n’est pas impossible, mais cela répond à une question de produit différente et doit être présenté comme tel.
Le français mérite un volet propre. L’absence de score français dans le dossier ne prouve pas une mauvaise qualité, mais interdit de la certifier. Compréhension d’un document français, synthèse fidèle, terminologie logicielle, respect d’une consigne contradictoire et commentaires dans le code sont des compétences distinctes. Une sortie fluide peut être factuellement inexacte ; une sortie anglaise excellente ne garantit pas une sortie française équivalente.
| Champ de comparaison | Valeur à figer | Pourquoi elle compte |
|---|---|---|
| Modèle | Identifiant et version exacts | Évite les variantes silencieuses |
| Licence | Périmètre de la distribution | Sépare poids, API et chaîne complète |
| Format | FP8 ou quantification nommée | Influence mémoire et qualité |
| Matériel | Hôte, mémoire, accélérateur | Rend l’essai reproductible |
| Prompt | Texte et paramètres publiés | Évite le cherry-picking |
| Budget | Entrée, sortie, appels outils | Rend les coûts comparables |
| Métrique | Définition et méthode | Sépare impression et mesure |
| Score | Valeur brute et incertitude | Évite les classements abusifs |
| Coût | Local ou tarif API daté | Compare des scénarios distincts |
Le bon langage est conditionnel : « Tencent positionne », « le dépôt publie », « OpenRouter affiche », « reste à mesurer ». Le mauvais langage serait « meilleur modèle ouvert », « comprend un million de tokens », « remplace un développeur » ou « tient sur 128 Go ».
8. Contre-épreuve et protocole de vérification
La thèse doit pouvoir échouer. Pour Hy4, la contre-épreuve réunit un corpus documentaire long, un petit dépôt logiciel et une séquence agentique avec outils, à matériel, format, prompts et budget constants pour toutes les références. On teste séparément le court et le long contexte, les positions de récupération, la génération et la correction de code, la planification, la reprise après erreur, les instructions contradictoires et la qualité en français.
Pour la récupération, plusieurs faits doivent être placés à des positions connues, avec des distracteurs et des faits absents. La réponse attendue doit distinguer restitution, citation, inférence et refus. Pour le code, le dépôt doit disposer de tests automatisés et d’une licence compatible avec l’essai. Pour l’agent, les outils sont bornés, journalisés et assortis d’un budget ; on compte les interventions humaines, les boucles, les commandes invalides et les modifications hors périmètre.
Chaque résultat doit préciser s’il provient du checkpoint officiel, de FP8, d’une quantification tierce ou d’une API. L’API OpenRouter peut être utile pour tester le service sans achat de matériel, mais ses tarifs et limites sont ceux du fournisseur au moment de l’essai [6]. Elle ne tranche ni la souveraineté locale ni la faisabilité sur 128 Go.
| Hypothèse | Test adverse | Métrique | Règle de décision |
|---|---|---|---|
| Le long contexte est utile | Faits à plusieurs positions et distracteurs | Exactitude par position | Positif seulement si la dégradation est documentée |
| 49B actifs réduisent le coût pratique | Comparaison chargement/débit avec références | Mémoire, premier token, tokens/s | Ne pas assimiler calcul et stockage |
| Hy4 aide au coding | Patch sur dépôt avec tests | Tests passants, reprises, interventions | Positif avec budget et supervision publiés |
| Hy4 est agentique | Outils limités et erreur injectée | Appels valides, boucles, arrêt | Pas d’autonomie proclamée sans trace |
| FP8 facilite le local | Même tâches en FP8 et autre format | Qualité, mémoire, vitesse | Conclure uniquement sur machine testée |
| L’expérience est bonne en français | Même protocole francophone | Exactitude, registre, termes | Ne pas extrapoler depuis l’anglais |
| Le modèle est souverain | Audit des artefacts et dépendances | Poids, code, données, runtime | Séparer licence et reproductibilité |
Trois verdicts doivent rester séparés. Intérêt scientifique et produit : élevé à examiner, car l’échelle MoE, la fenêtre annoncée et le positionnement sont documentés. Intérêt API : testable, si un fournisseur expose effectivement le modèle, avec des conditions datées. Intérêt local : conditionnel, car il dépend de la mémoire des poids et du KV cache, de la quantification, de l’offload, du runtime, de la vitesse, de la latence et de la qualité à la longueur visée.
Pour décider, lire l’appendice officiel avant toute citation de score ; vérifier les fichiers et leur licence ; essayer un runtime documenté ; enregistrer les logs ; tester FP8 séparément ; comparer une référence dans des conditions explicites ; inclure des tâches françaises ; publier les échecs ; ne pas présenter une API comme une exécution locale. Le verdict de septembre 2026 est précis : Hy4 preview est potentiellement structurant pour les workflows longs, le code et certains agents, mais n’est ni une preuve de supériorité générale, ni un « modèle de 49B », ni une garantie d’exécution confortable sur 128 Go.
9. Verdict provisoire et feuille de route
Verdict de publication — septembre 2026
Hy4 preview mérite d’être suivi comme une sortie importante de l’IA ouverte : Tencent publie des poids sous Apache 2.0, revendique 770B paramètres totaux, 49B actifs par token et un contexte supérieur à 1M. Cela établit une capacité et un positionnement, pas une supériorité générale. La qualité réelle en français, la reproductibilité des performances et l’exécution locale restent à mesurer.
| Ce que l’article établit | Ce qui reste à vérifier | Décision actuelle |
|---|---|---|
| Sortie officielle, poids publiés, licence Apache 2.0 | Code d’entraînement, données, reproductibilité complète | Ouvert avec périmètre clairement nommé |
| MoE 770B / 49B actifs et contexte annoncé >1M | Mémoire, KV cache, latence et fidélité à grande longueur | Prometteur, non démontré localement |
| Positionnement code, agents et documents | Scores comparables et traces indépendantes | À tester, aucun classement proclamé |
| Variante FP8 disponible | Quantifications et runtime efficaces sur 128 Go | Procédure de test, pas compatibilité garantie |
La prochaine étape raisonnable consiste à conserver Hy4 dans la veille open source, à tester d’abord l’accès distant si nécessaire, puis à évaluer les formats locaux lorsqu’un runtime et une quantification vérifiables seront disponibles. Pour le MS-S1 Max, aucun essai n’est rapporté dans cet article : une éventuelle exécution doit être documentée avec format, mémoire, offload, contexte, débit, latence et logs.
Les 5 règles d’or
- Nommer le périmètre d’ouverture : des poids sous Apache 2.0 ne suffisent pas à prouver que les données, le code et la reproduction sont ouverts.
- Ne jamais remplacer 770B par 49B : l’activation par token décrit le calcul, pas la mémoire à prévoir.
- Tester le contexte, pas seulement sa longueur : récupération, fidélité, latence et KV cache sont des résultats séparés.
- Évaluer l’agent sur des traces : dépôt, outils, tests, erreurs, budget et supervision doivent être visibles.
- Séparer les verdicts : intérêt du modèle, intérêt de l’API et faisabilité locale ne répondent pas à la même question.
Enquête menée avec Hermes — septembre 2026
Sources
[1] Tencent, « Tencent releases and open-sources Tencent Hy4 preview », https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/ — annonce, ouverture et intégration produit.
[2] Tencent / Hy Research, « Hy4 preview », https://hy.tencent.ai/research/hy4-preview?langVersion=en — contexte supérieur à 1 million de tokens et positionnement sur les usages longs.
[3] Hugging Face, dépôt tencent/Hy4-preview, https://huggingface.co/tencent/Hy4-preview — poids et licence Apache License 2.0.
[4] Hugging Face, dépôt tencent/Hy4-preview-FP8, https://huggingface.co/tencent/Hy4-preview-FP8 — variante FP8.
[5] GitHub Tencent-Hunyuan, dépôt Hy4-preview, https://github.com/Tencent-Hunyuan/Hy4-preview — dépôt officiel et tâches d’entraînement revendiquées.
[6] OpenRouter, page tencent/hy4-preview, https://openrouter.ai/tencent/hy4-preview — informations d’API publiques à distinguer de l’annonce Tencent ; tarifs susceptibles d’évoluer.