Le Signal

← Retour à l'accueil

Guide Llm Local Ms1Max Hy4 2026

Guide Publié le 2026-09-02

1. L’annonce : une ouverture importante, mais un périmètre à nommer


Tencent présente Hy4 preview comme un modèle ouvert et en publie les poids. Les éléments établis dans le dossier sont précis : une architecture Mixture-of-Experts, 770 milliards de paramètres au total, 49 milliards activés par token, une fenêtre de contexte annoncée supérieure à un million de tokens et une variante FP8 disponible sur Hugging Face [1][2][3][4]. Le dépôt officiel associe le modèle à des travaux d’ingénierie logicielle, de développement de jeux, d’analyse financière et de sécurité [5].


C’est une annonce significative par son échelle et son périmètre d’usage. Elle ne constitue pas, à elle seule, une démonstration de supériorité. Le mot preview signale un objet à qualifier. Il faut distinguer le fait publié, le positionnement revendiqué et ce qu’un utilisateur peut reproduire avec un runtime, une machine et un budget donnés.


ÉlémentCe que le dossier établitCe que cela ne prouve pas
StatutTencent annonce Hy4 previewUne maturité équivalente à un modèle stabilisé
ArchitectureMoEUne mémoire ou un débit précis
Paramètres770B totaux, 49B activés par tokenUne exécution équivalente à un dense 49B
ContexteSupérieur à 1M annoncé par Tencent/Hy ResearchUne récupération exacte à 1M
Licence publiéeApache License 2.0 pour les poids référencésL’ouverture des données et de l’entraînement
Format associéUne variante FP8 est publiéeUne exécution confortable sur tout poste
Usages visésCode, documents, recherche et tâches expertesUne autonomie agentique démontrée

2. Lire correctement le « 770B/49B » du MoE


Dans un modèle dense, chaque token traverse en principe l’ensemble du réseau paramétrique prévu par l’architecture. Dans un MoE, les experts sont répartis et un routeur sélectionne une partie d’entre eux pour chaque token. « 49B actifs par token » décrit donc principalement le volume de paramètres mobilisés dans le calcul d’un token, tandis que « 770B au total » décrit l’ensemble des paramètres que le système doit pouvoir utiliser au fil des tokens.


Cette distinction est utile pour comprendre la promesse de calcul parcimonieux. Elle n’autorise pas à appeler Hy4 « un modèle de 49B ». Les experts non sélectionnés à un instant donné ne disparaissent pas. Ils doivent être stockés, accessibles et, selon le runtime, déplacés ou synchronisés. Le coût réel dépendra aussi du routage, des kernels, de la topologie mémoire, de l’offload et du format numérique. Le dossier ne fournit pas de mesure qui permettrait de convertir proprement ces éléments en RAM, VRAM ou tokens par seconde.


La contre-épreuve est immédiate : si les 49B actifs suffisaient à déduire la faisabilité, toute machine capable de charger un dense de taille voisine pourrait exécuter le modèle dans les mêmes conditions. Ce raisonnement est trop court. Un MoE peut économiser du calcul par token et rester exigeant pour les poids, le cache et les transferts ; son bénéfice sur une machine précise reste expérimental.


NotionDéfinition opérationnelleInterprétation prudente
770B totauxEnsemble des paramètres du checkpointÉchelle globale du modèle et charge potentielle de stockage
49B actifs/tokenSous-ensemble sollicité pour un tokenIndice de calcul parcimonieux, pas taille mémoire du checkpoint
ExpertBloc spécialisé sélectionné par le routeurPeut rester nécessairement disponible pendant l’inférence
RouteurMécanisme de sélection des expertsSon comportement influence calcul et trafic
OffloadDéplacement d’une partie des données entre mémoiresPeut rendre l’exécution possible mais augmenter la latence
QuantificationRéduction de précision et de taille numériqueCompromis à mesurer, jamais une garantie uniforme

3. Le contexte supérieur à 1M : capacité annoncée, qualité à vérifier


Un contexte supérieur à un million de tokens ouvre des usages sur des dépôts logiciels, corpus documentaires ou dossiers de recherche volumineux. Tencent/Hy Research associe Hy4 à l’ingénierie logicielle longue, aux tâches documentaires et à la recherche scientifique [2]. C’est un positionnement cohérent avec une grande fenêtre.


Mais une fenêtre maximale n’est pas une mesure de compréhension. Quatre propriétés doivent être séparées : l’acceptation technique de la séquence, la récupération d’une information à une position donnée, la fidélité de la réponse et le coût de l’opération. Un modèle peut accepter une longue entrée mais perdre un détail situé au milieu, suivre imparfaitement des instructions dispersées ou produire une réponse trop lente pour le workflow visé.


L’offre OpenRouter consultée dans le rapport affiche 1 048 576 tokens de contexte et 64 000 tokens de sortie [6]. Cette fiche est une information sur un fournisseur API, susceptible d’évoluer ; elle ne doit pas être reformulée en annonce Tencent ni en validation indépendante. Elle peut servir à définir un scénario d’accès, pas à conclure sur la qualité ni sur l’inférence locale.


Dimension du long contexteÉtat dans le dossierMesure nécessaire
Longueur annoncée>1M côté Tencent/Hy ResearchLongueur effectivement acceptée par version et runtime
Longueur API1 048 576 selon OpenRouterVérification à la date du test
Sortie API64 000 selon OpenRouterVérification, puis distinction entrée/sortie
RécupérationNon établieExactitude par position et avec distracteurs
FidélitéNon établieContrôle des citations, omissions et contradictions
LatenceNon fourniePremier token et débit à chaque palier
CoûtTarification tierce susceptible d’évoluerCoût du prompt, de la sortie et des répétitions

Le KV cache est la réserve la plus facile à oublier. À mesure que l’entrée s’allonge, le système conserve de l’état pour générer la suite. La forme exacte de cette croissance, les méthodes de pagination, la précision du cache et les stratégies d’éviction doivent être documentées par le runtime testé. Sans cela, annoncer un million de tokens comme une expérience locale serait abusif.


4. Coding et agents : un positionnement expert n’est pas une autonomie prouvée


Le dépôt officiel indique un entraînement orienté vers des tâches réalisées par des experts internes, notamment l’ingénierie logicielle, le développement de jeux, l’analyse financière et la sécurité [5]. Tencent indique aussi une intégration ou un accès dans WorkBuddy, CodeBuddy, Yuanbao, ima et d’autres produits [1]. Ces éléments montrent un positionnement métier et une voie de déploiement produit. Ils ne constituent pas une évaluation indépendante du modèle seul.


Dans cet article, « agentique » désigne une séquence observable : planifier une tâche, appeler des outils bornés, lire leur résultat, corriger une erreur, poursuivre plusieurs étapes puis s’arrêter selon une contrainte. Un bon agent de code ne se résume pas à produire une fonction plausible. Il doit modifier un dépôt, respecter ses conventions, lancer les tests, interpréter un échec et éviter d’élargir la tâche sans autorisation.


La contre-épreuve consiste à retirer l’effet de démonstration. Même modèle, mêmes outils, mêmes permissions, même dépôt et même budget d’actions : on compare une tâche simple, une tâche avec tests cassés et une tâche comportant une instruction contradictoire. On compte les appels, les interventions humaines, les commandes refusées, les boucles et les modifications non demandées. Une intégration dans un produit Tencent peut bénéficier d’une orchestration, d’un contexte système et d’outils que l’on ne retrouve pas dans un checkpoint nu.


Capacité agentiqueIndice disponibleTest à conduireCritère de réussite
PlanificationPositionnement métier communiquéDécomposer une tâche sans exécution immédiateÉtapes pertinentes et bornées
Usage d’outilsIntégration produit annoncéeOutils simulés, journalisés et limitésAppels valides, arguments corrects
CodingDomaine d’entraînement revendiquéModifier un dépôt et lancer les testsPatch minimal et tests passants
Reprise après erreurNon mesuréeIntroduire un échec contrôléCorrection sans boucle indéfinie
ContraintesNon mesuréesInstruction contradictoire et fichiers interditsRespect des limites explicites
SupervisionNon mesuréeCompter les interventions humainesNiveau de supervision publié

Le verdict raisonnable est donc « modèle positionné pour des workflows agentiques », pas « agent autonome ». Pour le lecteur développeur, la question utile n’est pas de savoir si Hy4 sait écrire du code en général, mais dans quelles conditions il produit un changement vérifiable, réversible et compatible avec les tests.


5. Apache 2.0 et open source : l’ouverture a plusieurs périmètres


Les dépôts Hugging Face référencés indiquent une publication des poids sous Apache License 2.0, ainsi qu’une variante FP8 [3][4]. C’est un élément concret et important. Une licence permissive sur ce qui est distribué peut faciliter l’hébergement par des tiers, l’intégration dans un service, l’audit du fichier de poids et certaines adaptations, sous réserve de respecter les obligations applicables.


Elle ne signifie pas que toute la chaîne est ouverte. Le dossier ne confirme pas que le code d’entraînement, les données, la recette de reproduction, les évaluations et tous les composants nécessaires sont disponibles dans les mêmes conditions. « Open source » peut aussi être employé dans la communication courante comme raccourci pour « poids téléchargeables et utilisables sous une licence donnée ». Pour éviter l’ambiguïté, il faut nommer le périmètre.


Cette précision ne diminue pas la portée de l’annonce. Elle évite de faire porter à une licence des garanties qu’elle ne contient pas. La souveraineté technique est un continuum : pouvoir télécharger les poids est différent de pouvoir reconstruire l’entraînement ; pouvoir lancer un checkpoint est différent de pouvoir inspecter les données ; pouvoir modifier un service est différent de pouvoir reproduire les résultats.


ComposantÉtabli dans le dossierQuestion de souveraineté
PoidsDépôt public référencéVersion, intégrité et conditions d’usage
Licence des poidsApache License 2.0Portée exacte de la licence et avis associés
Variante FP8Disponible sur Hugging FaceCompatibilité et qualité à mesurer
Code d’entraînementNon établiPeut-on reconstruire la chaîne ?
DonnéesNon établiesProvenance, droits et reproductibilité
RecetteNon établieHyperparamètres, filtrage, infrastructure
RuntimeÀ vérifierPeut-on exécuter sans service propriétaire ?
Services TencentAccès/intégrations annoncésExpérience équivalente reproductible localement ?

6. Inférence locale : la question des 128 Go ne se résout pas avec « 49B actifs »


Sur une machine dotée de 128 Go de mémoire unifiée, le scénario est tentant : un modèle qui n’active que 49B par token semblerait proche d’une cible individuelle. Le dossier ne permet pourtant pas d’affirmer que Hy4 complet, non quantifié, est une cible réaliste sur cette machine. Il ne fournit ni mesure de chargement, ni débit, ni mémoire de travail, ni configuration minimale validée. Il serait donc incorrect de donner une taille de RAM ou un nombre de tokens par seconde inventés.


La faisabilité dépend au minimum du format de poids, de la quantification, de la mémoire réellement disponible pour le processus, de l’offload, du runtime, des kernels et de la longueur du contexte. La variante FP8 est un fait de disponibilité, pas une preuve qu’elle s’exécute confortablement sur un Mac Studio ou une autre machine de 128 Go. Une quantification communautaire pourrait réduire la charge, mais elle ajouterait une variable de compatibilité et de qualité ; ses résultats ne seraient pas automatiquement ceux du checkpoint officiel.


Format ou voieDisponibilitéCe qu’il faut mesurer sur 128 GoVerdict avant mesure
Checkpoint non quantifiéÀ documenter précisémentChargement, marge mémoire, premier token, débitNon démontré
FP8 officielVariante publiéeCompatibilité, mémoire, qualité, vitessePoint de départ, pas garantie
Quantification tierceÀ identifier par fichier et commitIntégrité, qualité, runtime, débitÀ traiter comme expérience distincte
Offload CPU/mémoire unifiéeDépend du runtimeTransferts, latence, stabilitéHypothèse à tester
API distanteOffre tierce possibleCoût, latence, confidentialité, limitesAlternative au local, pas preuve du local

La matrice de test doit consigner le nom exact du fichier, son format, le commit du runtime, le pilote ou système utilisé, la mémoire au repos et en charge, le temps de chargement, le délai du premier token, le débit, les erreurs et la longueur de contexte. Si le modèle ne démarre pas, cela doit apparaître comme un résultat reproductible. « Poids disponibles » et « faisabilité locale non démontrée » peuvent être simultanément vrais.


Pour le propriétaire d’un MS-S1 Max de 128 Go, la recommandation immédiate est de ne pas acheter d’accessoires ni de conclure à partir du seul chiffre 49B. Vérifier d’abord les artefacts publiés et le support réel du runtime ; tester à contexte court ; observer la mémoire ; augmenter par paliers ; arrêter si le système swap, échoue ou devient trop lent ; publier la configuration. L’optimisme est permis comme hypothèse, pas comme résultat.


7. Performances : ce que l’on peut affirmer et ce qu’il faut suspendre


Les sources du dossier établissent une annonce, une architecture, un positionnement, une licence, un format FP8 et une fenêtre de contexte. Elles n’établissent pas un classement général face à Qwen, DeepSeek, GLM ou Hy3. Les résultats qui circulent ne doivent pas être repris sans lecture de l’appendice officiel, identification de la version et séparation entre résultats Tencent et évaluations indépendantes.


Un score n’a de sens qu’avec son protocole. Le prompt, le nombre de tokens générés, le système de notation, la température, les outils, le format et le matériel peuvent modifier le résultat. Comparer Hy4 via une API à un modèle quantifié local n’est pas impossible, mais cela répond à une question de produit différente et doit être présenté comme tel.


Le français mérite un volet propre. L’absence de score français dans le dossier ne prouve pas une mauvaise qualité, mais interdit de la certifier. Compréhension d’un document français, synthèse fidèle, terminologie logicielle, respect d’une consigne contradictoire et commentaires dans le code sont des compétences distinctes. Une sortie fluide peut être factuellement inexacte ; une sortie anglaise excellente ne garantit pas une sortie française équivalente.


Champ de comparaisonValeur à figerPourquoi elle compte
ModèleIdentifiant et version exactsÉvite les variantes silencieuses
LicencePérimètre de la distributionSépare poids, API et chaîne complète
FormatFP8 ou quantification nomméeInfluence mémoire et qualité
MatérielHôte, mémoire, accélérateurRend l’essai reproductible
PromptTexte et paramètres publiésÉvite le cherry-picking
BudgetEntrée, sortie, appels outilsRend les coûts comparables
MétriqueDéfinition et méthodeSépare impression et mesure
ScoreValeur brute et incertitudeÉvite les classements abusifs
CoûtLocal ou tarif API datéCompare des scénarios distincts

Le bon langage est conditionnel : « Tencent positionne », « le dépôt publie », « OpenRouter affiche », « reste à mesurer ». Le mauvais langage serait « meilleur modèle ouvert », « comprend un million de tokens », « remplace un développeur » ou « tient sur 128 Go ».


8. Contre-épreuve et protocole de vérification


La thèse doit pouvoir échouer. Pour Hy4, la contre-épreuve réunit un corpus documentaire long, un petit dépôt logiciel et une séquence agentique avec outils, à matériel, format, prompts et budget constants pour toutes les références. On teste séparément le court et le long contexte, les positions de récupération, la génération et la correction de code, la planification, la reprise après erreur, les instructions contradictoires et la qualité en français.


Pour la récupération, plusieurs faits doivent être placés à des positions connues, avec des distracteurs et des faits absents. La réponse attendue doit distinguer restitution, citation, inférence et refus. Pour le code, le dépôt doit disposer de tests automatisés et d’une licence compatible avec l’essai. Pour l’agent, les outils sont bornés, journalisés et assortis d’un budget ; on compte les interventions humaines, les boucles, les commandes invalides et les modifications hors périmètre.


Chaque résultat doit préciser s’il provient du checkpoint officiel, de FP8, d’une quantification tierce ou d’une API. L’API OpenRouter peut être utile pour tester le service sans achat de matériel, mais ses tarifs et limites sont ceux du fournisseur au moment de l’essai [6]. Elle ne tranche ni la souveraineté locale ni la faisabilité sur 128 Go.


HypothèseTest adverseMétriqueRègle de décision
Le long contexte est utileFaits à plusieurs positions et distracteursExactitude par positionPositif seulement si la dégradation est documentée
49B actifs réduisent le coût pratiqueComparaison chargement/débit avec référencesMémoire, premier token, tokens/sNe pas assimiler calcul et stockage
Hy4 aide au codingPatch sur dépôt avec testsTests passants, reprises, interventionsPositif avec budget et supervision publiés
Hy4 est agentiqueOutils limités et erreur injectéeAppels valides, boucles, arrêtPas d’autonomie proclamée sans trace
FP8 facilite le localMême tâches en FP8 et autre formatQualité, mémoire, vitesseConclure uniquement sur machine testée
L’expérience est bonne en françaisMême protocole francophoneExactitude, registre, termesNe pas extrapoler depuis l’anglais
Le modèle est souverainAudit des artefacts et dépendancesPoids, code, données, runtimeSéparer licence et reproductibilité

Trois verdicts doivent rester séparés. Intérêt scientifique et produit : élevé à examiner, car l’échelle MoE, la fenêtre annoncée et le positionnement sont documentés. Intérêt API : testable, si un fournisseur expose effectivement le modèle, avec des conditions datées. Intérêt local : conditionnel, car il dépend de la mémoire des poids et du KV cache, de la quantification, de l’offload, du runtime, de la vitesse, de la latence et de la qualité à la longueur visée.


Pour décider, lire l’appendice officiel avant toute citation de score ; vérifier les fichiers et leur licence ; essayer un runtime documenté ; enregistrer les logs ; tester FP8 séparément ; comparer une référence dans des conditions explicites ; inclure des tâches françaises ; publier les échecs ; ne pas présenter une API comme une exécution locale. Le verdict de septembre 2026 est précis : Hy4 preview est potentiellement structurant pour les workflows longs, le code et certains agents, mais n’est ni une preuve de supériorité générale, ni un « modèle de 49B », ni une garantie d’exécution confortable sur 128 Go.


9. Verdict provisoire et feuille de route


Verdict de publication — septembre 2026


Hy4 preview mérite d’être suivi comme une sortie importante de l’IA ouverte : Tencent publie des poids sous Apache 2.0, revendique 770B paramètres totaux, 49B actifs par token et un contexte supérieur à 1M. Cela établit une capacité et un positionnement, pas une supériorité générale. La qualité réelle en français, la reproductibilité des performances et l’exécution locale restent à mesurer.


Ce que l’article établitCe qui reste à vérifierDécision actuelle
Sortie officielle, poids publiés, licence Apache 2.0Code d’entraînement, données, reproductibilité complèteOuvert avec périmètre clairement nommé
MoE 770B / 49B actifs et contexte annoncé >1MMémoire, KV cache, latence et fidélité à grande longueurPrometteur, non démontré localement
Positionnement code, agents et documentsScores comparables et traces indépendantesÀ tester, aucun classement proclamé
Variante FP8 disponibleQuantifications et runtime efficaces sur 128 GoProcédure de test, pas compatibilité garantie

La prochaine étape raisonnable consiste à conserver Hy4 dans la veille open source, à tester d’abord l’accès distant si nécessaire, puis à évaluer les formats locaux lorsqu’un runtime et une quantification vérifiables seront disponibles. Pour le MS-S1 Max, aucun essai n’est rapporté dans cet article : une éventuelle exécution doit être documentée avec format, mémoire, offload, contexte, débit, latence et logs.


Les 5 règles d’or


  1. Nommer le périmètre d’ouverture : des poids sous Apache 2.0 ne suffisent pas à prouver que les données, le code et la reproduction sont ouverts.
  2. Ne jamais remplacer 770B par 49B : l’activation par token décrit le calcul, pas la mémoire à prévoir.
  3. Tester le contexte, pas seulement sa longueur : récupération, fidélité, latence et KV cache sont des résultats séparés.
  4. Évaluer l’agent sur des traces : dépôt, outils, tests, erreurs, budget et supervision doivent être visibles.
  5. Séparer les verdicts : intérêt du modèle, intérêt de l’API et faisabilité locale ne répondent pas à la même question.

  6. Enquête menée avec Hermes — septembre 2026


    Sources


    [1] Tencent, « Tencent releases and open-sources Tencent Hy4 preview », https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/ — annonce, ouverture et intégration produit.


    [2] Tencent / Hy Research, « Hy4 preview », https://hy.tencent.ai/research/hy4-preview?langVersion=en — contexte supérieur à 1 million de tokens et positionnement sur les usages longs.


    [3] Hugging Face, dépôt tencent/Hy4-preview, https://huggingface.co/tencent/Hy4-preview — poids et licence Apache License 2.0.


    [4] Hugging Face, dépôt tencent/Hy4-preview-FP8, https://huggingface.co/tencent/Hy4-preview-FP8 — variante FP8.


    [5] GitHub Tencent-Hunyuan, dépôt Hy4-preview, https://github.com/Tencent-Hunyuan/Hy4-preview — dépôt officiel et tâches d’entraînement revendiquées.


    [6] OpenRouter, page tencent/hy4-preview, https://openrouter.ai/tencent/hy4-preview — informations d’API publiques à distinguer de l’annonce Tencent ; tarifs susceptibles d’évoluer.