Les Gros Titres des Trillions de Paramètres, la Réalité de la Seule GPU
En l’espace de six semaines cet été, trois laboratoires différents ont chacun annoncé le plus grand modèle à poids ouverts jamais publié. Kimi K3 de Moonshot AI a été publié le 27 juillet avec 2,8 trillions de paramètres. Qwen 3.8-Max d’Alibaba a suivi le 3 août avec 2,4 trillions. Zhipu avait déjà livré GLM-5.2 en juin. Chaque annonce s’accompagnait d’un graphique de performance montrant le nouveau modèle rivalisant avec, ou surpassant, les meilleurs systèmes propriétaires du marché.
Si vous dirigez une entreprise et que vous tentez de comprendre ce que tout cela signifie pour vos plans IA, les gros titres ne sont pas faits pour vous. Un modèle avec 2,8 trillions de paramètres n’est pas quelque chose qu’une entreprise de taille moyenne installe sur un serveur au bureau. C’est un point de données dans un bien plus grand paysage, un dans lequel les modèles réellement déployés au sein d’entreprises concrètes sont généralement une fraction de cette taille. Notre équipe de développement IA reçoit presque chaque semaine la question de savoir si une version à poids ouverts spécifique mérite d’être auto-hébergée, et la réponse honnête commence presque toujours par “lequel, et pour quoi”.
Ce guide vous explique où ce paysage se situe réellement en août 2026: quelles familles de modèles sont réelles et prêtes pour la production, ce que leurs licences permettent vraiment, l’infrastructure que chaque niveau exige réalistement, et la question de conformité que la plupart des présentations de fournisseurs contournent commodément.
Les Six Familles à Connaître
Au moment de la rédaction, six familles de modèles à poids ouverts possèdent des antécédents crédibles et vérifiables indépendamment en production. Trois autres méritent d’être surveillées: Inkling de Thinking Machines, Laguna de Poolside et le très attendu mais non encore publié GLM-5.5. Aucun n’appartient encore à la même catégorie, pour les raisons couvertes ci-dessous.
Kimi K3 (Moonshot AI). Publié le 27 juillet 2026, avec poids complets publiés sur Hugging Face. Avec 2,8 trillions de paramètres totaux et 104 milliards actifs par token, c’est la version à poids ouverts la plus grande à ce jour et la première à surpasser les classements indépendants de Frontend Code Arena, marquant 1.679 Elo contre 1.631 pour Claude Fable 5. Il excelle particulièrement en codage: SWE-bench Verified à 81,2% est un bon résultat en plus de l’avance Frontend Code Arena. Il est sous licence avec une licence Kimi K3 personnalisée plutôt qu’une licence open source standard. Cela importe plus que le graphique de performance une fois que l’équipe juridique s’en mêle (plus d’informations ci-dessous).
Qwen 3.8-Max (Alibaba). Présenté le 19 juillet, complètement lancé le 3 août 2026. Il fonctionne avec 2,4 trillions de paramètres totaux et 95 milliards actifs par token, et excelle dans le raisonnement multimodal, les tests indépendants initiaux suggérant une meilleure fiabilité d’utilisation d’outils d’entreprise que Kimi K3 dans au moins une comparaison. La tarification API est de 2 dollars par million de tokens d’entrée et 6 dollars par million de tokens de sortie. C’est environ 2,5 fois moins cher que la tarification API de Kimi K3. Les versions Qwen antérieures, y compris un checkpoint Qwen3.8-27B plus petit, sont confirmées Apache 2.0. Les poids flagship Qwen3.8-Max eux-mêmes, publiés à la mi-août 2026, sont livrés avec une licence personnalisée séparée à la place, une distinction qui mérite d’être notée si vous supposiez que toute la famille Qwen hériterait les mêmes conditions permissives.
GLM-5.2 (Zhipu). Publié le 13 juin 2026, avec poids ouverts et accès API via des fournisseurs tiers dont OpenRouter. Avec environ 753 milliards de paramètres totaux et environ 40 milliards actifs, il est notablement plus petit que K3 et Qwen 3.8-Max, et cela se voit: GLM-5.2 égale ou surpasse plusieurs modèles propriétaires sur les tâches de codage longue portée à une fraction du coût d’inférence, marquant 62,1% sur SWE-Bench Pro. Il est sous licence MIT, l’une des plus amicales pour les affaires de cette liste.
DeepSeek. DeepSeek V4 a été lancé en avril 2026 avec une fenêtre de contexte d’un million de tokens et poids ouverts. Les détails publics sur cette version sont plus minces que pour les cinq autres familles, alors traitez-le comme l’une des options crédibles qui mérite d’être explorée directement avec votre équipe technique plutôt que comme un choix entièrement spécifié.
Llama 3.1 405B (Meta). Le modèle le plus ancien de cette liste, et de loin. Meta l’a publié le 23 juillet 2024, selon son annonce officielle, et il est encore largement déployé en 2026, méritant d’être inclus ici pour avoir été aussi complètement testé au combat en production. Avec 405 milliards de paramètres denses (chaque paramètre s’active à chaque token, contrairement aux conceptions mixture-of-experts ci-dessus), il se classe aux côtés des modèles de classe Claude et GPT dans les tests d’évaluation à l’aveugle. Il fonctionne avec la Llama Community License, qui est permissive pour la grande majorité des entreprises mais n’est pas une véritable licence open source: Meta conserve des restrictions d’utilisation qu’Apache 2.0 ou MIT n’ont pas.
Mistral Large 3 (Mistral AI). Lancé en décembre 2025 et mis à disposition plus largement en accès anticipé en juillet 2026. Avec 675 milliards de paramètres totaux et 41 milliards actifs, il est sous licence Apache 2.0 et tarifé à 0,50 dollar par million de tokens d’entrée et 1,50 dollar par million de tokens de sortie, parmi les options API les moins chères de cette liste. Mistral ne revendique pas une performance de raisonnement au niveau frontière; il est plutôt positionné comme un modèle d’entreprise efficace en coûts et fortement multilingue, ce qui est une position défendable et honnêtement énoncée.
Pourquoi la Licence Compte Plus que la Performance
Chacune des six familles ci-dessus publie des poids que vous pouvez télécharger. Ce seul fait est aplati en “open source” dans beaucoup de couverture. Cet aplatissement importe. Les licences attachées à ces versions ne sont pas interchangeables.
Apache 2.0 et MIT sont les défauts sûrs. Mistral Large 3 et les versions Qwen antérieures, y compris le plus petit checkpoint Qwen3.8-27B, portent Apache 2.0. Les versions DeepSeek et GLM-5.2 sont toutes deux sous licence MIT. Les trois permettent l’usage commercial, la modification et la redistribution avec un frottement minimal, c’est pourquoi les équipes juridiques les approuvent généralement rapidement.
La Llama Community License est permissive mais conditionnelle. Llama 3.1 405B est libre d’utilisation pour la grande majorité des entreprises, mais elle reste une licence communautaire plutôt qu’une licence open source standard. Meta attache des conditions d’utilisation, y compris des restrictions liées à la taille de l’entreprise, qu’Apache 2.0 n’a pas.
Kimi K3 et le flagship Qwen 3.8-Max ont tous deux besoin d’un examen juridique avant l’utilisation en production. Aucun n’est livré avec Apache 2.0, MIT ou une licence standard comparable. La licence Kimi K3 personnalisée de Moonshot exige un accord commercial séparé une fois qu’un service construit sur celle-ci dépasse des seuils de revenus définis. Alibaba a publié les poids flagship Qwen3.8-Max à la mi-août 2026 également sous sa propre licence personnalisée, distincte des conditions Apache 2.0 couvrant les checkpoints Qwen plus petits. L’analyse de Layer3Labs des modèles à poids ouverts prêts pour le business signale les licences personnalisées comme celles-ci comme portant un vrai risque de conformité à mesure qu’un déploiement s’étend, puisque les termes peuvent changer entre l’aperçu et la sortie générale d’une manière qu’une licence standard ne permettrait pas.
L’enseignement pratique: exécutez chaque modèle que vous évaluez par le processus d’examen standard des licences logicielles de votre équipe juridique avant qu’il ne touche les données de production, de la même manière que vous le feriez avec n’importe quelle dépendance tierce. Un modèle avec un score de performance plus fort et une licence plus floue n’est pas automatiquement la meilleure décision commerciale.
Ce que « Compétitif avec les Modèles Frontière » Signifie Vraiment
Les annonces des fournisseurs cet été ont été agressives en positionnant leurs modèles comme égaux ou supérieurs aux meilleurs systèmes propriétaires. Certains d’entre eux sont défendables. Certains ont besoin d’une correction avant d’atteindre un deck de conseil d’administration.
Les audits indépendants d’Artificial Analysis, une entreprise d’analyse comparative tierce, placent Kimi K3 avec un score Intelligence Index de 57,1, le classant troisième mondialement, contre environ 60 pour Claude Fable 5. C’est un véritable écart, et il est visible nettement sur les tâches de raisonnement plus difficile: sur le benchmark Omniscience, Fable 5 répond correctement à 61% des questions factuelles difficiles contre 46% pour K3. K3 montre également un taux d’hallucination plus élevé que son prédécesseur, 51% contre 39%, un détail qui mérite d’être pris au sérieux si votre cas d’usage touche à quelque chose de critique pour les faits comme le travail juridique ou de conformité. Ces scores d’indice sont un instantané: Artificial Analysis les recalcule à mesure que de nouveaux modèles et variantes de raisonnement étendu entrent dans le classement, alors traitez les chiffres exacts comme directionnels plutôt que de les vérifier une fois et de les archiver.
Où K3 gagne vraiment ses gros titres, c’est le codage. Son score Frontend Code Arena et son résultat SWE-bench Verified sont tous deux solides selon toute mesure indépendante, et plusieurs praticiens rapportent des résultats solides en déployant K3 dans des pipelines d’ingénierie réels. La leçon se généralise au-delà de K3. Les modèles à poids ouverts ont tendance à être forts sur le travail spécifique à une tâche comme la génération de code et plus faibles sur le raisonnement large et difficile. Un graphique de performance qui mélange les deux en un gros titre “compétitif avec les modèles frontière” vous rend un mauvais service.
Il y a un deuxième rebondissement qui mérite d’être signalé. Différentes configurations d’évaluation peuvent faire varier le score d’un même modèle de 10 à 26 points. Cela seul rend les tableaux de performance inter-fournisseurs peu fiables, même lorsque personne n’est délibérément trompeur. Un examen axé sur la sécurité de Semgrep illustre le problème de l’intérieur: l’exécution de Kimi K3 à travers deux configurations de notation différentes de sa propre a produit deux nombres de précision différents pour le même modèle, et K3 est resté derrière les modèles concurrents dans la comparaison inter-modèles de Semgrep lui-même. Traitez les tableaux de performance inter-fournisseurs comme directionnels au mieux. Appuyez-vous sur les chiffres auditées indépendamment, comme l’Artificial Analysis Intelligence Index, quand la décision compte vraiment.
Et une mise en garde sur GLM: le prochain modèle de Zhipu, largement appelé GLM-5.5 en ligne, est prévu autour d’août 2026 selon les notes des analystes et les fuites communautaires décrivant une architecture d’un peu plus d’un trillion de paramètres. Au moment de la rédaction, Zhipu n’a publié aucune fiche de modèle officielle, de performance ou d’endpoint API pour cela. Jusqu’à ce que cela change, traitez GLM-5.5 comme une rumeur qui ne devrait pas influencer une décision de déploiement.
Ce que Cela Coûte Vraiment de Faire Fonctionner Ces Modèles
C’est là que l’écart entre le gros titre et la réalité du déploiement est le plus large. Kimi K3 et Qwen 3.8-Max sont les deux plus grands modèles à poids ouverts les plus capables disponibles maintenant, et ni l’un ni l’autre n’est un objectif réaliste d’auto-hébergement pour une entreprise typique. Faire fonctionner un modèle avec 2,8 trillions de paramètres à l’échelle de la production nécessite une infrastructure GPU dans la plage de 10 millions à 100 millions de dollars ou plus, ou un partenariat négocié avec un fournisseur d’inférence géré. C’est une décision d’infrastructure à l’échelle de la construction d’un centre de données plutôt que de l’installation de logiciels. Peu d’entreprises en ont besoin.
Vous verrez parfois K3 décrit comme capable de “fonctionner sur du matériel grand public”. C’est trompeur même après avoir tenu compte de la quantification: les poids de K3 totalisent environ 1,4 téraoctet une fois compressés, plus que ce qu’une seule GPU sur le marché peut contenir, y compris une carte de station de travail de 50.000 à 100.000 dollars. Le guide de déploiement de Moonshot lui-même appelle un cluster de 64 ou plus accélérateurs, et un déploiement de production réel signifie louer ou construire ce cluster, coûtant des dizaines de milliers de dollars par mois au minimum. Les mathématiques sont impitoyables. Le gros titre obscurcit à la fois le coût réel et l’infrastructure réelle.
Les modèles que la plupart des entreprises peuvent réalistement auto-héberger se situent dans un niveau très différent: modèles de 40 à 100 milliards de paramètres, souvent des conceptions mixture-of-experts où seule une petite fraction des paramètres s’active par inférence, fonctionnant bien quantifiés sur une GPU haut de gamme. Les 40 milliards de paramètres actifs de GLM-5.2 et les 41 milliards actifs de Mistral Large 3 se situent tous deux dans cette plage, même si leurs comptages totaux de paramètres semblent grands sur papier. C’est aussi là où vivent les variantes plus petites de Llama et la plupart des déploiements auto-hébergés pratiques. Les flagships à des trillions de paramètres font la couverture de presse; ces modèles plus petits génèrent le vrai trafic en production.
Sur la question plus large des coûts, soyez sceptique quant à l’affirmation selon laquelle les modèles à poids ouverts sont maintenant simplement moins chers d’auto-héberger qu’une API propriétaire. C’est vrai seulement au-dessus d’un certain seuil, et ce seuil est déterminé par le volume et la prévisibilité plutôt que par le modèle que vous avez choisi. L’auto-hébergement se paie surtout avec des charges de travail stables et à haut volume, des millions de tokens par jour, soutenu. Pour une demande imprévisible ou sporadique, une API gérée reste généralement moins chère une fois compté honnêtement la location de GPU, le temps du personnel pour l’évaluation du modèle et le surcoût opérationnel de l’exécution de votre propre pile d’inférence.
La plupart des entreprises exécutant l’IA en production en 2026 utilisent plutôt une approche hybride au lieu de choisir un côté. Une API gérée pour le raisonnement complexe ou à fort enjeu, des modèles auto-hébergés plus petits pour le travail à haut volume et basse complexité comme la classification ou l’ébauche de premier passage. Si vous voulez un walkthrough plus approfondı de ce calcul pour votre charge de travail, notre article sur l’exécution d’un cluster d’inférence local pour une PME explore l’infrastructure et les mathématiques du seuil de rentabilité en détail.
La Question de Conformité que Personne n’Aborde dans son Deck
Quatre des six familles de modèles crédibles couvertes ici, Qwen, Kimi K3, DeepSeek et GLM, proviennent de laboratoires chinois. C’est quatre sur six. Aucune de la documentation officielle de ces modèles n’aborde les règles de contrôle d’exportation américaines ou les obligations de la loi IA de l’UE qui peuvent s’appliquer selon votre juridiction, votre secteur et votre façon de déployer le modèle.
Les réglementations d’administration de l’exportation et la législation spécifique à l’IA de l’UE sont toutes deux des domaines actifs et en évolution du droit, et ni Moonshot, Alibaba ni Zhipu ne publie de directives sur la façon dont leurs conditions de licence ou de déploiement interagissent avec l’un ou l’autre cadre. Si votre entreprise opère sous juridiction de contrôle d’exportation américaine, dans un secteur réglementé de l’UE ou gère du travail gouvernemental ou connexe à la défense, impliquez le conseil juridique avant que l’ingénierie ne commence à construire contre le modèle, tandis que la décision est encore peu coûteuse à inverser.
Nous ne prétendons pas résoudre cette question ici, car cela dépend vraiment de votre juridiction, votre secteur et les spécificités de votre déploiement. Ce que nous dirons, c’est ceci: si la documentation d’un fournisseur est silencieuse sur le contrôle d’exportation et l’exposition réglementaire, ce silence n’est pas la même chose qu’un certificat de bonne santé. Intégrez l’examen juridique à votre calendrier d’évaluation dès le départ, avant qu’un modèle ne soit déjà en production et que l’examen ne devienne une étape que quelqu’un découvre avoir été contournée.
Qui Devrait Vraiment Évaluer les Modèles à Poids Ouverts Maintenant
Un bon ajustement si:
- Vous avez une charge de travail prévisible et à fort volume où les coûts en tokens se composent de manière significative sur un an.
- Les exigences de résidence ou de localisation des données contractuelles font d’une API tierce un “non” dur indépendamment du coût.
- Votre cas d’usage principal est la génération de code ou une autre tâche étroite et bien évaluée où les modèles à poids ouverts plus petits fonctionnent déjà près du niveau frontière.
- Vous avez, ou êtes disposé à développer, la capacité interne à évaluer, affiner et surveiller un modèle dans le temps. L’auto-hébergement est un engagement d’ingénierie continu qui dépasse le déploiement initial, plus proche de l’embauche que de l’approvisionnement.
Probablement pas la bonne décision encore si:
- Votre usage est à faible volume ou imprévisible. Une API gérée restera presque certainement moins chère.
- Votre cas d’usage est le raisonnement large et difficile où l’écart actuel entre les modèles à poids ouverts et les modèles propriétaires frontière (environ 6 points sur Artificial Analysis Intelligence Index) est susceptible d’importer.
- Vous n’avez pas encore quelqu’un en interne pour posséder l’évaluation du modèle et l’infrastructure en tant que responsabilité continue.
- Vous envisagez un modèle d’origine chinoise pour une charge de travail réglementée ou connexe au gouvernement sans approbation juridique déjà en main.
Où Ce Paysage Va Vraiment
L’écart entre les meilleurs modèles à poids ouverts et les meilleurs systèmes propriétaires frontière s’est réduit significativement au cours de l’année dernière, passant d’environ 13 points à environ 6 points sur les indices de performance indépendants. C’est une vraie tendance. Il est raisonnable de s’attendre à ce qu’elle continue. Mais «réduit» n’est pas la même chose que «fermé», et les modèles générant la plupart de l’attention maintenant, les versions à des trillions de paramètres de Moonshot et Alibaba, sont les moins accessibles pour une entreprise typique à réellement exécuter.
Si vous évaluez si l’IA à poids ouverts a une place dans votre stack, la question la plus utile généralement n’est pas «quel modèle dirige le classement ce mois-ci». C’est si votre charge de travail est assez stable et votre équipe assez équipée pour faire payer l’auto-hébergement, si la sensibilité des données justifie l’effort et si le modèle spécifique que vous envisagez a une licence que votre équipe juridique approvera réellement. Ces questions ne bougent pas presque aussi vite que le cycle de sortie, ce qui est exactement pourquoi elles méritent des réponses réfléchies. Pour un regard plus proche de si l’auto-hébergement convient à votre situation, consulter notre guide sur l’IA sur site pour les petites et moyennes entreprises, et si les frameworks agentiques font partie du plan, notre comparaison entre plateformes agentiques open source et propriétaires couvre la couche qui s’assied généralement sur le modèle que vous choisissez.
Questions fréquentes
Que signifie vraiment « à poids ouverts » et est-ce la même chose que l''open source?
À poids ouverts signifie que les paramètres entraînés d'un modèle sont publiés pour que n'importe qui puisse les télécharger et les exécuter, contrairement aux modèles fermés comme GPT ou Claude qui ne sont accessibles que via une API. Ce n'est pas la même chose que l'open source: plusieurs versions à poids ouverts, notamment Llama de Meta et Kimi K3 de Moonshot, utilisent des licences personnalisées ou communautaires avec des restrictions d'utilisation plutôt qu'une véritable licence open source comme Apache 2.0 ou MIT.
Quelles familles de modèles à poids ouverts méritent une évaluation pour une entreprise en 2026?
Six familles possèdent actuellement des antécédents crédibles et vérifiables en production: Qwen et Kimi K3 (échelle frontière, exigences en infrastructure maximales), GLM et DeepSeek (forte performance en codage à moindre coût) et Llama et Mistral (écosystèmes matures avec des licences permissives). Celle qui convient dépend de votre charge de travail, de votre tolérance aux licences et de votre besoin d'une performance de raisonnement au niveau frontière ou d'un modèle plus petit et économique pour une tâche étroite.
Les modèles à poids ouverts font-ils vraiment économiser de l''argent par rapport à une API propriétaire comme Claude ou GPT?
Seulement au-delà d'un certain volume et uniquement pour les charges de travail stables et prévisibles. L'auto-hébergement entraîne des coûts fixes en infrastructure et en personnel qu'une API à la demande n'a pas, donc il gagne surtout sur les coûts avec un usage soutenu et à fort volume. Pour une demande imprévisible ou sporadique, une API gérée reste généralement moins chère une fois comptabilisés honnêtement la location de GPU, la maintenance et le temps d'évaluation.
Est-il légal pour une entreprise occidentale de déployer un modèle à poids ouverts développé en Chine comme Qwen ou Kimi K3?
Cela dépend de votre juridiction, votre secteur et la façon dont le modèle est déployé, et la documentation des fournisseurs pour ces modèles n'aborde pas les obligations de contrôle d'exportation ou de la loi IA de l'UE. Les entreprises dans les secteurs réglementés ou soumises aux règles d'administration de l'exportation américaine devraient obtenir des conseils juridiques spécifiques à la juridiction avant de s'engager dans un modèle d'origine chinoise dans un système de production.
Quelle taille doit avoir un modèle à poids ouverts pour tourner sur une seule GPU?
Les modèles dans la plage de 40 à 100 milliards de paramètres, en particulier les conceptions mixture-of-experts où seule une fraction des paramètres s'activent par token, peuvent tourner bien quantifiés sur une GPU haut de gamme. Les modèles phares à des trillions de paramètres comme Kimi K3 et Qwen 3.8-Max sont un niveau tout à fait différent, nécessitant des clusters multi-GPU ou une API gérée plutôt qu'une simple station de travail.