Alibaba vient de donner un nouveau coup d'accélérateur à la course mondiale à l'intelligence artificielle. L'équipe Qwen annonce Qwen3.8-Max, son modèle le plus puissant à ce jour, avec un argument spectaculaire : 2,4 billions de paramètres, soit 2 400 milliards. Surtout, le groupe chinois promet de publier les poids du modèle afin que d'autres acteurs puissent l'héberger, l'étudier et l'adapter.
Au 5 août 2026, Qwen3.8-Max est déjà utilisable par API, mais ses poids ne sont pas encore téléchargeables. Qwen annonce leur publication la semaine suivante, avec une version Qwen3.8-27B beaucoup plus accessible.
En bref
Qwen3.8-Max est un modèle multimodal de type MoE, pour Mixture of Experts. Il possède 2,4 billions de paramètres au total, mais en active environ 95 milliards pour traiter chaque token. Il accepte du texte, des images et des vidéos, dispose d'une fenêtre de contexte d'un million de tokens et vise particulièrement le code, les agents autonomes et les tâches professionnelles longues.
Son API coûte 2 dollars par million de tokens entrants et 6 dollars par million de tokens générés. Ce tarif est nettement inférieur à ceux des modèles haut de gamme d'Anthropic et d'OpenAI. L'annonce la plus importante reste cependant la future publication des poids, une première pour un modèle Qwen de classe Max.
Que signifie vraiment open weight ?
Un modèle fermé comme Claude Opus 5 ou GPT-5.6 Sol ressemble à un moteur dont le constructeur conserve les clés. Il est possible de lui demander un trajet en passant par une application ou une API, mais le moteur lui-même reste dans les centres de données de l'entreprise.
Avec un modèle open weight, les valeurs numériques apprises pendant l'entraînement deviennent téléchargeables. Une entreprise ou un laboratoire peut alors exécuter le modèle sur sa propre infrastructure, le quantifier pour réduire sa consommation de mémoire, l'adapter à un domaine particulier ou l'utiliser sans envoyer chaque requête au fournisseur d'origine.
Cela ne signifie pas nécessairement que tout devient open source. Les poids ne donnent pas automatiquement accès aux données d'entraînement, à la recette complète, aux outils de filtrage ou au code utilisé pour entraîner le modèle. La licence reste également déterminante : elle précise les droits de modification, de redistribution et d'utilisation commerciale.
Qwen promet pour le moment les poids de Qwen3.8-Max, mais ne publie pas encore la licence du futur checkpoint. Il faut donc attendre la sortie effective avant de parler d'un modèle totalement exploitable. Comme le montre déjà l'exemple de Brave Leo et de Llama, les poids ne constituent qu'une partie du produit final. L'interface, les outils, l'hébergement et les règles de sécurité restent à construire autour du modèle.
Pourquoi 2,4 billions de paramètres impressionnent sans tout expliquer
Les paramètres sont les milliards de coefficients ajustés pendant l'entraînement. Ils permettent au modèle d'encoder des relations entre les mots, les images, le code et les concepts. Un modèle plus grand dispose théoriquement de davantage de capacité, mais le nombre de paramètres ne mesure pas directement son intelligence.

La qualité des données, l'architecture, le post-entraînement, les outils disponibles et la quantité de calcul utilisée au moment de répondre peuvent compter davantage. Le chiffre rappelle d'ailleurs le modèle Gemini de 1,2 billion de paramètres évoqué pour Siri, sans qu'il soit possible d'en déduire qu'un modèle deux fois plus grand sera deux fois meilleur.
Une architecture Mixture of Experts
Qwen3.8-Max n'active pas ses 2,4 billions de paramètres pour chaque token. Un mécanisme de routage sélectionne certains experts spécialisés selon la requête. Environ 95 milliards de paramètres travaillent ainsi à chaque étape, soit un peu moins de 4 % du total.
Cette organisation permet d'augmenter fortement la capacité du modèle sans multiplier dans les mêmes proportions le calcul nécessaire à chaque réponse. Elle ne supprime toutefois pas le problème du stockage. L'ensemble des poids doit rester accessible au système, même si seule une partie est sollicitée à un instant donné.
L'ordre de grandeur est considérable. Stockés sur 16 bits, 2,4 billions de paramètres représentent théoriquement environ 4,8 To. À 8 bits, il reste environ 2,4 To. Même avec une quantification agressive sur 4 bits, les seuls poids occupent encore approximativement 1,2 To, avant le cache, les activations et les autres besoins du moteur d'inférence.
Qwen3.8-Max n'est donc pas un modèle que le grand public installera simplement sur un MacBook Pro. Son auto-hébergement concernera surtout des laboratoires, des opérateurs cloud et de grandes entreprises disposant d'une infrastructure distribuée. Pour une utilisation locale, la future version Qwen3.8-27B sera beaucoup plus intéressante.
Ce que Qwen3.8-Max sait techniquement faire
La fiche officielle QwenCloud annonce une fenêtre de contexte d'un million de tokens. Le modèle peut recevoir jusqu'à 991 000 tokens en entrée, ou 983 000 en mode raisonnement, et générer jusqu'à 131 000 tokens. Son budget maximal de raisonnement atteint 262 000 tokens.
Qwen3.8-Max accepte du texte, des images et des vidéos en entrée, mais produit principalement du texte. Il prend en charge les appels de fonctions, les réponses JSON structurées, la complétion à partir d'un préfixe et plusieurs niveaux d'effort de raisonnement.
QwenCloud lui ajoute la recherche web, l'extraction de pages, l'interprétation de code et la recherche d'images. Ces outils appartiennent au service hébergé. Ils ne seront pas nécessairement contenus dans les poids téléchargés : une installation privée devra reconstruire sa propre couche d'agents, de permissions et d'exécution.
Des tâches qui durent plusieurs jours
Alibaba positionne surtout Qwen3.8-Max comme un moteur de travail autonome. Dans une expérience publiée par Qwen, le modèle construit et entretient un projet logiciel pendant plus de dix jours. Au 30 juillet, le dépôt aurait fonctionné de manière autonome pendant environ seize jours, avec 265 commits, 127 pull requests et 151 issues.
Une autre démonstration porte sur l'optimisation d'un accélérateur cryptographique. Le modèle enchaîne environ 500 tours et 71 évaluations, réécrit progressivement l'architecture et réduit le nombre de portes logiques de 8 298 à 678.
Qwen présente également une simulation de commerce électronique couvrant 365 jours. Il ne s'agit pas d'une année réelle d'exécution, mais d'une année virtuelle durant laquelle le modèle doit gérer les fournisseurs, les prix, les stocks, les promotions et la trésorerie.
Ces démonstrations sont impressionnantes, mais elles restent des études de cas produites par Alibaba dans des environnements conçus par ses équipes. Elles montrent ce que le modèle peut accomplir dans certaines conditions, pas ce qu'il réussira automatiquement sur tous les projets.
Ce que le graphique d'Alibaba ne prouve pas
Le graphique publié par Qwen place Qwen3.8-Max devant ou au niveau de Claude, Gemini et GPT-5.6 sur de nombreux tests de code, de travail professionnel, de perception visuelle et d'utilisation d'ordinateur. Il faut cependant le lire comme une déclaration du constructeur, pas comme un classement universel.
Le billet technique de Qwen précise que certains tests sont internes et que les modèles ne sont pas toujours évalués dans le même environnement. Les modèles Qwen utilisent parfois OpenCode, les modèles Anthropic Claude Code et GPT-5.6 Codex. Les limites de temps, les outils, le contexte et le nombre d'essais peuvent également varier.
Le graphique compare surtout Qwen3.8-Max à Claude Opus 4.8. Or Anthropic commercialise Claude Opus 5 depuis le 24 juillet 2026, dix jours avant la publication de Qwen. Le nouveau modèle quotidien haut de gamme d'Anthropic est donc absent de la comparaison.
Il serait par conséquent excessif d'affirmer que Qwen bat Claude ou GPT de façon générale. Il faudra attendre des évaluations indépendantes, réalisées avec les mêmes outils, les mêmes prompts et le même budget de calcul.
Qwen3.8-Max face à Anthropic et OpenAI
| Modèle |
Accès |
Contexte |
API entrée / sortie |
| Qwen3.8-Max |
API, poids annoncés |
1 million |
2 $ / 6 $ |
| Claude Opus 5 |
Service hébergé |
1 million |
5 $ / 25 $ |
| Claude Fable 5 |
Service hébergé |
1 million |
10 $ / 50 $ |
| GPT-5.6 Sol |
Service hébergé |
1,05 million |
5 $ / 30 $ |
Tarifs publics par million de tokens au 5 août 2026. Les prix GPT-5.6 Sol indiqués correspondent au contexte court. OpenAI applique une tarification supérieure au-delà de 272 000 tokens d'entrée. Les tokenizers et les budgets de raisonnement diffèrent, ce qui empêche de convertir parfaitement ces tarifs en coût par tâche réussie.
Face à GPT-5.6 Sol, Qwen coûte 2,5 fois moins cher en entrée et 5 fois moins cher en sortie. Face à Claude Opus 5, il est également 2,5 fois moins cher en entrée et environ 4,2 fois moins cher en sortie. L'écart avec Claude Fable 5 est encore plus important.
Le prix ne suffit pourtant pas. OpenAI et Anthropic proposent des plateformes complètes avec des outils, des contrôles de sécurité, des capacités d'agents, du support et une infrastructure déjà opérée. Comme l'illustre le passage de Codex vers une application ChatGPT plus complète, le modèle n'est qu'une composante du produit.

Anthropic ne publie ni les poids ni le nombre de paramètres de Claude Fable 5 ou Claude Opus 5. OpenAI ne communique pas non plus le nombre de paramètres de GPT-5.6 Sol et ne propose pas ses poids au téléchargement. Il est donc impossible de comparer sérieusement les 2,4 billions de Qwen à un nombre équivalent chez Claude ou GPT.
OpenAI possède malgré tout ses propres modèles à poids ouverts, gpt-oss-20b et gpt-oss-120b. La différence est que ces modèles restent beaucoup plus petits que le modèle de pointe GPT-5.6 Sol. Qwen promet ici d'ouvrir directement un modèle de classe Max.
Faut-il utiliser Qwen3.8-Max ?
Pour le grand public : pas spécialement
Les 2,4 billions de paramètres ne constituent pas une raison suffisante pour abandonner ChatGPT ou Claude. Un utilisateur qui souhaite discuter, analyser quelques documents ou organiser son travail trouvera souvent davantage de valeur dans la qualité de l'application, la simplicité des outils et la continuité du service. Qwen Studio permet néanmoins de tester le modèle sans gérer l'infrastructure.
Pour un développeur ou une startup : oui, dans une évaluation comparative
Qwen3.8-Max mérite d'entrer dans une sélection pour le code agentique, les très longs documents, l'analyse d'images ou de vidéos et les workflows utilisant de nombreux outils. Son tarif API peut changer fortement l'économie d'un produit à gros volume.
Il ne faut pas migrer sur la base du graphique d'Alibaba. La bonne méthode consiste à reprendre des tâches réelles, puis à comparer Qwen, Claude et GPT avec les mêmes prompts, les mêmes outils et les mêmes critères : taux de réussite, temps, coût total, erreurs, stabilité et besoin de supervision humaine.
Pour une entreprise avec des données sensibles : potentiel important, mais attente nécessaire
La publication des poids peut permettre un hébergement privé, un meilleur contrôle de la localisation des données et une adaptation à un métier précis. Ce sont des avantages que les modèles Claude et GPT de pointe ne proposent pas sous la même forme.
Il faut toutefois attendre la licence, la model card, les formats de poids, les guides de déploiement et les résultats de sécurité. Héberger soi-même un modèle retire une dépendance au fournisseur, mais transfère à l'entreprise la responsabilité de l'infrastructure, des mises à jour, des permissions et des garde-fous.
Pour une utilisation locale : attendre Qwen3.8-27B
Qwen3.8-Max restera hors de portée d'une machine personnelle, même fortement équipée. La version 27B annoncée en open weight correspond beaucoup mieux aux Mac Apple Silicon, aux stations de travail et aux serveurs équipés d'une seule carte graphique puissante, sous réserve des formats et quantifications qui seront publiés.
Pour la recherche et les grands déploiements privés : c'est là que l'annonce compte vraiment
Les laboratoires, les opérateurs cloud et les entreprises disposant de plusieurs serveurs pourront étudier les 95 milliards de paramètres actifs, tester différentes quantifications, adapter le modèle et construire leurs propres agents. Pour ces acteurs, l'ouverture d'un modèle de cette taille peut être plus importante que quelques points gagnés sur un benchmark.
Le verdict est donc simple : Qwen3.8-Max mérite d'être testé immédiatement par API, mais pas adopté aveuglément. Pour un déploiement privé, il faut attendre la publication réelle des poids et de leur licence. Pour un usage local, la version 27B sera bien plus pertinente.
L'événement n'est pas seulement qu'Alibaba annonce 2,4 billions de paramètres. C'est qu'un modèle de cette échelle pourrait quitter le service fermé de son constructeur pour devenir une infrastructure que d'autres entreprises peuvent contrôler. C'est cette ouverture, plus que le chiffre, qui peut réellement modifier l'équilibre face à Anthropic et OpenAI.