Alibaba a mis en ligne les poids de Qwen 3.8 le 14 août 2026, onze jours après avoir annoncé la version fermée Qwen3.8-Max. Pour une équipe qui veut un modèle de langage capable de coder, de lire un document ou de raisonner sur un contexte long sans envoyer chaque requête vers une API tierce, c'est la première vraie option de cette génération Qwen : deux modèles, sous deux licences différentes, taillés pour tourner sur votre propre infrastructure plutôt que sur celle d'un fournisseur cloud.
On suit la lignée Qwen depuis la version 2, qu'on a déjà recommandée à des clients cherchant une alternative à OpenAI pour des usages où les données ne doivent pas sortir de l'infra du client. Sur ce sujet précis, on n'a pas encore posé les mains sur Qwen 3.8 en production : le modèle phare pèse 95 milliards de paramètres actifs par requête, ça ne se teste pas sérieusement en un après-midi sur une machine de dev. Cet article s'appuie donc sur les fiches techniques officielles publiées par l'équipe Qwen, les benchmarks qu'elle a rendus publics, et les premiers retours de la communauté qui a commencé à faire tourner le modèle.
Ce que la fiche produit ne vous dira pas d'emblée : la licence n'est pas la même selon le modèle choisi, la version multimodale n'est pas celle qui code le mieux, et l'auto-hébergement a un coût GPU précis, détaillé plus bas.

Le contexte
Le 3 août 2026, Alibaba annonce Qwen3.8-Max, son modèle propriétaire le plus capable à ce jour : vision native, fenêtre de contexte d'un million de tokens par défaut, outils intégrés, accessible uniquement via Alibaba Cloud Model Studio. Onze jours plus tard, le 14 août, l'équipe Qwen publie les poids de deux modèles dérivés sur Hugging Face et ModelScope : Qwen3.8-27B, un modèle dense multimodal de 27 milliards de paramètres, et Qwen3.8-2.4T-A95B, un modèle Mixture-of-Experts de 2 400 milliards de paramètres au total dont 95 milliards activés par requête (512 experts, 11 actifs par passage).
C'est le rythme habituel de Qwen depuis deux générations : sortir la version fermée pour occuper le terrain médiatique, puis publier une version ouverte quelques jours après pour capter les développeurs. Ce qui change cette fois : DeepSeek a imposé le million de tokens de contexte comme standard de fait sur ses derniers modèles, et Qwen 3.8 réplique avec une extension YaRN qui monte le contexte natif de 262 144 tokens à un peu plus d'un million — sans l'offrir par défaut comme Max le fait.
Ce que ça fait concrètement
Les deux modèles ne visent pas le même usage. Qwen3.8-27B est le modèle à choisir si vous avez besoin de lire des images, des vidéos ou des documents en plus du texte : c'est un modèle dense classique, donc plus simple à déployer qu'un MoE. Qwen3.8-2.4T-A95B, lui, est strictement textuel — la documentation officielle est explicite : « multimodal inputs are not supported » — mais c'est la version qui pousse le raisonnement le plus loin, avec un mode réflexion obligatoire sur chaque requête.
Pour un usage de codage ou d'agent autonome, Alibaba recommande explicitement le MoE. Le téléchargement se fait comme n'importe quel modèle Hugging Face :
HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27BLe flag HF_HUB_ENABLE_HF_TRANSFER évite de saturer la connexion sur un téléchargement de plusieurs dizaines de gigaoctets — en BF16 natif, comptez environ 55 Go pour le 27B, et bien davantage pour le MoE.
Les chiffres publiés (et ce qu'ils valent)
On n'a pas de test maison à vous donner sur ce modèle : il est trop récent et trop lourd pour un benchmark sérieux en une semaine sur nos machines. Voici donc ce qu'Alibaba a publié, avec la réserve qui s'impose — ce sont des chiffres constructeur, pas encore reproduits par un tiers indépendant à cette date.
Sur les benchmarks techniques standards, l'équipe Qwen annonce 61,7 % sur SWE-bench Pro, 89,2 % sur GPQA Diamond, 90,3 % sur LiveCodeBench v6, 84,3 % sur OSWorld (usage d'ordinateur) et 64,8 % sur WebArena (navigation web autonome). Trois démonstrations accompagnent l'annonce, plus parlantes que des pourcentages :
10+ jours
Run de codage autonome
265
Commits produits sur ce run
127
Pull requests ouvertes
125h / 7 600 lignes
Reproduction d'un papier de recherche
458 équipes battues
Concours Tianchi (526 équipes)
Le concours Tianchi mérite un mot : c'est un concours de data science organisé par Alibaba lui-même, sur lequel le modèle a dépassé 87 % des équipes humaines inscrites. Ce n'est pas neutre — c'est Alibaba qui juge son propre modèle sur son propre concours — mais le chiffre reste concret, contrairement à un score de benchmark synthétique.
Comparatif
Face à un modèle propriétaire (GPT, Claude) ou à un autre modèle ouvert (DeepSeek, Llama), ce qui distingue Qwen 3.8 n'est pas le score brut mais la structure du choix :
| Critère | Qwen 3.8 (27B / MoE) | Modèle propriétaire (GPT, Claude) | DeepSeek (open-weight) |
|---|---|---|---|
| Prix | Gratuit à l'usage si auto-hébergé, coût = GPU | Abonnement ou facturation à la requête | Gratuit à l'usage si auto-hébergé |
| Hébergement / juridiction | Chez vous, ou Alibaba Cloud (Chine) en hosted | Cloud du fournisseur (US) | Chez vous, ou API DeepSeek (Chine) |
| Lock-in | Aucun sur le 27B, licence à vérifier sur le MoE | Total, API propriétaire fermée | Aucun sur les poids ouverts |
| Maturité écosystème | Récente (moins de deux semaines), tooling léger | Élevée, SDK et intégrations partout | Élevée depuis les versions V3/R1 |
| Support | Communauté Hugging Face, pas de SLA | SLA contractuel possible | Communauté, pas de SLA |
| Cas d'usage idéal | Agent de code interne, données sensibles à garder en interne | Prototypage rapide, sans contrainte de souveraineté | Alternative déjà éprouvée en prod |
Le point commun entre Qwen et DeepSeek — et leur vraie différence avec GPT ou Claude — c'est que les deux viennent de Chine. Auto-héberger règle le problème de juridiction sur l'inférence, pas sur l'entraînement : les données d'entraînement, elles, ont déjà transité par où elles ont transité. Pour un usage RGPD strict sur vos données de production, l'auto-hébergement reste la seule vraie garantie sur le flux d'inférence.
On gère ce genre de setup — GPU dédié, modèle open-weight tournant en interne — pour des clients qui ne veulent pas dépendre d'un cloud IA fermé sans pour autant monter une équipe MLOps. En parler.
Auto-hébergement : ce que ça coûte en GPU
Le 27B a l'avantage d'être facilement quantifiable en GGUF. Les tailles disponibles, du plus compressé au plus fidèle :
| Quantization | Taille | Carte GPU visée |
|---|---|---|
| 2-bit (UD-IQ2_XXS) | ~9 Go | 12 Go, avec dégradation visible |
| 4-bit (Q4_K_M) | ~17 Go | 24 Go — le choix standard |
| 8-bit (Q8_0) | ~29 Go | 48 Go |
| BF16 natif | ~55 Go | classe 80 Go |
Le MoE 2.4T-A95B n'entre dans aucune de ces cases pour un homelab : même quantifié, on parle de plusieurs centaines de gigaoctets à charger, avec 95 milliards de paramètres actifs par token à faire tourner à chaque passage. C'est un modèle pour un cluster, pas pour un rack de garage.
Limites et pour qui ce n'est pas
Points forts
- Le 27B tourne sur une seule carte 24 Go en Q4 — accessible à un homelab sérieux
- Licence Apache 2.0 sur le 27B, aucun lock-in
- Contexte 262k natif, largement suffisant pour la plupart des usages agentiques
Points faibles
- Chiffres de benchmark non vérifiés par un tiers indépendant à la date de publication
- Le MoE, le plus capable des deux, est sous licence restrictive et hors de portée d'un déploiement homelab
- Écosystème de tooling encore jeune, deux semaines d'existence, peu de retours de production
Ce n'est pas un modèle pour qui veut la meilleure qualité de réponse toutes catégories confondues : sur le raisonnement pur, les modèles propriétaires les plus récents restent devant. Ce n'est pas non plus un modèle pour qui veut du support contractuel — vous êtes seul avec la communauté Hugging Face en cas de bug. C'est un modèle pour qui a déjà un GPU ou loue une instance à l'heure, et qui préfère payer du calcul plutôt qu'un abonnement par token sur des données qu'il ne veut pas voir sortir de son infra.
En pratique
Si vous partez sur Qwen 3.8, l'ordre logique : d'abord tester le 27B quantifié en Q4 sur une carte 24 Go pour valider la qualité sur vos propres prompts, avant d'envisager le MoE sur une infra dédiée. Si vous manquez de GPU en interne, on a déjà couvert une solution d'hébergement souverain adaptée à ce genre de charge dans notre retour sur Kyun.sh, un cloud privacy-first sans KYC. Si votre besoin est plutôt un agent de code prêt à l'emploi qu'un modèle brut à intégrer vous-même, on avait aussi testé Lurus Code, un agent de coding IA RGPD-compliant, qui répond à un besoin voisin sans la complexité du self-hosting.
Et si la question de fond est la conformité RGPD de vos outils plutôt que le modèle en lui-même, notre article sur les risques RGPD d'un site vitrine mal configuré pose des bases qui s'appliquent aussi aux briques IA ajoutées à votre stack.
Sources
Cet article a été rédigé avec l'aide de l'IA et relu par un humain avant publication.