Qwen3.8-27B : le modèle ouvert d'Alibaba se mesure à Claude
Alibaba a publié Qwen3.8-27B le 14 août 2026 sous licence Apache 2.0. Sur les benchmarks de l'éditeur, le modèle passe devant Claude Opus 4.6 sur deux épreuves de code et reste derrière sur d'autres. Nous faisons le point pour les équipes qui arbitrent entre API propriétaire et modèle auto-hébergé.
Sommaire(8 sections)
- Ce qu'Alibaba a publié, exactement1
- Les benchmarks : un tableau d'éditeur, à lire dans les deux sens2
- Sur une vraie tâche de développement, ça donne quoi3
- Le vrai basculement : le modèle peut rester chez vous4
- Auto-héberger reste un choix actif, pas une évidence5
- Ce qu'une équipe en retient6
- Pour aller plus loin7
- Sources8
Une équipe qui a branché un modèle d'IA dans son produit vit avec deux contraintes qu'elle ne maîtrise pas vraiment : une facture indexée sur l'usage, et du code qui part chez un tiers à chaque requête. Le 14 août 2026, l'équipe Qwen d'Alibaba a publié Qwen3.8-27B, un modèle dont les poids se téléchargent librement et qui, sur les mesures publiées par l'éditeur, passe devant Claude Opus 4.6 sur deux épreuves de code. Ça ne règle pas les deux contraintes, mais ça déplace la question.
Ce qu'Alibaba a publié, exactement
Qwen3.8-27B est un modèle dense de 27 milliards de paramètres (dimension cachée de 5120, 64 couches), nativement multimodal : il comprend les images et la vidéo en plus du texte. Sa fiche modèle officielle annonce une fenêtre de contexte native de 262 144 tokens, extensible jusqu'à 1 million de tokens via YaRN, une technique d'extension de contexte. L'architecture empile deux types de couches d'attention. Les couches classiques (Gated Attention) comparent chaque mot du contexte à tous les autres : précis, mais le coût de calcul s'envole dès que le texte s'allonge. Les couches linéaires (Gated DeltaNet) résument l'historique au fil de la lecture, moins finement, mais pour un coût qui reste proportionnel à la longueur. En alternant les deux, le modèle encaisse des contextes très longs sans que la facture de calcul suive la même courbe.
Le modèle succède à Qwen3.5 et Qwen3.6, dont il reprend les fondations architecturales. Alibaba le présente comme la génération la plus capable de sa famille de modèles ouverts à ce jour, avec des gains sur le code, les tâches professionnelles, la recherche et les tâches agentiques longues. C'est une progression continue plutôt qu'une rupture surgie de nulle part, et c'est précisément ce qui rend la trajectoire intéressante à suivre.
Le point qui compte le plus pour une direction technique tient en deux mots : Apache 2.0. Le dépôt officiel d'Alibaba Cloud distribue le modèle sous cette licence permissive, sans restriction d'usage commercial. Vous pouvez télécharger les poids, les exécuter où vous voulez et les intégrer dans un produit vendu. Une nuance mérite d'être posée tout de suite : la publication professionnelle IT eWeek relève que le grand frère de la gamme, Qwen3.8-2.4T-A95B, sort lui sous une licence maison qui impose un accord distinct à certains services au-delà de 50 millions de dollars de revenus sur douze mois glissants. C'est bien ce modèle de 27 milliards de paramètres, pas toute la famille Qwen3.8, qui est sous Apache 2.0.
Les benchmarks : un tableau d'éditeur, à lire dans les deux sens
Qwen publie son propre tableau comparatif, et il faut le lire comme tel : des épreuves choisies et mesurées par l'éditeur du modèle. Deux lignes y sautent aux yeux. Sur SWE-bench Pro, qui fait résoudre de vrais tickets issus de dépôts open source, Qwen3.8-27B marque 61,7 contre 53,4 à la colonne Opus4.6 Max, soit Claude Opus 4.6 poussé à son effort de raisonnement maximal. Sur LiveCodeBench v6, des problèmes de programmation récents, 90,3 contre 88,8.
Le même tableau donne l'inverse sur d'autres épreuves de code, ce qui est à porter au crédit de l'éditeur. Sur Terminal Bench 2.1, qui mesure le travail autonome dans un terminal, Qwen3.8-27B est à 73,0 contre 78,2. Sur NL2Repo-Bench, qui teste la génération de code à l'échelle d'un dépôt entier, 42,3 contre 47,6. Le raccourci « le modèle ouvert est passé devant sur le code » ne tient donc pas tel quel : il passe devant sur deux épreuves, il reste derrière sur deux autres.
Sur le raisonnement, l'écart est plus net et il ne s'inverse nulle part. GPQA Diamond, qui teste le raisonnement scientifique de niveau doctorat : 89,2 contre 91,3. Humanity's Last Exam, une épreuve de raisonnement multidisciplinaire difficile : 30,8 contre 40,0. Un modèle très bon sur certaines tâches de code n'est donc pas automatiquement au niveau sur le raisonnement large.
Une précision méthodologique change la lecture de la ligne la plus spectaculaire, et Qwen la donne lui-même : sur SWE-bench Pro, le score de Claude Opus 4.6 est repris tel qu'Anthropic, l'éditeur des modèles Claude, l'a officiellement publié, sans réévaluation. Tous les autres modèles du tableau, Qwen3.8-27B compris, ont été réévalués par Qwen avec le harnais Claude Code, ses propres paramètres et un jeu de tâches qu'il a lui-même corrigé. On met donc face à face des mesures maison et un chiffre externe repris tel quel. Ça ne disqualifie rien, ça rappelle simplement qu'un tableau de benchmarks constructeur est un point de départ, pas un verdict.
Autre borne à poser : la comparaison porte sur Claude Opus 4.6, pas sur Claude Opus 5 publié depuis. Qu'un modèle ouvert de 27 milliards de paramètres rattrape une génération frontière précédente sur une partie des tâches de code, c'est déjà l'information marquante. Ce n'est pas la même phrase que « l'open source a rattrapé le fermé ».
Sur une vraie tâche de développement, ça donne quoi
Les scores de benchmark ne disent rien de la fiabilité au quotidien. Le média technique allemand heise online a donc mis le modèle, exécuté en local, sur une tâche d'entreprise banale : générer une API REST complète pour un système de gestion de stock, avec gestion des utilisateurs et autorisations par rôle, sans poser la moindre question de clarification. Le modèle a travaillé 12 minutes, le code a compilé dès le premier essai et les fonctions demandées étaient au rendez-vous. Il a repéré seul des doublons dans sa propre production et lancé un refactoring.
Le testeur juge le résultat indissociable des compétences de programmation de Claude, avec une réserve honnête : une tendance à sur-analyser des problèmes simples, à s'enliser dans les détails et donc à consommer beaucoup de tokens et de temps, comportement qu'il estime ajustable par paramétrage. C'est un test, pas une campagne de mesure. Il reste plus parlant qu'un score, parce qu'il porte sur le genre de tâche que vos équipes confient réellement à un assistant.
Le vrai basculement : le modèle peut rester chez vous
Voilà où l'actualité devient une question d'architecture. Un modèle accessible uniquement par API impose que vos prompts, donc votre code source et vos données métier, sortent de votre réseau à chaque appel. Des poids ouverts changent la donne, et la barre matérielle est plus basse qu'on ne l'imagine. heise a mené son essai sur une carte professionnelle Nvidia RTX Pro 6000 Blackwell, mais relève dans le même article que les versions quantifiées du modèle, dont les poids sont stockés dans un format moins précis pour occuper moins de mémoire, tiennent dans 22 Go de mémoire vidéo, soit une carte de jeu haut de gamme (RTX 3090, 4090, 5090, Radeon 7900 XTX). Les fichiers publiés par Unsloth, l'éditeur qui distribue ces versions compressées, le confirment : 18,5 Go pour la variante Q5_K_M, 15,9 Go pour la Q4_K_M. On parle d'un poste de travail, pas d'une salle serveur, et des outils comme Ollama ont banalisé la manipulation.
Pour une entreprise soumise au RGPD, à un secret industriel ou à des clauses de confidentialité client, ce n'est pas un détail de tuyauterie. C'est l'écart entre « nos données transitent chez un prestataire, sous contrat » et « nos données ne quittent pas notre infrastructure ». C'est aussi une réponse concrète au Shadow AI, ces usages d'outils d'IA non validés qui prospèrent quand la solution officielle est trop contraignante : un modèle disponible en interne, sans compte à créer ni budget à demander, retire beaucoup de raisons de contourner.
Auto-héberger reste un choix actif, pas une évidence
Alibaba l'illustre lui-même : en parallèle des poids téléchargeables, l'éditeur annonce une offre hébergée, Qwen Cloud, avec un contexte d'un million de tokens par défaut et des outils intégrés, présentée comme bientôt disponible au moment de la sortie. Même l'éditeur d'un modèle à poids ouverts propose donc une option managée. L'arbitrage n'est pas « propriétaire contre open source », il est « qui exploite le modèle, et à quelles conditions ».
Parce que « ouvert » ne veut pas dire « gratuit ». Faire tourner un modèle de cette taille en production, c'est une infrastructure à dimensionner (GPU, mémoire, stockage des poids), à superviser, à sécuriser et à mettre à jour au rythme des sorties. C'est aussi une compétence à installer dans l'équipe, pas seulement une machine à louer. Un modèle qui tourne trois semaines puis que personne ne sait redémarrer un lundi matin ne rend service à personne.
Le calcul honnête met en face, d'un côté, un abonnement API dont le coût suit l'usage et qui n'immobilise aucune machine, de l'autre, un serveur à équiper ou à louer, une supervision, une chaîne de mise à jour au rythme des sorties. Sur un usage sporadique, l'API garde l'avantage. Sur un usage massif et régulier, ou dès que la confidentialité devient une contrainte réglementaire, la bascule devient défendable. Et rien n'oblige à trancher globalement : beaucoup d'architectures font tourner les traitements sensibles en local et gardent l'API pour les tâches où le modèle le plus capable fait la différence.
Ce qu'une équipe en retient
Qwen3.8-27B ne rend obsolète aucun contrat en cours. Ce qu'il change, c'est la réponse par défaut. Il y a un an, « on garde le modèle en interne » se heurtait vite à un écart de qualité difficile à assumer devant les utilisateurs. Sur une partie des tâches de code, cet écart s'est réduit au point de s'inverser, tandis qu'il reste net sur le raisonnement généraliste et sur le travail autonome en terminal. Autrement dit, l'option souveraine est devenue crédible sur un périmètre précis, pas sur tout.
La décision se prend donc sur vos tâches, pas sur un tableau d'éditeur : un jeu de cas représentatifs de votre métier, rejoué sur deux ou trois modèles, avec le coût réel mesuré de bout en bout et la contrainte de confidentialité posée dès le départ. C'est exactement le travail d'un audit et d'une étude de cadrage avant d'engager la moindre intégration, et c'est ce qui évite de tout réoutiller au modèle suivant. Chez Koul, c'est la porte d'entrée que nous proposons systématiquement sur les sujets d'automatisation et d'IA : on mesure avant de câbler.
Pour aller plus loin
- Le glossaire de l'IA générative : tokens, poids, contexte, agents, les 27 termes qui reviennent dans toutes ces annonces.
- Le RAG, connecter une IA à vos données d'entreprise : la brique qui rend un modèle utile sur votre métier, ouvert ou non.
- Intégrer un LLM dans une application Next.js : à quoi ressemble le câblage côté produit.
- Hermes Agent : notre agent maison, pour voir ce que donne une chaîne agentique qui tourne vraiment.
- Grok 4.6, ce qui change pour vos agents : l'autre bout du marché, celui des modèles fermés facturés au token.
Sources
Chaque chiffre de cet article est repris d'une source primaire ou d'un test publié, vérifiée en statut 200 au 18 août 2026 :
- Qwen3.8-27B, fiche modèle officielle et tableau de benchmarks (équipe Qwen, Alibaba, 14 août 2026)
- Qwen3.8-27B, dépôt officiel Alibaba Cloud (licence Apache 2.0, 14 août 2026)
- Qwen3.8-27B sur ModelScope (distribution officielle des poids)
- Qwen3.8-27B, versions quantifiées GGUF (Unsloth, tailles de fichiers par quantification)
- Trying out local AI: This is what Qwen3.8-27B can do (heise online, 16 août 2026)
- Alibaba Releases Qwen3.8-27B Under Apache 2.0 (eWeek, 17 août 2026)
