Qwen3.8-27B : un modèle ouvert de 27 milliards de paramètres qui tient sur un seul GPU, et l'affirmation de benchmark qui ne tient pas la route
L'équipe Qwen d'Alibaba a publié Qwen3.8-27B les 13 et 14 août 2026, un modèle dense de 27,8 milliards de paramètres sous licence Apache 2.0, dont une version quantifiée tourne sur un seul GPU grand public de 24 Go. Une affirmation devenue virale prétend qu'il surpasse Claude Opus 4.6 sur 15 des 19 benchmarks. Ce chiffre ne provient pas du tableau officiel publié par Alibaba. La réalité est plus intéressante : un modèle gratuit réellement capable, mais encore rugueux sur les bords pour qui n'est pas déjà à l'aise avec les outils de LLM local.
Qwen3.8-27B est réel, gratuit, et tourne en local. C'est un modèle dense de 27,8 milliards de paramètres, sous licence Apache 2.0, publié par l'équipe Qwen d'Alibaba les 13 et 14 août 2026. Une version quantifiée en 4 bits tient sur un GPU grand public de 24 Go (classe RTX 3090/4090) à une longueur de contexte modérée ; le contexte natif complet de 262 144 tokens demande bien plus de mémoire.
L'affirmation « bat Claude Opus 4.6 sur 15 des 19 tests » n'a pas de source primaire. Elle remonte à un post X, pas à la fiche modèle d'Alibaba elle-même. Une comparaison indépendante a constaté que Qwen n'est en tête que sur 1 des 5 métriques comparées face à Opus. Traitez-la comme un argument de réseaux sociaux non vérifié.
Ce qui est réel : Qwen3.8-27B bat effectivement Muse Glimmer de Meta (30B, publié le 10 août) sur plusieurs benchmarks d'agentivité et de codage. Ses scores SWE-bench Pro, OSWorld-Verified et LiveCodeBench v6 sont réellement solides pour un modèle de cette taille, autodéclarés par le propre dispositif de test de Qwen.
Pour l'analyse de documents spécifiquement : l'encodeur de vision natif du modèle et son long contexte le rendent architecturalement adapté à la lecture de PDF avec graphiques, à la synthèse d'articles de recherche et aux questions posées localement et en privé. Aucun benchmark ne prouve encore qu'il excelle à cette tâche. C'est une attente raisonnable, pas un résultat démontré.
Ce qui a réellement été déployé, et quand
Le Tongyi Lab d'Alibaba a publié les poids ouverts de Qwen3.8-27B les 13 et 14 août 2026, une semaine après l'avoir pré-annoncé aux côtés du plus grand Qwen3.8-Max. C'est un modèle dense de 27,8 milliards de paramètres (pas un mélange d'experts), sous licence Apache 2.0, avec un support vision-langage natif. Cela signifie qu'il traite les images et la vidéo directement dans son espace d'embedding plutôt que d'y greffer un adaptateur séparé. L'architecture est hybride : 64 couches construites à partir de blocs répétés de trois couches Gated DeltaNet (attention linéaire) pour une couche Gated Attention (attention complète), soit environ 48 couches à attention linéaire contre 16 à attention complète, plus une prédiction multi-token pour un décodage plus rapide.
Fenêtre de contexte : 262 144 tokens natifs, extensible à 1 048 576 tokens (1M) via le scaling YaRN RoPE. C'est assez long pour tenir quelques centaines de pages de texte en un seul passage, du même ordre de grandeur que la capacité de sources par notebook de Gemini Notebook, bien que les deux ne soient pas directement comparables puisque l'un est un produit hébergé avec une interface et l'autre des poids de modèle bruts que vous faites tourner vous-même.
Les chiffres de benchmark, tels qu'Alibaba les a réellement publiés
Chaque chiffre ci-dessous provient de la fiche modèle officielle sur Hugging Face (Qwen/Qwen3.8-27B), recoupée avec une reproduction tierce du même tableau. Ce sont les chiffres autodéclarés de Qwen, obtenus avec son propre dispositif d'agent. Aucun laboratoire indépendant ne les a encore reproduits, et cela compte plus que d'habitude ici, car le harnais d'évaluation utilisé change le score.
Benchmark Qwen3.8-27B Claude Opus 4.6 (Max) Who leads
--------------------------------------------------------------------
Terminal-Bench 2.1 73.0 78.2 Opus
SWE-bench Pro 61.7 53.4 Qwen
OSWorld-Verified 84.3 72.7 Qwen
LiveCodeBench v6 90.3 88.8 Qwen
GPQA Diamond 89.2 91.3 Opus
IFBench 79.5 62.5 Qwen
DeepSWE 1.1 (self, v3.6→3.8) 13.3 → 42.2 n/a improvedC'est un tableau de résultats réellement mitigé : Qwen en tête sur le codage et les tâches d'utilisation d'ordinateur, Opus en tête sur la pure connaissance (GPQA Diamond) et un benchmark de terminal agentique. Ce n'est pas « 15 tests sur 19 ». Ce chiffre remonte à un seul post X/Twitter (@hosseeb) qui a été repris par des sites agrégateurs jusqu'à ressembler à un fait citable. Il n'apparaît pas sur la fiche modèle officielle de Qwen, et un article indépendant distinct (ExplainX.ai) a constaté que Qwen n'est en tête que sur 1 des 5 métriques comparées directement à Opus. Si vous voyez « 15 sur 19 » répété ailleurs, c'est circulaire : tout le monde cite le même post non vérifié.
Deux autres réserves à connaître avant de faire confiance à ces chiffres pour une décision d'achat. SWE-bench Pro reprend le résultat d'Opus précédemment publié par Anthropic plutôt que de le refaire tourner dans des conditions identiques, et DeepSWE, QwenSWEBench, CoWorkBench et RecreationBench sont les suites de benchmarks maison de Qwen, sans l'auditabilité publique d'un SWE-bench ou d'un LiveCodeBench. Rien de tout cela ne rend le modèle mauvais. Cela rend le tableau marketing moins fiable que le modèle lui-même.
La même semaine, deux autres publications à poids ouverts
Qwen3.8-27B n'est pas arrivé isolément. Muse Glimmer de Meta (environ 29,6 milliards de paramètres, dont un encodeur de vision de 1,8 milliard, Apache 2.0) est sorti le 10 août, spécialement conçu pour des flux de travail d'agents locaux permanents via une quantification agressive en 4 bits et un décodage spéculatif. Les propres documents de Meta affirment qu'il tourne sur un seul GPU de 24 Go ou un Mac M4/M5 Max sans aucun appel réseau. V4-Pro de DeepSeek a atteint la disponibilité générale le 13 août : un modèle à mélange d'experts de 1 600 milliards de paramètres (environ 49 milliards actifs par token) avec une fenêtre de contexte d'1M de tokens sous licence MIT. C'est réellement à l'échelle de la frontière, mais pas une histoire de GPU unique ; il nécessite du matériel multi-GPU ou de classe datacenter même avec la parcimonie du MoE.
Le schéma commun aux trois : les modèles à poids ouverts comblent l'écart avec les modèles fermés de pointe plus vite que ne l'ont remarqué la plupart des gens qui ne suivent que les gros titres de ChatGPT et Gemini. C'est la vraie histoire ici, et elle est plus utile aux lecteurs de ce site que n'importe quel tableau de benchmark isolé. Cela signifie qu'un modèle d'IA réellement capable est désormais quelque chose que vous pouvez posséder et faire tourner, pas seulement louer.
Comment le faire tourner concrètement (et à quel point c'est vraiment difficile)
Des versions GGUF quantifiées sont apparues quelques heures après la sortie sur llama.cpp, LM Studio et Ollama. lmstudio-community/Qwen3.8-27B-GGUF et unsloth/Qwen3.8-27B-GGUF sur Hugging Face sont celles à privilégier ; vérifiez que toute fiche Ollama trouvée est bien l'officielle avant de la télécharger, car des versions communautaires sous des noms légèrement différents sont apparues dès les premiers jours. En théorie : installez LM Studio, cherchez « Qwen3.8-27B », téléchargez une version quantifiée Q4_K_M (environ 16 Go), chargez-la, discutez.
En pratique, les premiers utilisateurs sur Hacker News ont rencontré de vrais frottements qu'un débutant ne s'attendrait pas à devoir résoudre seul. Le mode de raisonnement par défaut (« xhigh ») consomme un nombre inhabituellement élevé de tokens et produit un texte dégradé, grammaticalement appauvri dans ses traces de réflexion. Plusieurs utilisateurs ont dû réduire manuellement l'effort de raisonnement à « medium » et remplacer les modèles de chat par des versions maintenues par la communauté pour corriger l'appel d'outils et obtenir un comportement de cache KV sain. Un utilisateur a rapporté que le cache KV en contexte 32K consommait à lui seul 2,5 Go de VRAM, nettement moins efficace que des modèles comparables comme Gemma 4 ou Muse Glimmer, et n'a pas pu faire tenir un contexte de 128K même en quantification 4 bits sur une machine bien équipée. Description honnête : adapté aux passionnés, pas encore plug-and-play. Si vous n'avez jamais fait tourner de modèle local, prévoyez un après-midi de configuration, pas cinq minutes.
Vérification de la réalité matérielle
Format Size on disk Practical fit
-----------------------------------------------
BF16 (full) 51.8 GB 80GB-class GPU or multi-GPU
FP8 28.8 GB 48GB card, reduced context
Q6_K GGUF 21.3 GB 32GB+ GPU
Q4_K_M GGUF 15.9 GB 24GB consumer GPU, moderate context only« Tourne sur un seul GPU grand public » est vrai à contexte court à modéré. Poussez vers la fenêtre complète de 262K tokens et le cache KV seul peut réclamer 60 à 80 Go supplémentaires. À ce stade, vous ne faites plus tourner cela sur un PC de jeu, quantification ou non.
Ce que cela signifie pour l'analyse de documents privée
C'est la partie qui intéressera réellement les lecteurs de ce site, et elle mérite une réserve honnête plutôt qu'un paragraphe promotionnel. L'encodeur de vision natif et le long contexte de Qwen3.8-27B le rendent architecturalement bien adapté à la lecture de PDF avec graphiques et diagrammes, à la synthèse d'articles de recherche, et aux questions posées sur un large ensemble de documents entièrement hors ligne : pas de téléversement, pas d'abonnement, aucun fournisseur cloud ne voit votre matériel source. C'est une posture de confidentialité réellement différente de n'importe quel outil hébergé dans le cloud, Gemini Notebook y compris.
Mais il n'existe encore aucun benchmark publié ni de flux de travail utilisateur documenté prouvant spécifiquement que Qwen3.8-27B excelle en RAG documentaire ou en synthèse d'articles. Le modèle a environ deux jours au moment de la rédaction. Les recommandations générales sur les LLM locaux (non spécifiques à ce modèle) soutiennent tout de même un choix pratique : pour les documents qui tiennent dans la fenêtre de contexte, injectez le tout en un seul passage plutôt que de le découper, car le découpage associé à une récupération par embeddings perd le contexte inter-segments qu'un seul passage long préserve. Réservez le découpage aux documents qui dépassent réellement la limite de contexte du modèle.
Si votre besoin réel est « résumer ce PDF et pouvoir poser des questions complémentaires », et que vous ne voulez pas passer un après-midi à configurer quantification et modèles de chat, Gemini Notebook reste la voie la plus rapide. Il fait le même travail sans aucune configuration locale, au prix de voir vos documents quitter votre machine. Qwen3.8-27B est le bon outil quand la confidentialité de ne rien téléverser compte plus que la commodité, ou quand vous traitez quelque chose que vous n'avez pas le droit d'envoyer à un tiers du tout.
Quand ce n'est pas le bon outil
- Vous ne possédez pas de GPU avec au moins 24 Go de VRAM. Un MacBook Air ou un portable avec GPU intégré ne le fera pas tourner à une vitesse utilisable ; il faudrait plutôt viser un modèle plus petit.
- Vous voulez quelque chose qui fonctionne en cinq minutes. Les réglages par défaut nécessitent des ajustements (effort de raisonnement, modèle de chat) avant que le modèle se comporte de façon sensée. Ce n'est pas encore une expérience en un clic.
- Vous avez régulièrement besoin des 262K tokens de contexte complets. Le coût mémoire du cache KV à long contexte dépasse largement ce qu'un seul GPU grand public peut contenir, ce qui compromet l'argument « tourne sur un seul GPU » précisément à la longueur où cela compterait le plus pour un corpus complet d'articles de recherche.
- Vous avez besoin d'une précision irréprochable pour une tâche sensible aux citations dès aujourd'hui. Aucun laboratoire indépendant n'a encore reproduit les chiffres de benchmark de Qwen ; considérez le modèle comme prometteur mais non vérifié pour tout ce où se tromper a de vraies conséquences.
Qwen3.8-27B bat-il réellement Claude Opus 4.6 ?
Sur certains benchmarks, oui : SWE-bench Pro, OSWorld-Verified et LiveCodeBench v6 favorisent tous Qwen dans les chiffres publiés par Alibaba elle-même. Sur d'autres, Opus est en tête (Terminal-Bench 2.1, GPQA Diamond). Le chiffre largement repris « bat Opus sur 15 des 19 tests » n'apparaît pas sur la fiche modèle officielle de Qwen et remonte à un post de réseau social non vérifié. Ne le prenez pas pour un fait.
Quel GPU faut-il pour faire tourner Qwen3.8-27B ?
Une version quantifiée en 4 bits (Q4_K_M, environ 16 Go) tient sur un GPU grand public de 24 Go comme une RTX 3090 ou 4090 à une longueur de contexte modérée. Les poids BF16 complets pèsent 51,8 Go et nécessitent une carte de classe 80 Go ou plusieurs GPU. Un long contexte (au-delà d'environ 32-64K tokens) fait grimper les besoins en mémoire bien au-delà de ce qu'un seul GPU grand public peut contenir, même à faible précision.
Qwen3.8-27B est-il gratuit pour un usage commercial ?
Oui. Il est publié sous licence Apache 2.0, qui autorise l'usage commercial, la modification et la redistribution, contrairement à certains modèles à poids ouverts qui restreignent le déploiement commercial.
Puis-je utiliser Qwen3.8-27B à la place de Gemini Notebook pour la recherche ?
Pas comme un remplacement direct. Gemini Notebook est un produit hébergé avec gestion des sources, citations, Audio Overviews et une interface web conçue pour les flux de travail de recherche prête à l'emploi. Qwen3.8-27B, ce sont des poids de modèle bruts : il faudrait construire soi-même le chargement de documents, le découpage et l'interface, ou utiliser un outil enveloppant comme le chat documentaire de LM Studio. C'est le bon choix quand garder les documents hors de tout serveur cloud compte plus que la commodité.
Exportez votre NotebookLM en un clic
Extension Chrome gratuite. PDF, Word et Markdown. Généré sur votre machine — rien n'est envoyé en ligne.