Qwen3.8-27B: un modelo de pesos abiertos de 27B que cabe en una sola GPU, y la afirmación de benchmark que no se sostiene
El equipo Qwen de Alibaba lanzó Qwen3.8-27B el 13-14 de agosto de 2026, un modelo de 27.800 millones de parámetros bajo licencia Apache 2.0 cuya versión cuantizada funciona en una sola GPU de consumo de 24 GB. Una afirmación viral dice que supera a Claude Opus 4.6 en 15 de 19 benchmarks. Esa cifra no se remonta a la tabla publicada por la propia Alibaba. El panorama real es más interesante: un modelo gratuito genuinamente capaz que todavía tiene aristas para cualquiera que no esté ya cómodo con las herramientas de LLM locales.
Qwen3.8-27B es real, gratuito y se ejecuta en local. Es un modelo denso de 27.800 millones de parámetros, con licencia Apache 2.0, lanzado por el equipo Qwen de Alibaba el 13-14 de agosto de 2026. Una versión cuantizada a 4 bits cabe en una GPU de consumo de 24 GB (de la clase RTX 3090/4090) con una longitud de contexto moderada; el contexto nativo completo de 262.144 tokens necesita muchísima más memoria.
La afirmación de que "supera a Claude Opus 4.6 en 15 de 19 pruebas" no tiene fuente primaria. Se remonta a una publicación en X, no a la ficha del modelo de la propia Alibaba. Una comparación independiente descubrió que Qwen lidera en solo 1 de 5 métricas comparadas directamente frente a Opus. Trátala como un argumento de redes sociales sin verificar.
Lo que sí es real: Qwen3.8-27B sí supera a Muse Glimmer de Meta (30B, lanzado el 10 de agosto) en varios benchmarks de programación y agénticos. Sus puntuaciones en SWE-bench Pro, OSWorld-Verified y LiveCodeBench v6 son genuinamente sólidas para un modelo de este tamaño, autorreportadas por el propio andamiaje de pruebas de Qwen.
Para el análisis de documentos en concreto: el codificador de visión nativo del modelo y su contexto largo lo hacen arquitectónicamente apto para leer PDF y artículos de investigación en local y en privado. Ningún benchmark demuestra todavía que sea bueno en ese trabajo. Es una expectativa razonable, no un resultado demostrado.
Qué se lanzó exactamente, y cuándo
El Tongyi Lab de Alibaba publicó los pesos abiertos de Qwen3.8-27B el 13-14 de agosto de 2026, una semana después de preanunciarlo junto al más grande Qwen3.8-Max. Es un modelo denso de 27.800 millones de parámetros (no una mezcla de expertos), con licencia Apache 2.0, con soporte nativo de visión y lenguaje. Eso significa que procesa imágenes y vídeo directamente en su espacio de embeddings en lugar de añadir un adaptador aparte. La arquitectura es híbrida: 64 capas construidas a partir de bloques repetidos de tres capas Gated DeltaNet (atención lineal) por cada capa Gated Attention (atención completa), aproximadamente 48 capas de atención lineal frente a 16 de atención completa, más predicción multi-token para una decodificación más rápida.
Ventana de contexto: 262.144 tokens nativos, ampliable a 1.048.576 tokens (1M) mediante escalado YaRN RoPE. Suficiente para mantener unos cientos de páginas de texto en una sola pasada, del mismo orden de magnitud que la capacidad de fuentes por cuaderno de Gemini Notebook, aunque los dos no son directamente comparables, ya que uno es un producto alojado con interfaz y el otro son pesos de modelo en bruto que ejecutas tú mismo.
Las cifras de los benchmarks, tal como las publicó Alibaba
Todas las cifras siguientes proceden de la ficha oficial del modelo en Hugging Face (Qwen/Qwen3.8-27B), contrastadas con una reproducción de terceros de la misma tabla. Son cifras autorreportadas por el propio Qwen usando su propio andamiaje de agentes. Ningún laboratorio independiente las ha reproducido todavía, y eso importa más de lo habitual aquí, porque el arnés de evaluación que uses cambia la puntuación.
Benchmark Qwen3.8-27B Claude Opus 4.6 (Max) Who leads
--------------------------------------------------------------------
Terminal-Bench 2.1 73.0 78.2 Opus
SWE-bench Pro 61.7 53.4 Qwen
OSWorld-Verified 84.3 72.7 Qwen
LiveCodeBench v6 90.3 88.8 Qwen
GPQA Diamond 89.2 91.3 Opus
IFBench 79.5 62.5 Qwen
DeepSWE 1.1 (self, v3.6→3.8) 13.3 → 42.2 n/a improvedEs un marcador genuinamente mixto: Qwen por delante en tareas de programación y de uso de ordenador, Opus por delante en conocimiento puro (GPQA Diamond) y en un benchmark agéntico de terminal. No son "15 de 19 pruebas". Esa cifra se remonta a una única publicación en X/Twitter (@hosseeb) que fue repetida por sitios agregadores hasta que pareció un hecho citable. No aparece en la ficha oficial del modelo de Qwen, y un análisis independiente aparte (ExplainX.ai) descubrió que Qwen lideraba en solo 1 de 5 métricas comparadas directamente frente a Opus. Si ves "15 de 19" repetido en otro sitio, es circular: todos citan la misma publicación sin verificar.
Dos advertencias más que conviene conocer antes de fiarte de cualquiera de estas cifras para una decisión de compra. SWE-bench Pro importa el resultado de Opus previamente publicado por Anthropic en lugar de repetirlo en condiciones idénticas, y DeepSWE, QwenSWEBench, CoWorkBench y RecreationBench son suites de benchmarks internas del propio Qwen, sin la auditabilidad pública de algo como SWE-bench o LiveCodeBench. Nada de esto hace que el modelo sea malo. Hace que la tabla de marketing sea menos fiable que el modelo en sí.
La misma semana, otros dos lanzamientos de pesos abiertos
Qwen3.8-27B no llegó en el vacío. Muse Glimmer de Meta (unos 29.600 millones de parámetros incluyendo un codificador de visión de 1.800 millones, Apache 2.0) se lanzó el 10 de agosto, diseñado específicamente para flujos de trabajo de agentes locales siempre activos mediante cuantización agresiva a 4 bits y decodificación especulativa. El propio material de Meta afirma que funciona en una GPU de 24 GB o en un Mac M4/M5 Max sin ninguna llamada de red. V4-Pro de DeepSeek alcanzó disponibilidad general el 13 de agosto: un modelo de mezcla de expertos de 1,6 billones de parámetros (unos 49.000 millones activos por token) con una ventana de contexto de 1M de tokens bajo licencia MIT. Es genuinamente de escala frontera, pero no es una historia de una sola GPU; necesita hardware multi-GPU o de nivel de centro de datos incluso con la dispersión de MoE.
El patrón en los tres casos: los modelos de pesos abiertos están cerrando la brecha con los modelos de frontera cerrados más rápido de lo que ha notado la mayoría de la gente que solo sigue los titulares de ChatGPT y Gemini. Esa es la historia real aquí, y es más útil para los lectores de este sitio que cualquier tabla de benchmarks aislada. Significa que un modelo de IA genuinamente capaz es ahora algo que puedes poseer y ejecutar, no solo alquilar.
Cómo ejecutarlo de verdad (y lo difícil que es en realidad)
Las versiones cuantizadas en GGUF aparecieron en cuestión de horas tras el lanzamiento en llama.cpp, LM Studio y Ollama. lmstudio-community/Qwen3.8-27B-GGUF y unsloth/Qwen3.8-27B-GGUF en Hugging Face son las que hay que buscar; verifica que cualquier listado de Ollama que encuentres sea el oficial antes de descargarlo, ya que en los primeros días aparecieron subidas de la comunidad con nombres ligeramente distintos. En principio: instala LM Studio, busca "Qwen3.8-27B", descarga una versión cuantizada Q4_K_M (unos 16 GB), cárgala, chatea.
En la práctica, los primeros usuarios en Hacker News se toparon con fricciones reales que un principiante no esperaría tener que resolver solo. El modo de razonamiento por defecto ("xhigh") consume una cantidad inusualmente grande de tokens y produce texto degradado y gramaticalmente empobrecido en sus rastros de pensamiento. Varios usuarios tuvieron que bajar manualmente el esfuerzo de razonamiento a "medium" y sustituir las plantillas de chat por otras mantenidas por la comunidad para arreglar la llamada a herramientas y conseguir un comportamiento sensato de la caché KV. Un usuario informó de que solo la caché KV con contexto de 32K consumía 2,5 GB de VRAM, notablemente menos eficiente que modelos comparables como Gemma 4 o Muse Glimmer, y no conseguía que cupiera un contexto de 128K ni con cuantización a 4 bits en una máquina bien equipada. Planteamiento justo: apto para entusiastas, todavía no es plug-and-play. Si nunca has ejecutado un modelo local, calcula una tarde de configuración, no cinco minutos.
La comprobación de la realidad del hardware
Format Size on disk Practical fit
-----------------------------------------------
BF16 (full) 51.8 GB 80GB-class GPU or multi-GPU
FP8 28.8 GB 48GB card, reduced context
Q6_K GGUF 21.3 GB 32GB+ GPU
Q4_K_M GGUF 15.9 GB 24GB consumer GPU, moderate context only"Funciona en una sola GPU de consumo" es cierto con contexto de corto a moderado. Empuja hacia la ventana completa de 262K tokens y solo la caché KV puede exigir otros 60-80 GB. Llegados a ese punto, ya no lo estás ejecutando en un PC gaming, sean pesos cuantizados o no.
Qué significa esto para el análisis privado de documentos
Esta es la parte que de verdad va a interesar a los lectores de este sitio, y merece una matización honesta en lugar de un párrafo de bombo. El codificador de visión nativo y el contexto largo de Qwen3.8-27B lo hacen arquitectónicamente muy adecuado para leer PDF con gráficos y diagramas, resumir artículos de investigación, y responder preguntas sobre un conjunto de documentos grande completamente sin conexión: sin subir nada, sin suscripción, sin que ningún proveedor en la nube vea tu material fuente. Es una postura de privacidad genuinamente distinta a la de cualquier herramienta alojada en la nube, Gemini Notebook incluido.
Pero todavía no hay ningún benchmark publicado ni ningún flujo de trabajo de usuario documentado que demuestre específicamente que Qwen3.8-27B sea bueno en RAG de documentos o en resumir artículos. El modelo tiene unos dos días de vida en el momento de escribir esto. La guía general sobre LLM locales (no específica de este modelo) sí respalda una elección práctica: para documentos que caben dentro de la ventana de contexto, mete todo el documento en una sola pasada en lugar de trocearlo, ya que el troceado combinado con recuperación basada en embeddings pierde el contexto entre fragmentos que una sola pasada de contexto largo mantiene intacto. Reserva el troceado para documentos que de verdad superan el límite de contexto del modelo.
Si tu necesidad real es "resume este PDF y déjame hacer preguntas de seguimiento", y no quieres pasarte una tarde configurando cuantización y plantillas de chat, Gemini Notebook sigue siendo el camino más rápido. Hace el mismo trabajo sin ninguna configuración local, a costa de que tus documentos salgan de tu máquina. Qwen3.8-27B es la herramienta adecuada cuando la privacidad de no subir nada importa más que la comodidad, o cuando estás procesando algo que no tienes permitido enviar a ningún tercero.
Cuándo esta no es la herramienta adecuada
- No tienes una GPU con al menos 24 GB de VRAM. Un MacBook Air o un portátil con GPU integrada no ejecutará esto a una velocidad utilizable; en ese caso te convendría un modelo más pequeño.
- Quieres algo que funcione en cinco minutos. Los ajustes por defecto necesitan retocarse (esfuerzo de razonamiento, plantilla de chat) antes de que el modelo se comporte de forma sensata. Todavía no es una experiencia de un solo clic.
- Necesitas el contexto completo de 262K tokens con regularidad. El coste de memoria de la caché KV con contexto largo se dispara muy por encima de lo que puede sostener una sola GPU de consumo, lo que socava el argumento de "funciona en una sola GPU" justo en la longitud donde más importaría para un corpus completo de artículos de investigación.
- Necesitas hoy mismo una precisión a prueba de fallos para una tarea sensible a las citas. Ningún laboratorio independiente ha reproducido todavía las cifras de benchmark de Qwen; trata el modelo como prometedor pero sin verificar para cualquier cosa donde equivocarse tenga consecuencias reales.
¿Supera Qwen3.8-27B realmente a Claude Opus 4.6?
En algunos benchmarks, sí: SWE-bench Pro, OSWorld-Verified y LiveCodeBench v6 favorecen a Qwen en las cifras publicadas por la propia Alibaba. En otros, Opus lidera (Terminal-Bench 2.1, GPQA Diamond). La cifra ampliamente repetida de que "supera a Opus en 15 de 19 pruebas" no aparece en la ficha oficial del modelo de Qwen y se remonta a una publicación en redes sociales sin verificar. No la trates como un hecho.
¿Qué GPU necesito para ejecutar Qwen3.8-27B?
Una versión cuantizada a 4 bits (Q4_K_M, unos 16 GB) cabe en una GPU de consumo de 24 GB como una RTX 3090 o 4090 con longitud de contexto moderada. Los pesos completos en BF16 pesan 51,8 GB y necesitan una tarjeta de clase 80 GB o varias GPU. El contexto largo (más allá de unos 32-64K tokens) dispara las necesidades de memoria muy por encima de lo que sostiene una sola GPU de consumo, incluso con baja precisión.
¿Es Qwen3.8-27B gratuito para uso comercial?
Sí. Se publica bajo la licencia Apache 2.0, que permite el uso comercial, la modificación y la redistribución, a diferencia de algunos modelos de pesos abiertos que restringen el despliegue comercial.
¿Puedo usar Qwen3.8-27B en lugar de Gemini Notebook para investigar?
No como sustituto directo. Gemini Notebook es un producto alojado con gestión de fuentes, citas, Resúmenes en audio y una interfaz web construida para flujos de investigación desde el primer momento. Qwen3.8-27B son pesos de modelo en bruto: tendrías que construir tú mismo la carga de documentos, el troceado y la interfaz, o usar una herramienta envoltorio como el chat de documentos de LM Studio. Es la opción correcta cuando mantener los documentos fuera de cualquier servidor en la nube importa más que la comodidad.
Exporta tu NotebookLM con un clic
Extensión de Chrome gratuita. PDF, Word y Markdown. Generado en tu equipo — nada se sube a la nube.