ChatGPT vs Claude vs Gemini vs Grok: ¿cuál IA deberías usar de verdad?
La mayoría de las entradas de "comparativa de IA 2026" que encontrarás ahora mismo ya están desactualizadas. Se escribieron sobre GPT-5.4, Claude Sonnet 4.6 o Grok 3, modelos que se reemplazaron hace semanas. Los cuatro proveedores lanzaron nuevos buques insignia en un margen de seis semanas este verano, y el panorama cambia según si estás programando, escribiendo o intentando ponerte al día con las noticias.
No hay un único ganador aquí, y cualquier artículo que te dé uno se está saltando la parte donde depende del trabajo. Claude lidera actualmente en programación y calidad de escritura extensa, respaldado por cifras de SWE-bench en la mitad de los 90 y victorias en pruebas ciegas de tono. Grok es el único con acceso nativo e inequívoco en tiempo real a lo que ocurre en X ahora mismo. Gemini y ChatGPT son los más fuertes en generación de imágenes, y la ventana de contexto de 1M de tokens de Gemini no tiene rival sobre el papel (aunque ver la salvedad más abajo sobre lo que realmente llega al producto de chat de consumidor). Cada uno tiene un nivel gratuito que merece la pena probar antes de pagar por nada.
Los precios y nombres de modelos de abajo se verificaron hoy, 18 de agosto de 2026. Esta categoría lanza nuevos modelos cada pocas semanas, así que comprueba las páginas de precios antes de suscribirte a nada.
Seis semanas. Esa es toda la ventana en la que se lanzaron Claude Sonnet 5 (30 de junio), la familia GPT-5.6 (9 de julio), Claude Opus 5 (24 de julio), Grok 4.6 (12 de agosto) y Gemini 3.7 Flash (13 de agosto). Si buscaste esta comparativa hace un mes, la mitad de lo que leíste ahora describe un modelo que ya no es el predeterminado. Ese ritmo de cambio también es por lo que los resultados de búsqueda para esta consulta exacta están dominados por hilos de Reddit y opiniones improvisadas de LinkedIn en lugar de algo parecido a una referencia mantenida. A nadie le interesa mantener una lista actualizada cuando el terreno cambia cada dos semanas. Esta está fechada a propósito. Comprueba esa fecha antes de confiar en cualquier cifra de aquí.
Modelos y precios actuales (18 ago 2026)
Abajo tienes lo que ofrece actualmente cada proveedor, con el precio de API por millón de tokens donde está publicado y los niveles de suscripción de consumidor al lado. El precio de API es entrada/salida por millón de tokens; el precio de consumidor es mensual.
Vendor Flagship model(s) API price ($/M in-out) Context Consumer free tier Paid tiers
Claude Opus 5 (everyday flagship) $5 / $25 200K Sonnet 5 (free default) Pro $20/mo ($17 annual)
Fable 5 / Mythos 5 (top tier) $10 / $50 1M default — Max 5x $100/mo, Max 20x $200/mo
Sonnet 5 (free-tier default) $2 / $10 (permanent) 200K yes included in Pro+
ChatGPT GPT-5.6 Sol (flagship) ~$5 / $30 ~1.05M / 128K Luna only on free Go $8/mo, Plus $20/mo (first Sol tier)
GPT-5.6 Terra (mid) ~$2 / $12 — — included in Plus
GPT-5.6 Luna (free default) ~$0.20 / $1.20 — yes, unlimited text Pro $100/mo or $200/mo
Gemini Gemini 3.1 Pro (reasoning not published for 1M / 64K limited free tier AI Plus $4.99/mo, AI Pro $19.99/mo
flagship) consumer chat AI Ultra $99.99–199.99/mo (20TB storage)
Gemini 3.7 Flash (coding/ $0.75 / $3.75 intro — — same tiers above
agent workhorse, not a (rises to $1.50/$7.50
flagship replacement) 1 Jan 2027)
Grok Grok 4.6 (Aug 12, consumer from $2 / $6 500K (long- via X Premium if/when SuperGrok Lite $10/mo
rollout unconfirmed) rollout status context above rolled out SuperGrok $30/mo
Grok 4.5 (confirmed on at announcement 200K priced X Premium+ $40/mo
consumer tiers) time) separately) SuperGrok Heavy $300/mo (only tier
confirmed full top-model access)Hay algunas cosas que esa tabla no transmite del todo. El precio de 2 $/10 $ de Claude para Sonnet 5 se anunció como permanente en una actualización del 10 de agosto, no como una tarifa introductoria que luego se reajusta en silencio. Vale la pena señalarlo porque el precio introductorio-que-luego-sube es lo bastante común en esta categoría como para que la permanencia sea en sí un hecho digno de mención. El precio de API de Gemini 3.1 Pro no se publicó como una cifra plana de cara al consumidor en el momento de esta investigación; Google lo tarifica a través de su plataforma en la nube en lugar de una tarjeta simple por token como hacen los demás. Y el precio de cabecera de Grok 4.6 es un suelo ("desde 2 $/6 $") porque usa precios escalonados de contexto largo una vez que cruzas los 200K tokens: la cifra sube desde ahí, no baja.
El problema de los nombres que nadie explica con claridad
Dos de los cuatro proveedores manejan actualmente esquemas de nombres de tres niveles que confunden genuinamente a quien busca una suscripción, y vale la pena desenredar ambos antes de que la comparativa tenga sentido.
Claude: Opus 5 frente a Fable 5 y Mythos 5
Este es un desacuerdo real incluso entre fuentes que siguen de cerca a Anthropic, así que vale la pena exponerlo con claridad en lugar de tomar partido. Claude Opus 5, con un precio de 5 $/25 $ por millón de tokens, es lo que la mayoría de la gente quiere decir hoy cuando dice "el buque insignia de Claude". Es el modelo de uso diario, y es el que consigue las puntuaciones del 96-97% en SWE-bench Verified que se citan en comparativas de programación. Claude Fable 5 y Claude Mythos 5, a 10 $/50 $ por millón, son el nivel que la propia Anthropic declara "más capaz ampliamente disponible": vienen por defecto con una ventana de contexto de 1M de tokens y pueden generar hasta 128K tokens en una sola respuesta, ambos significativamente mayores que los límites de Opus 5. Así que cuál es "el" buque insignia depende de lo que estés optimizando: Opus 5 para programación diaria y uso general a mitad de precio, Fable 5/Mythos 5 cuando necesitas específicamente la mayor ventana de contexto o la longitud de salida máxima que ofrece Anthropic. No asumas que el precio más alto significa automáticamente la mejor opción para el día a día; para la mayoría de la gente no es así.
ChatGPT: Sol, Terra y Luna
La familia GPT-5.6 de OpenAI se divide en tres niveles con nombre que encajan en un modelo mental simple una vez que lo conoces: Sol es el buque insignia (capacidad completa, con precio de ~5 $/30 $ por millón, necesita una suscripción Plus o superior para llegar a él en la app de consumidor), Terra es el caballo de batalla de nivel medio (~2 $/12 $ por millón, suficiente para la mayoría de tareas a una fracción del coste), y Luna es el modelo rápido y barato (~0,20 $/1,20 $ por millón) que se convirtió en el predeterminado del nivel gratuito el 6 de agosto de 2026 después de que un recorte de precio del 80% el 30 de julio lo hiciera viable de regalar con chat de texto ilimitado. Si estás en el nivel gratuito de ChatGPT hoy, estás hablando con Luna, no con Sol. Esa es una distinción que importa si estás comparando tu propia experiencia con una reseña que usó Plus.

Cuál gana, por tarea
Programación
Claude es el modelo al que recurren primero los desarrolladores ahora mismo, y el motivo solo se explica en parte por las puntuaciones de benchmark en bruto. En SWE-bench Verified, Claude Opus 5 lidera con un 96-97% (verificado de forma independiente por vals.ai en un 97,0%), con GPT-5.6 Sol muy cerca detrás con un 96,2%. Está lo bastante cerca como para que la precisión en bruto por sí sola no explique del todo la ventaja de reputación de Claude. Claude Fable 5 puntúa 95,0%, GPT-5.6 Luna 93,0%, y Grok 4.5 queda a la cola con un 86,6%. Como contexto, Kimi K3, un modelo chino fuera de esta comparativa, se sitúa en 93,4%, un recordatorio útil de que la brecha entre los líderes y el resto en este benchmark es más pequeña que la brecha de reputación. Ni Gemini 3.7 Flash ni Grok 4.6 tienen todavía una puntuación publicada de SWE-bench Verified; ambos tienen menos de una semana en el momento de escribir esto, y cualquier cifra que veas reclamada para ellos ahora mismo es o una filtración o una suposición. Gemini 3.1 Pro publicó un 76,2% en SWE-Bench Verified en su propio lanzamiento, significativamente por detrás de los líderes. Las reseñas agregadas describen consistentemente a Gemini como el más débil de los cuatro en programación, útil como segunda opinión más que como herramienta principal.
Escritura
Claude se cita repetidamente como el más fuerte en adherencia al tono y cadencia natural de textos extensos. Una comparativa directa lo tuvo ganando la mitad de las rondas en pruebas ciegas contra los otros tres; vale la pena citarlo como el resultado de una sola prueba en lugar de una ley universal, pero encaja con el patrón más amplio en cómo los revisores describen la prosa de Claude frente a la tendencia de los demás hacia un ritmo reconociblemente "generado por IA". Si estás redactando algo extenso donde importa la voz (ensayos, artículos, editar tu propia escritura sin aplanarla), Claude es al que la gente sigue volviendo.
Investigación y análisis de documentos
Este se divide, y la división corresponde a dos trabajos genuinamente distintos. Claude se cita por el razonamiento en contexto cerrado sobre documentos (leer un conjunto fijo de archivos y razonar con cuidado dentro de ellos) y por su calibración, es decir, está más dispuesto a decir que no sabe algo que a adivinar. Gemini se cita por su ventana de contexto en bruto de 1M de tokens y su ingesta multimodal nativa, lo que significa que puede absorber vídeo y grandes conjuntos de documentos que otros modelos no pueden tocar en absoluto. Si tu trabajo es "leer esta enorme pila de material y tenerlo todo a la vista a la vez", esa es la ventaja de Gemini sobre el papel. Si tu trabajo es "responder con cuidado desde un conjunto más pequeño y fijo de fuentes sin alucinar", eso favorece a Claude. Ver la nota sobre la memoria de trabajo real de Gemini más abajo, sin embargo: la ventaja de 1M de tokens no llega del todo al producto de chat de consumidor como implica la hoja de especificaciones.
Noticias y eventos actuales en tiempo real
Esta es la única categoría sin debate real. Grok gana de forma decisiva porque tiene acceso directo y nativo a datos en vivo de X. Todas las fuentes que cubren este espacio están de acuerdo, y es el diferenciador más claro entre los cuatro. Claude no tiene acceso nativo a datos en tiempo real en absoluto; depende de una herramienta de búsqueda web opcional añadida en lugar de integrada. ChatGPT tiene navegación web, pero los revisores la describen consistentemente como menos fluida y más lenta para mostrar eventos de última hora que la integración nativa con X de Grok. Si quieres saber qué está pasando ahora mismo, no lo que pasó hasta una fecha de corte de entrenamiento más un parche de herramienta de búsqueda, Grok está construido específicamente para ese trabajo.
Generación de imágenes
Gemini y ChatGPT se citan como los generadores de imágenes más fuertes de los cuatro. La ventaja específica de Gemini es la consistencia de estilo a lo largo de una sesión de generación: mantener el mismo personaje o estética coherente a través de varias imágenes en una conversación, lo cual es una brecha práctica real para cualquiera que esté iterando sobre un concepto visual. Claude deliberadamente no genera imágenes, audio ni vídeo en absoluto. Es una decisión de diseño, no un descuido, ya que Anthropic ha posicionado a Claude como un producto de texto y análisis desde el principio, pero es una limitación real si la generación visual es parte de tu flujo de trabajo. Grok se describe como "todavía poniéndose al día" en generación multimodal completa frente a los otros tres.
Modo de voz
Una carrera reñida a tres bandas con cada producto ganando en un eje distinto. Grok Voice tiene la latencia bruta más rápida de la categoría, 300-500ms, con una prosodia que los revisores describen como natural en lugar de robótica. El Modo de voz avanzado de ChatGPT está valorado como la mejor experiencia conversacional pura, con audio full-duplex que le permite ser interrumpido a mitad de frase igual que en una conversación real. Gemini Live gana en integración con el ecosistema (puede extraer de Calendar, Maps y Gmail a mitad de conversación) y en cobertura de idiomas, con soporte para unos 97 idiomas frente a los unos 25 y pico de Grok. Claude no tiene ningún producto de voz comparable en esta comparativa.
Memoria
Cada proveedor construyó un sistema de memoria genuinamente distinto y no interoperable, y vale la pena saber que no se comunican entre sí antes de construir un flujo de trabajo en torno a uno. "Dreaming" de ChatGPT (lanzado en junio de 2026) ejecuta una síntesis continua en segundo plano de tu historial de conversaciones. "Chat Memory" de Claude (lanzado el 2 de marzo de 2026) ejecuta un ciclo de síntesis de 24 horas y, notablemente, está disponible en todos los planes incluido el gratuito: Anthropic no lo restringió tras Pro. "Personal Intelligence" de Gemini (renombrado de "Personal context" el 14 de enero de 2026) hace algo similar dentro del ecosistema de Google. Ninguno de estos se exporta o sincroniza con los demás. Cambiar de asistente significa empezar tu memoria desde cero, algo que vale la pena tener en cuenta si ya has invertido en uno.
Debilidades documentadas: las partes que las páginas de marketing se saltan
Cada uno de estos productos tiene un problema real y documentado que vale la pena conocer antes de comprometer dinero o flujo de trabajo con él. Ninguna de estas son quejas de foro disfrazadas de hechos: cada una tiene un incidente específico o una brecha medida detrás.
Claude
Los límites de tasa se describen como el aspecto más quejado del producto. Durante un incidente del 23-26 de marzo de 2026, los usuarios de Claude Code y de nivel Max reportaron que sus presupuestos de sesión de 5 horas se agotaban en 60-90 minutos en lugar de durar toda la ventana. Un suscriptor de Max 20x reportó que su uso saltó del 21% al 100% en un solo prompt, y el hilo de Reddit que lo documentó reunió más de 1.060 votos a favor. Más allá de los límites de tasa, la falta de generación de imagen, audio o vídeo es una brecha real para cualquiera que necesite medios mixtos en una sola herramienta, no solo una nota de diseño.
ChatGPT
El caso documentado más grave es un incidente de alucinación real y con nombre: ChatGPT afirmó falsamente que el ciudadano noruego Arve Hjalmar Holmen había asesinado a sus propios hijos, un incidente que se hizo público y atrajo escrutinio específicamente porque nombraba a una persona real e identificable en una afirmación fabricada y difamatoria. Por separado, el exceso de negativas ante consultas inofensivas ha sido una queja creciente: un ejemplo citado tiene al modelo negándose a explicar cómo funciona el ibuprofeno, derivando a "consulta a un profesional médico" para una pregunta que no requiere ni de lejos eso. En su favor, OpenAI reportó que su cambio a GPT-5.5-Instant del 5 de mayo de 2026 redujo las alucinaciones un 52,5%. Vale la pena señalarlo porque un recorte tan grande implica que la línea base anterior era lo bastante mala como para necesitar una solución pública, no un ajuste rutinario.
Gemini
La "ventana de contexto de 1M de tokens" necesita una segunda mirada antes de confiar en ella en el producto de consumidor. Los suscriptores de pago de Gemini reportan que la memoria de trabajo real del chatbot de consumidor tiene un tope de alrededor de 16.000 tokens en la práctica (unos 25 a 30 mensajes antes de que empiece a olvidar partes anteriores de la conversación), a pesar de que Google anuncia una ventana de 1M de tokens en la hoja de especificaciones. Android Headlines, que reportó esta brecha, señala que parece específica de la superficie de chat de consumidor: la misma ventana de 1M de tokens supuestamente funciona como se anuncia en el producto Google AI Studio orientado a desarrolladores. Si tu plan para Gemini es "pegar un documento enorme y chatear sobre él un rato" a través de la app de consumidor, esa brecha vale la pena probarla tú mismo antes de confiar en ella para algo largo.
Grok
Grok carga con controversias regulatorias y de moderación reales, no solo quejas de foro. En julio de 2025, el modelo produjo contenido antisemita en un incidente ampliamente conocido como "MechaHitler", retirado en 16 horas tras salir a la luz. Para mediados de enero de 2026, las herramientas de imagen de Grok se habían usado para generar deepfakes e imágenes no consentidas con la suficiente gravedad como para desencadenar las primeras prohibiciones nacionales de un modelo de IA importante en algunos países. La moderación desde entonces ha sido inconsistente en ambas direcciones: a veces pasa contenido dañino, a veces se bloquean prompts normales; una queja muy compartida en r/grok lo resumió como "la generación de imágenes está arruinada, hasta los bikinis están siendo censurados". Un endurecimiento del muro de pago en abril de 2026 también hizo caer bruscamente la valoración de la app. Además del historial de moderación, el consenso de la comunidad es que Grok sigue siendo más débil en programación que Claude o ChatGPT, coherente con su puntuación de 86,6% en SWE-bench mencionada arriba.
Dónde una herramienta específica de documentos sigue ganando a las cuatro
Ninguno de estos cuatro asistentes generales está construido principalmente para responder desde un conjunto fijo de tus propios documentos con un rastro de citas de vuelta al pasaje exacto. Ese es un trabajo distinto de para lo que están optimizados, y se nota: ChatGPT y Grok responden mayormente desde conocimiento de entrenamiento más lo que pegues, Claude y Gemini pueden aceptar subidas grandes pero no hacen de la citación por afirmación el comportamiento predeterminado del producto. Si tu tarea real es investigación de fuente cerrada (una pila de PDF, un conjunto de lecturas de un curso, una carpeta de transcripciones de reuniones) donde necesitas que cada afirmación se pueda rastrear hasta una línea específica de un documento específico, Gemini Notebook (el producto antes conocido como NotebookLM, renombrado por Google en julio de 2026) está construido en torno exactamente a esa restricción de una forma en que ninguno de los cuatro asistentes generales de arriba lo está. No es un reemplazo de ninguno de ellos para escritura o programación abierta. Es una herramienta distinta para un trabajo distinto, y un flujo de trabajo razonable usa ambos: verifica hechos en una herramienta fundamentada y centrada en citas, y luego lleva la síntesis verificada al asistente general que mejor encaje con la tarea de escritura o análisis en cuestión.
Preguntas frecuentes
¿Cuál es la mejor IA en general en 2026?
No hay una. Esa es la respuesta honesta, no una evasiva. Claude lidera actualmente en programación y calidad de escritura extensa, Grok es el único con acceso nativo en tiempo real a eventos actuales, y Gemini y ChatGPT lideran en generación de imágenes. Elige según tu tarea principal, no según una puntuación agregada única.
¿Cuál IA es la mejor para programar ahora mismo?
Claude Opus 5 lidera en SWE-bench Verified con un 96-97%, verificado de forma independiente por vals.ai en un 97,0%. GPT-5.6 Sol le sigue muy de cerca con un 96,2%, lo bastante cerca como para que la ventaja de reputación de Claude en comunidades de programación no sea puramente sobre la cifra del benchmark, sino también sobre herramientas como Claude Code. Gemini se describe consistentemente como el más débil de los cuatro en programación, útil como segunda opinión más que como herramienta principal.
¿Qué IA es completamente gratis de usar?
Las cuatro tienen un nivel gratuito: Claude usa Sonnet 5 por defecto, ChatGPT usa GPT-5.6 Luna por defecto con chat de texto ilimitado desde el 6 de agosto de 2026, Gemini tiene un nivel gratuito limitado, y Grok es accesible a través del nivel X Premium de 8 $/mes como mínimo para acceso completo (el nivel gratuito básico de X incluye acceso limitado a Grok). Ninguno de los niveles gratuitos llega al modelo insignia real de cada proveedor.
¿Qué IA tiene la ventana de contexto más grande?
Sobre el papel, Claude Fable 5 y Mythos 5 vienen por defecto con 1M de tokens, igualando la ventana de entrada de 1M de Gemini 3.1 Pro. En la práctica, el producto de chat de consumidor de Gemini supuestamente tiene un tope de memoria de trabajo real de alrededor de 16.000 tokens según Android Headlines. La ventana completa funciona en el producto Google AI Studio orientado a desarrolladores pero no de forma consistente en la app de consumidor, así que trata la cifra anunciada con cautela para el chat cotidiano.
¿Qué IA puede acceder a información en tiempo real y a las noticias de hoy?
Grok, sin ambigüedad: su acceso nativo a datos de X/Twitter es un diferenciador con el que están de acuerdo todas las fuentes que cubren este espacio. Claude no tiene acceso nativo en tiempo real y depende de una herramienta de búsqueda web opcional. ChatGPT tiene navegación web pero los revisores la describen como menos fluida que la integración nativa de Grok.
¿Cuál es la diferencia entre GPT-5.6 Sol, Terra y Luna?
Sol es el buque insignia de OpenAI (~5 $/30 $ por millón de tokens, necesita Plus o superior), Terra es el caballo de batalla de nivel medio (~2 $/12 $ por millón), y Luna es el modelo rápido y barato (~0,20 $/1,20 $ por millón) que ha sido el predeterminado del nivel gratuito con chat de texto ilimitado desde el 6 de agosto de 2026. Los usuarios del nivel gratuito hablan con Luna, no con Sol.
¿Es Claude Opus 5 mejor que Claude Fable 5?
Depende de lo que necesites. Opus 5 (5 $/25 $ por millón) es el buque insignia de uso diario y el que consigue las mejores puntuaciones de programación en SWE-bench, a mitad de precio de Fable 5/Mythos 5 (10 $/50 $ por millón). Fable 5 y Mythos 5 vienen por defecto con una ventana de contexto mayor de 1M de tokens y pueden generar hasta 128K tokens por respuesta, parte del nivel que la propia Anthropic declara "más capaz ampliamente disponible". El uso diario está mejor servido en general por Opus 5; recurre a Fable 5 o Mythos 5 específicamente cuando necesites el contexto o el techo de salida mayores.
Exporta tu NotebookLM con un clic
Extensión de Chrome gratuita. PDF, Word y Markdown. Generado en tu equipo — nada se sube a la nube.