Mejor detector de IA 2026: lo que muestra de verdad la investigación independiente, no lo que afirman los proveedores
La página de marketing de cada detector de IA dice más o menos lo mismo: 99% de precisión, con la confianza de universidades, funciona con ChatGPT, Gemini y Claude. Casi nada de eso viene de nadie ajeno a la empresa que vende la herramienta. Esta guía se salta las afirmaciones de los proveedores y se basa en lo que encontraron investigadores independientes, universidades que de verdad desplegaron estas herramientas a gran escala, y un benchmark revisado por pares, al probar los detectores contra escritura real, incluido el problema concreto de sesgo que sigue presente de forma medible en 2026, tres años después de que se documentara por primera vez.
Ningún detector de IA es lo bastante fiable como para ser la única base de una acusación. Las herramientas con mejor rendimiento en pruebas independientes (no hechas por el proveedor), Pangram y GPTZero, muestran tasas de falsos positivos cercanas a cero en texto limpio y sin editar en estudios controlados, pero la precisión de todos los detectores cae en picado en cuanto el texto se parafrasea, se edita o lo escribe alguien que no tiene el inglés como lengua materna, y ninguno de esos matices sobrevive en una sola cifra de porcentaje.
Si de todos modos necesitas un detector: Pangram y GPTZero cuentan hoy con los datos de precisión independientes más sólidos detrás. Originality.ai y Turnitin tienen tasas de falsos positivos elevadas y documentadas en estudios concretos, más abajo. Existen niveles gratuitos en GPTZero (10.000 palabras/mes), Pangram (2.000 palabras/día) y QuillBot/Scribbr (alrededor de 1.200 palabras por análisis), suficiente para comprobar un solo ensayo sin pagar.
Al menos tres universidades con un historial público claro, Waterloo, Curtin y Ciudad del Cabo, han desactivado formalmente y por completo las funciones de detección de IA, citando falsos positivos y sesgo, y una cuarta, Buffalo, vio una petición firmada por 1.200 estudiantes tras un caso de señalamiento injusto. Es la señal más fuerte en todo este terreno: las instituciones con más en juego y más datos de uso se están alejando de estas herramientas, no acercándose a ellas.
Si has llegado aquí porque usaste NotebookLM/Gemini Notebook para estudiar o redactar algo y te preocupa que te lo marquen, salta a la sección de más abajo: la respuesta honesta tiene más matices que un sí o un no.
Qué significa «el mejor» depende de quién pregunte
Un profesor que revisa 150 ensayos quiere sobre todo una tasa baja de falsos positivos: acusar injustamente a un alumno de copiar es un resultado peor que pasar por alto un caso real. Una editorial que comprueba entregas de colaboradores a gran escala se preocupa más por el rendimiento y el acceso a la API. Un estudiante que quiere comprobar su propia redacción antes de entregarla solo quiere algo gratis y razonablemente orientativo. Casi todas las listas de «mejor detector de IA» en la web tratan esto como la misma pregunta y ordenan por la misma afirmación vaga de «precisión», casi siempre sacada de la propia página de marketing del proveedor y no de una prueba independiente. Esa es la brecha que esta guía intenta cerrar: lo que encontró realmente la investigación independiente y con metodología divulgada, no lo que dice cada empresa sobre sí misma.
Los detectores que la gente usa de verdad
Tool Free tier Paid, monthly Notes
--------------------------------------------------------------------------------
GPTZero 10,000 words/mo $14.99 ($8.33 annual) Sentence-level highlighting
Pangram 2,000 words/day $20 (300,000 words/mo) Strongest independent FPR data
Originality.ai None $14.95 (2,000 credits) Elevated FPR in RAID benchmark
Copyleaks ~10 pages/mo (unverified) $13.99 Also sells a paraphrase-evasion product
Turnitin Institutional only No consumer pricing Add-on license; own reported FPR <1%
Winston AI 2,000-credit, 14-day trial $18 ($10 annual) Positions for educators/publishers
ZeroGPT "Free forever," cap unclear ~$8-10 Pro, ~$27 Max Free-tier word cap varies by source
QuillBot ~1,200 words/scan $19.95 ($8.33 annual) Same underlying engine as Scribbr
Scribbr ~1,200 words/scan, unlimited N/A, bundled Runs on QuillBot's detection engine
Pricing checked against vendor pages and independent trackers, September 2026.
ZeroGPT and Copyleaks free-tier limits vary across sources - confirm on the
vendor's own page before relying on either for a real check.Lo que encontró de verdad la investigación independiente
Hay dos estudios que importan más que el resto, porque ambos tienen la metodología divulgada y ninguno fue financiado ni realizado por un proveedor de detectores. Los economistas Brian Jabarian y Alex Imas, de la Booth School de la Universidad de Chicago, publicaron «Artificial Writing and Automated Detection» como documento de trabajo del NBER en 2025: cerca de 2.000 pasajes escritos por humanos en seis medios distintos (blogs, reseñas de productos, noticias, novelas, reseñas de restaurantes, currículos), cada uno reescrito también por cuatro LLM distintos, pasados por GPTZero, Originality.ai, Pangram y una línea base de RoBERTa de código abierto. Pangram salió como el más fuerte, con una tasa de falsos positivos cercana al 0% y una tasa de falsos negativos de entre el 2 y el 4%. GPTZero quedó muy cerca, con menos del 1% de falsos positivos y entre el 0 y el 2% de falsos negativos. Los falsos positivos de Originality.ai se mantuvieron por debajo del 1%, pero su tasa de falsos negativos osciló entre el 10% y el 40% según el LLM y el medio probados, lo que significa que se le escapó una parte considerable de texto genuinamente escrito por IA. Las cuatro herramientas se degradaron con fuerza en pasajes de menos de unas 50 palabras, algo que importa si estás comprobando respuestas cortas en vez de ensayos completos.
Por separado, el benchmark RAID, revisado por pares (Dugan et al., ACL 2024), probó un conjunto más amplio de detectores en distintos dominios y condiciones adversariales. Originality.ai quedó de hecho primero en el conjunto de RAID, con una precisión media de en torno al 85% y un 96,7% de precisión específicamente en texto parafraseado, su mejor resultado en cualquiera de los estudios citados aquí. Pero ese mismo benchmark encontró que su tasa de falsos positivos en texto de estilo Wikipedia llegó específicamente al 13%, un orden de magnitud más alto que su rendimiento en los pasajes de Chicago Booth de arriba. Ambas cifras vienen del mismo estudio: la precisión de un detector no es una cifra fija, se mueve según el tipo de texto que le des, y una buena media general puede seguir escondiendo un punto débil en un dominio concreto. Un estudio anterior, muy citado, de Weber-Wulff et al. (2023, International Journal for Educational Integrity), probó 14 herramientas, incluidas Turnitin y GPTZero, y concluyó que ninguna era «lo bastante precisa ni fiable» para decisiones de alto riesgo, y que la precisión se desplomaba todavía más en cuanto el texto se parafraseaba ligeramente, un paso trivial para cualquiera que intente evadir la detección de forma deliberada.
El problema del sesgo no ha desaparecido, se ha reducido
En julio de 2023, los investigadores de Stanford Weixin Liang, Mert Yuksekgonul, Yining Mao, Eric Wu y James Zou publicaron un estudio muy citado en la revista *Patterns* (Cell Press): pasaron siete detectores comerciales de IA por 91 ensayos del TOEFL escritos por personas cuya lengua materna no era el inglés y 88 ensayos de hablantes nativos. La tasa media de falsos positivos en los ensayos de no nativos fue del 61,3%. En los ensayos de hablantes nativos, fue cercana a cero. En la práctica, los detectores estaban marcando la propia fluidez: quienes no tienen el inglés como lengua materna tienden a frases más cortas y menos variedad léxica, rasgos que los modelos estadísticos de los detectores asocian con la generación por IA.
Lo que casi ninguna cobertura actual de «mejor detector de IA» menciona es que esto se volvió a probar. Un estudio de 2026 aceptado en el EACL Student Research Workshop (Al Ali, Helcl y Libovický, arXiv:2602.05769) repitió el mismo conjunto de ensayos del TOEFL con un detector comercial moderno y encontró que la tasa de falsos positivos había bajado de forma sustancial, del 61,3% original al 23,1%. En un experimento aparte dentro del mismo estudio, probando un par de idiomas distinto, los investigadores encontraron que el sesgo depende del idioma y de la morfología: los ensayos de hablantes de checo, por ejemplo, no mostraron ningún sesgo estadísticamente significativo. Es una mejora real y medible. No es lo mismo que el problema esté resuelto: una tasa de falsos positivos del 23,1% en escritura de no nativos en inglés sigue siendo más de uno de cada cinco estudiantes señalados injustamente, y el benchmark más reciente BAID (arXiv:2512.11505, diciembre de 2025) extiende el mismo hallazgo a siete categorías sociolingüísticas más amplias, no solo hablantes de inglés como segunda lengua. Un informe de julio de 2026 del Higher Education Policy Institute del Reino Unido conectó esto directamente con resultados reales: de las revisiones de casos de mala conducta académica que examinó que incluían pruebas de detección de IA, tres de cada cuatro implicaban a estudiantes internacionales o de inglés como segunda lengua.
Las universidades están apagando los detectores en silencio
Si la precisión de los detectores fuera una cuestión resuelta, cabría esperar que su adopción estuviera subiendo. No es así, al menos no de forma uniforme. La Universidad de Waterloo dejó de usar formalmente la función de detección de IA de Turnitin en septiembre de 2025, después de que su propio grupo de Tecnologías Instructivas y Servicios de Medios calificara el valor de la herramienta como «no concluyente» y documentara casos en los que marcó como 100% generado por IA texto genuinamente escrito por humanos. La Universidad de Curtin desactivó la misma función a partir del 1 de enero de 2026. La Universidad de Ciudad del Cabo la desactivó en agosto de 2025, citando tanto falsos positivos como falsos negativos. En la Universidad de Buffalo, cerca de 1.200 estudiantes firmaron una petición en mayo de 2025 después de que a un estudiante lo marcaran en tres tareas distintas y pasara meses sin una notificación formal. Rastreadores independientes enumeran docenas de instituciones más con la función desactivada; este artículo solo cita las cuatro que tienen una fuente primaria clara y comprobable, ya que la cifra más amplia de «más de 50 universidades» que circula en sitios agregadores de SEO no se puede rastrear hasta nada verificable de forma independiente.
La propia postura de Turnitin es que su tasa de falsos positivos a nivel de documento está por debajo del 1%, basada en pruebas internas sobre entre 700.000 y 800.000 trabajos anteriores a 2018, una línea base que es completamente anterior a la generación actual de LLM y que no ha sido auditada de forma independiente. El Center for Teaching de Vanderbilt hizo la cuenta en público en 2023: incluso una tasa de falsos positivos del 1%, aplicada al volumen de trabajos propio de Vanderbilt, se traduce en cientos de señalamientos injustos al año. A la escala en la que opera una gran universidad pública o una plataforma como Turnitin, una tasa que suena tranquilizadoramente baja en una frase de marketing sigue produciendo acusaciones injustas reales e individuales.
Algo que casi nadie revela: quién es en realidad el dueño de estas herramientas
El detector de IA de Scribbr y el de QuillBot funcionan sobre el mismo motor de detección subyacente: no son productos independientes construidos por equipos que compiten entre sí. Ambas empresas, junto con Turnitin, pertenecen a la misma matriz, Learneo. Si comparas el resultado de Scribbr con el de QuillBot y tratas la coincidencia entre ambos como una segunda opinión, en realidad no la estás obteniendo: estás comprobando el mismo motor dos veces bajo dos marcas distintas. Ninguno de los recopilatorios de «mejor detector de IA» consultados al investigar este artículo revelaba esa coincidencia. Eso no hace que ninguna de las dos herramientas esté mal, pero es el tipo de dato estructural que necesita saber alguien que decide «con qué dos herramientas debería contrastar» antes de elegir dos que resultan ser lo mismo.
¿NotebookLM (Gemini Notebook) hace que te marquen los detectores de IA?
Busca esta pregunta y los resultados son escasos: un hilo de Reddit en r/notebooklm con respuestas anecdóticas y contradictorias, un par de vídeos de TikTok que afirman que a un estudiante lo marcaron con un 89% de IA tras usarlo, y uno o dos blogs de poca autoridad haciendo afirmaciones seguras sin ninguna metodología detrás. No existe ninguna fuente autorizada —ni Google, ni una universidad, ni un estudio revisado por pares— que pruebe específicamente la salida de Gemini Notebook contra detectores de IA. Esa ausencia es en sí misma la respuesta honesta: nadie ha hecho pruebas rigurosas y divulgadas sobre esta pregunta concreta, así que cualquier afirmación segura de sí o no que leas no tiene respaldo.
Lo razonable que se puede decir en su lugar, según cómo funcionan realmente estas herramientas, es esto: los detectores marcan patrones estadísticos en el *texto*, no la herramienta que lo produjo, así que una transcripción de un Audio Overview de Gemini Notebook pegada directamente en un ensayo, o la redacción de una Guía de estudio copiada en gran parte sin editar, lleva la misma firma estadística detectable que cualquier otra escritura generada por IA, porque es escritura generada por IA. La distinción más segura está entre usar Gemini Notebook para *entender y organizar el material fuente* (lo que produce tu propia escritura, fundamentada en citas que puedes señalar) frente a copiar directamente sus salidas de Studio en un trabajo entregado (lo que produce exactamente el tipo de texto que estos detectores están hechos para atrapar, con todo el riesgo de falso positivo de arriba todavía presente incluso si después escribiste cada palabra tú mismo pero demasiado pegado a su redacción). Si tu institución usa detección de IA y has usado cualquier herramienta de IA como parte de tu proceso de investigación, incluido Gemini Notebook, la práctica más segura es la misma que ya existía antes de los detectores de IA: cita tu proceso si te lo piden, y asegúrate de que las palabras de tu entrega final son de verdad tu propia síntesis, no un copia y pega ligeramente editado.
Entonces, ¿cuál deberías usar de verdad?
Para quien tenga que tomar una decisión de alto riesgo (un profesor decidiendo si escalar un caso, un editor filtrando entregas), trata el porcentaje de un solo detector como un dato débil, no como un veredicto, y combínalo con una conversación con quien lo escribió antes de actuar. De las herramientas con datos independientes reales detrás, Pangram y GPTZero tienen hoy el mejor historial de precisión en pruebas divulgadas y ajenas al proveedor; ambas ofrecen un nivel gratuito utilizable si solo quieres comprobar un documento. Vale la pena sopesar la baja tasa de falsos positivos que reporta Originality.ai en el estudio de Chicago Booth frente a su tasa considerablemente más alta en el benchmark RAID y su tasa de falsos negativos mucho más alta, lo que significa que es más probable que se le escape texto real de IA a que marque injustamente texto humano, lo cual puede o no ser el equilibrio que quieres según tu caso de uso. Turnitin sigue siendo la opción por defecto en entornos institucionales por sus relaciones de licencia ya existentes, no porque la investigación independiente lo sitúe por encima de las alternativas, y una lista creciente de universidades ha decidido que ese equilibrio ya no compensa.
La gente también pregunta
¿Qué detector de IA es el más preciso?
En el estudio independiente más sólido disponible (Jabarian y Imas, NBER/Chicago Booth, 2025), Pangram y GPTZero tuvieron las tasas más bajas de falsos positivos y falsos negativos entre las herramientas probadas. La precisión varía según el tipo y la longitud del texto, y no se ha demostrado que ningún detector sea lo bastante fiable por sí solo para decisiones de alto riesgo.
¿Los detectores de IA dan falsos positivos con escritura humana?
Sí, y la tasa varía muchísimo según la herramienta y el perfil de quien escribe. Estudios independientes han encontrado tasas de menos del 1% a más del 60% según el detector y si quien escribe no tiene el inglés como lengua materna, cuyo estilo de escritura los detectores de IA han demostrado repetidamente clasificar mal como generado por IA con más frecuencia que la escritura de hablantes nativos.
¿Los detectores de IA tienen sesgo contra quienes no tienen el inglés como lengua materna?
Sí, aunque el sesgo se ha reducido. Un estudio de Stanford de 2023 encontró una tasa media de falsos positivos del 61,3% en ensayos de no nativos en siete detectores. Un estudio de seguimiento de 2026 encontró que esa tasa había bajado al 23,1% en un detector moderno, pero confirmó que el sesgo no se había eliminado, y que varía según la lengua materna de quien escribe.
¿Por qué las universidades están desactivando el detector de IA de Turnitin?
Entre los motivos documentados están los falsos positivos en texto escrito por humanos, el sesgo contra quienes no tienen el inglés como lengua materna, y pruebas internas no concluyentes. La Universidad de Waterloo, la Universidad de Curtin y la Universidad de Ciudad del Cabo han desactivado formalmente la función y han publicado sus razones.
¿Pueden los detectores de IA saber si usé NotebookLM o Gemini Notebook?
Actualmente no existe ninguna fuente autorizada y probada de forma independiente sobre esta pregunta concreta. Los detectores analizan los patrones estadísticos del propio texto, no la herramienta de origen, así que el texto generado por IA copiado de cualquier herramienta, incluidas las salidas de Studio de Gemini Notebook, lleva una firma de IA detectable. Usar la herramienta para investigar y luego escribir tu propia síntesis con tus propias palabras es una situación distinta a copiar su salida directamente.
¿Hay algún detector de IA gratuito que funcione?
GPTZero (10.000 palabras/mes), Pangram (2.000 palabras/día) y QuillBot/Scribbr (unas 1.200 palabras por análisis) ofrecen todos niveles gratuitos utilizables. Ninguno debería tratarse como un veredicto final, sobre todo en texto corto o texto de alguien que no tiene el inglés como lengua materna, donde está documentado que las tasas de falsos positivos son más altas.
Exporta tu NotebookLM con un clic
Extensión de Chrome gratuita. PDF, Word y Markdown. Generado en tu equipo — nada se sube a la nube.