IA para artículos de investigación: qué hace realmente cada herramienta, y el estudio que comprueba sus afirmaciones de precisión
Todos los primeros resultados para esta búsqueda son la propia página de inicio de un proveedor, lo que significa que todos intentan venderte algo en lugar de contarte en qué son realmente malos. Aquí va la versión honesta: qué hace cada herramienta de forma distinta, qué cuesta concretamente en el nivel gratuito, y un estudio independiente revisado por pares que contradice en 13 puntos la afirmación estrella de precisión de un proveedor.
Estas herramientas hacen cuatro trabajos distintos, no uno. Descubrimiento/búsqueda (ResearchRabbit, Consensus), extracción estructurada (Elicit), verificación del contexto de citas (Scite), y resumen puro de artículos que ya tienes (Scholarcy, y Gemini Notebook). Elegir la categoría equivocada para tu tarea es el error más habitual.
El único estudio independiente de precisión que existe encontró que la precisión de extracción de datos de Elicit era del 81,4%, sin diferencia estadísticamente significativa frente al 86,7% de los revisores humanos. El propio marketing de Elicit afirma un 94-99%. Ambas cosas pueden ser ciertas: la cifra del proveedor procede de evaluaciones de mejor caso autoseleccionadas.
Tres de las ocho herramientas comparten el mismo corpus subyacente. Elicit, Consensus y Scite se apoyan las tres en Semantic Scholar como capa base, así que sus lagunas de cobertura no son independientes entre sí aunque parezcan productos distintos.
Gemini Notebook no compite en esta categoría como cabría esperar. No tiene búsqueda en bases de datos académicas. Su función "Descubrir" busca en la web general, no en PubMed ni en Semantic Scholar. Es una herramienta de chat sobre texto completo para artículos que ya tienes, más cerca de Scholarcy que de Elicit.
Los cuatro trabajos que hacen realmente estas herramientas
"IA para artículos de investigación" se trata como una sola categoría, pero las ocho herramientas que merece la pena conocer se dividen claramente en cuatro trabajos distintos. Confundirlos es la razón por la que la gente acaba decepcionada. Pedirle a Scholarcy que encuentre artículos, o pedirle a ResearchRabbit que resuma uno, no lleva a ningún sitio, porque no es lo que hace ninguna de las dos herramientas.
- Descubrimiento/búsqueda, encontrar artículos que todavía no tienes. ResearchRabbit (grafos de redes de citas), Consensus (búsqueda que responde primero con un "medidor de consenso"), el modo Academic Focus de Perplexity.
- Extracción estructurada, sacar datos concretos de muchos artículos y volcarlos en una tabla. Elicit está construido específicamente para esto; ninguna otra herramienta de esta lista lo tiene como trabajo principal.
- Verificación del contexto de citas. Para una afirmación o un artículo, mostrar si los artículos que lo citan realmente lo respaldan, lo contradicen, o solo lo mencionan de pasada. Todo el producto de Scite es este único trabajo.
- Resumen de artículos que ya tienes. Sin búsqueda, sin base de datos, solo convertir un PDF que subes en algo más legible. Scholarcy y Gemini Notebook viven ambos aquí.
Elicit: extracción estructurada, y la brecha de precisión que conviene conocer
La característica distintiva de Elicit es la extracción basada en tablas: apúntalo a una pregunta de investigación, y criba cientos o miles de artículos, luego construye una tabla comparativa que extrae campos concretos (tamaño de la muestra, metodología, medida de resultado) de cada uno. Ninguna otra herramienta de esta lista lo hace a esa escala.
Nivel gratuito: búsqueda ilimitada en unos 138 millones de artículos (deduplicados de Semantic Scholar, OpenAlex y PubMed), resúmenes y chat de texto completo ilimitados, pero solo 2 informes automatizados al mes y un tope de 2 columnas en las tablas de extracción. Pro cuesta 49 $/mes y criba hasta 5.000 artículos con tablas de 20 columnas; Scale cuesta 169 $/mes por tablas de 30 columnas y extracción de figuras.
Este es el hallazgo sobre el que merece la pena construir una decisión: un estudio revisado por pares (Hilkenmeier et al., *Social Science Computer Review*, dic. 2025, con 43 estudios y 602 puntos de datos) evaluó a Elicit como segundo revisor semiautomatizado para la extracción de datos en revisiones sistemáticas. Precisión global: 81,4%, frente al 86,7% de los revisores humanos, sin diferencia estadísticamente significativa. Pero esa cifra global esconde una división marcada: en campos factuales sencillos, Elicit se acercaba mucho a los humanos; en tareas de extracción interpretativa como identificar "constructos de interés", la precisión caía al 51,2%, apenas mejor que el azar en algunas categorías, y el estudio documentó que Elicit alucinaba resultados que ni siquiera estaban presentes en el artículo fuente.
El propio blog de Elicit cita una precisión del 94% en su autoevaluación, y un estudio de caso de un cliente afirma un 99,4% en una revisión concreta. Ambas son cifras reales de evaluaciones reales, pero están seleccionadas por el proveedor y describen un mejor caso, no uno típico. El resumen honesto: Elicit es un segundo revisor genuinamente útil para extracción sencilla, y algo que hay que comprobar a mano para cualquier cosa interpretativa. Úsalo así, en lugar de fiarte de una sola tabla que genera sin leerla.
ResearchRabbit: descubrimiento por red de citas, gratis
Aliméntalo con unos pocos artículos que ya sabes que son relevantes, y construye un grafo visual de trabajos anteriores, posteriores y similares por relaciones de citas. Genuinamente útil para la fase de "qué me estoy dejando" de una revisión bibliográfica que la búsqueda por palabras clave no saca bien a la luz.
Nivel gratuito: búsquedas y colecciones ilimitadas, hasta 50 artículos semilla. RR+ por 10 $/mes eleva el tope de semillas a 300 y añade varios proyectos y filtros avanzados. Los datos proceden de OpenAlex, Semantic Scholar (campos no médicos) y PubMed (campos médicos), cientos de millones de artículos, aunque la cifra más precisa de Elicit de 138M (tras deduplicar) da una idea más realista de la cobertura que la afirmación más vaga de "cientos de millones" de ResearchRabbit. Ningún estudio independiente ha evaluado su exhaustividad ni su precisión frente a una revisión bibliográfica manual. Es una laguna real en la evidencia específicamente para esta herramienta, no una crítica en su contra.
Scite: ¿el artículo que cita respalda realmente la afirmación?
Las Smart Citations de Scite clasifican cada cita a un artículo como de apoyo, de contraste, o de mera mención, una capacidad genuinamente distinta de las herramientas de búsqueda/resumen, y lo más parecido en esta lista a verificar una cita en lugar de encontrarla. Construido sobre más de 1.200 millones de declaraciones de citas clasificadas en más de 180 millones de artículos, con 185 millones de artículos de texto completo indexados allí donde el acceso del editor lo permite.
Los precios no tienen ningún nivel gratuito permanente. Una prueba de 7 días del plan Personal de 20 $/mes (o 12 $/mes facturado anualmente) es la puerta de entrada. La cobertura se inclina hacia STEM; las citas de humanidades y derecho están indexadas de forma menos fiable. Una prueba comparativa de la biblioteca de HKUST (un prompt de prueba en Scite, Elicit, Consensus y Scopus AI, revisado manualmente) encontró que Scite funcionaba relativamente bien precisamente por su acceso a texto completo, pero señaló que las cuatro herramientas a veces sacaban conclusiones de afirmaciones introductorias generales de un resumen en lugar de los hallazgos reales de un artículo, una advertencia que se aplica a toda esta categoría, no solo a Scite.
Scholarcy: resume lo que ya tienes, no busca
Esta es la herramienta que más a menudo se clasifica mal. Scholarcy no busca en ninguna base de datos. Subes, pegas o enlazas un artículo, y extrae y reestructura el texto existente en un resumen tipo tarjeta de memoria (introducción, métodos, hallazgos) usando resumen extractivo en lugar de generativo. Esa distinción importa para la confianza: extrae lo que realmente hay en el artículo, no genera prosa nueva que podría desviarse de él, aunque los errores al analizar la estructura de PDF mal escaneados siguen produciendo errores genuinos.
Nivel gratuito: 10 resúmenes al mes. El precio de pago se reporta de forma inconsistente entre fuentes (4,99 $ frente a 9,99 $/mes), así que comprueba directamente scholarcy.com antes de fiarte de ninguna de las dos cifras. Un modo de fallo documentado en un informe de usuario: Scholarcy atribuyó erróneamente un gran metaanálisis a "una universidad relativamente pequeña", un recordatorio de que incluso las herramientas extractivas pueden analizar mal la estructura, y su salida sigue necesitando una comprobación humana contra la fuente antes de citarla.
ScholarAI, Consensus y Perplexity: búsqueda envuelta en chat
ScholarAI vive dentro de ChatGPT como un plugin en lugar de como un producto independiente. El nivel gratuito da 5 créditos de un solo uso, Basic cuesta 9,99 $/mes por 50 créditos. La laguna notable: ScholarAI no publica sus fuentes de datos en ningún sitio de su propia web, a diferencia de todas las demás herramientas de aquí, algo que merece señalarse en lugar de asumir una cobertura equivalente a la de Elicit o Consensus.
Consensus responde directamente preguntas de investigación de sí/no con un "Consensus Meter" que muestra el consenso científico, construido sobre el mismo corpus de Semantic Scholar que Elicit y Scite. Sus límites de nivel gratuito son genuinamente poco claros: distintas fuentes reportan 20 búsquedas/día, 20/mes, y otras dos cifras contradictorias más. Pro se reporta de forma consistente en 10 $/mes por búsqueda ilimitada más 15 Deep Reviews. Comprueba directamente consensus.app/pricing en lugar de fiarte de ninguna fuente secundaria aislada, incluida esta, para la cifra concreta del nivel gratuito.
El modo Academic Focus de Perplexity (nivel Pro, 20 $/mes, o Education Pro a 10 $/mes para estudiantes verificados) restringe la recuperación a fuentes revisadas por pares: Semantic Scholar, PubMed, preprints de arXiv/bioRxiv/medRxiv. Merece la pena repetir la propia indicación de Perplexity: cita en tu artículo real las fuentes primarias que muestra, no a Perplexity en sí.
Dónde encaja realmente Gemini Notebook
Merece la pena decirlo con precisión porque es fácil equivocarse. Gemini Notebook no tiene búsqueda en bases de datos académicas integrada. Responde solo a partir de las fuentes que añades explícitamente. Su función "Descubrir fuentes" busca en la web general o en tu Google Drive, no en PubMed ni en Semantic Scholar, y devuelve páginas web resumidas por IA que todavía tienes que añadir manualmente, no una lista clasificada de artículos revisados por pares con recuentos de citas.
Eso hace que su pariente funcional más cercano en esta lista sea Scholarcy, no Elicit ni Consensus: ambos trabajan solo sobre documentos que ya tienes. Donde Gemini Notebook se adelanta es en volumen y síntesis a través de muchas fuentes a la vez, hasta 300 fuentes en el nivel Pro, con Resúmenes en audio, Deep Research dentro de tu conjunto de fuentes, y citas que apuntan al pasaje exacto usado. El flujo de trabajo práctico que emerge de comparar las ocho herramientas: usa Elicit, ResearchRabbit o Consensus para encontrar y cribar artículos, y luego trae lo que has recopilado a Gemini Notebook para sintetizarlo todo a la vez. Casi ninguna de las páginas individuales de estas herramientas lo dice explícitamente, pero es la forma hacia la que converge el flujo de trabajo real de todo investigador serio.
Tabla comparativa
Tool Job Free tier Paid entry point
---------------------------------------------------------------------------------------
Elicit Extraction Unlimited search, 2 reports/mo $49/mo (Pro)
ResearchRabbit Discovery (network) 50 seed articles $10/mo (RR+)
Scite Citation verification None (7-day trial only) $20/mo, $12/mo annual
Scholarcy Summarization 10 summaries/mo ~$5-10/mo (verify)
ScholarAI Search + chat (GPT) 5 one-time credits $9.99/mo (Basic)
Consensus Discovery (answer-first) Limited (unclear, verify) $10/mo (Pro)
Perplexity Discovery (web+academic) Limited Pro Search $20/mo, $10/mo students
Gemini Notebook Summarization/synthesis 50 sources, 50 chats/day $4.99/mo (Plus)Cuándo no fiarse de ninguna de estas
- Para las afirmaciones centrales de tu revisión bibliográfica. Todos los estudios de precisión encontrados en esta investigación, la evaluación SAGE de Elicit y la comparativa de cuatro herramientas de HKUST, recomiendan tratar estas herramientas como un segundo revisor o un punto de partida, no como una fuente que citas sin comprobar tú mismo el artículo original.
- En temas emergentes o poco documentados. Las cuatro herramientas de la prueba de HKUST mostraron una fiabilidad reducida fuera de áreas de investigación bien establecidas, donde simplemente hay menos texto indexado del que extraer resúmenes precisos.
- Cuando el artículo que resume está retractado o es objeto de controversia. Ninguna de estas herramientas señala el estado de retractación de forma fiable. Contrasta directamente cualquier cosa importante con la revista o con Retraction Watch.
- Si una supuesta evaluación de estas herramientas ha sido ella misma retractada. Un artículo que pretendía evaluar Elicit, SciSpace y Consensus para trabajos de revisión bibliográfica fue retirado de una revista canadiense de biblioteconomía sin dar ningún motivo público de retractación, un recordatorio útil de que incluso la metaevidencia en este campo necesita comprobación, no solo las herramientas en sí.
¿Cuál es la herramienta de IA más precisa para artículos de investigación?
Ninguna herramienta tiene un historial de precisión limpio y verificado de forma independiente en todos los aspectos. El único estudio riguroso que existe (sobre Elicit) encontró una precisión global del 81,4%, sin diferencia estadísticamente significativa frente a los revisores humanos, pero con debilidades reales en tareas de extracción interpretativa. Todas las herramientas de aquí deberían tratarse como un segundo revisor, no como una fuente final.
¿Puede Gemini Notebook buscar en bases de datos académicas como PubMed?
No. Gemini Notebook solo trabaja a partir de fuentes que añades tú mismo. Su función Descubrir busca en la web general o en Google Drive, no en PubMed, Semantic Scholar ni arXiv. Para el descubrimiento en bases de datos, usa en su lugar Elicit, ResearchRabbit o Consensus, y luego trae lo que encuentres a Gemini Notebook para sintetizarlo.
¿Hay alguna forma gratuita de comprobar si las citas de un artículo respaldan realmente sus afirmaciones?
Scite está construido específicamente para esto (clasificación de apoyo/contraste/mención), pero no tiene ningún nivel gratuito permanente más allá de una prueba de 7 días. No hay ninguna alternativa totalmente gratuita que haga ese mismo trabajo concreto con el mismo nivel de exhaustividad.
¿Cuál es la diferencia entre Elicit y Consensus?
Elicit está construido para la extracción estructurada de datos de muchos artículos en una tabla comparativa. Consensus está construido para respuestas rápidas de sí/no a una pregunta de investigación con un medidor de consenso. Ambos se apoyan en el corpus de Semantic Scholar, pero resuelven problemas distintos: extracción frente a síntesis rápida.
Exporta tu NotebookLM con un clic
Extensión de Chrome gratuita. PDF, Word y Markdown. Generado en tu equipo — nada se sube a la nube.