IA pour articles de recherche : ce que fait vraiment chaque outil, et l'étude qui vérifie leurs affirmations d'exactitude
Chaque premier résultat pour cette recherche est la page d'accueil d'un éditeur, ce qui signifie que chacun essaie de vous vendre quelque chose plutôt que de vous dire ce en quoi il est réellement mauvais. Voici la version honnête : ce que fait chaque outil différemment, ce qu'il coûte au palier gratuit précisément, et une étude indépendante évaluée par les pairs qui contredit de 13 points l'affirmation d'exactitude phare d'un éditeur.
Ces outils font quatre métiers différents, pas un seul. La découverte/recherche (ResearchRabbit, Consensus), l'extraction structurée (Elicit), la vérification du contexte de citation (Scite), et la simple synthèse d'articles que vous possédez déjà (Scholarcy, et Gemini Notebook). Choisir la mauvaise catégorie pour votre tâche est l'erreur la plus courante.
La seule étude d'exactitude indépendante qui existe a mesuré l'exactitude d'extraction de données d'Elicit à 81,4 %, sans différence statistiquement significative avec les évaluateurs humains à 86,7 %. Le marketing d'Elicit lui-même revendique 94 à 99 %. Les deux peuvent être vrais : le chiffre de l'éditeur provient d'évaluations autosélectionnées dans le meilleur des cas.
Trois des huit outils partagent le même corpus sous-jacent. Elicit, Consensus et Scite s'appuient tous sur Semantic Scholar comme couche de base, si bien que leurs lacunes de couverture ne sont pas indépendantes les unes des autres, même s'ils ressemblent à des produits séparés.
Gemini Notebook ne concurrence pas cette catégorie comme on pourrait s'y attendre. Il n'a aucune recherche dans une base de données académique. Sa fonctionnalité « Discover » explore le web général, pas PubMed ni Semantic Scholar. C'est un outil de chat plein texte pour des articles que vous possédez déjà, plus proche de Scholarcy que d'Elicit.
Les quatre métiers que font réellement ces outils
« IA pour articles de recherche » est traité comme une seule catégorie, mais les huit outils à connaître se répartissent nettement en quatre métiers différents. Les confondre est la raison pour laquelle les gens finissent déçus. Demander à Scholarcy de trouver des articles, ou à ResearchRabbit d'en résumer un, ne mène nulle part, car ce n'est pas ce que fait l'un ou l'autre outil.
- Découverte/recherche, trouver des articles que vous n'avez pas déjà. ResearchRabbit (graphes de réseaux de citations), Consensus (recherche axée réponse avec un « indicateur de consensus »), le mode Focus Académique de Perplexity.
- Extraction structurée, extraire des points de données spécifiques dans de nombreux articles pour former un tableau. Elicit est conçu spécifiquement pour cela ; rien d'autre dans cette liste n'en fait son métier principal.
- Vérification du contexte de citation. Pour une affirmation ou un article, montrer si les articles qui le citent le soutiennent réellement, le contredisent, ou le mentionnent simplement en passant. Tout le produit de Scite tient dans ce seul métier.
- Synthèse d'articles que vous possédez déjà. Pas de recherche, pas de base de données, juste transformer un PDF téléversé en quelque chose de plus lisible. Scholarcy et Gemini Notebook se trouvent tous deux ici.
Elicit : extraction structurée, et l'écart d'exactitude à connaître
La caractéristique distinctive d'Elicit est l'extraction sous forme de tableau : pointez-le vers une question de recherche, et il filtre des centaines ou milliers d'articles, puis construit un tableau comparatif extrayant des champs spécifiques (taille d'échantillon, méthodologie, mesure de résultat) de chacun. Rien d'autre dans cette liste ne fait cela à cette échelle.
Palier gratuit : recherche illimitée parmi environ 138 millions d'articles (dédupliqués à partir de Semantic Scholar, OpenAlex et PubMed), résumés illimités et chat en texte intégral, mais seulement 2 rapports automatisés par mois et un plafond de 2 colonnes pour les tableaux d'extraction. Pro coûte 49 $/mois et filtre jusqu'à 5 000 articles avec des tableaux de 20 colonnes ; Scale coûte 169 $/mois pour des tableaux de 30 colonnes et l'extraction de figures.
Voici la découverte qui mérite de fonder une décision : une étude évaluée par les pairs (Hilkenmeier et al., *Social Science Computer Review*, décembre 2025, testant 43 études et 602 points de données) a évalué Elicit comme second évaluateur semi-automatisé pour l'extraction de données de revues systématiques. Exactitude globale : 81,4 %, contre 86,7 % pour les évaluateurs humains, une différence non statistiquement significative. Mais ce chiffre global masque un écart marqué : sur des champs factuels simples, Elicit a égalé les humains de près ; sur des tâches d'extraction interprétative comme l'identification des « constructs d'intérêt », l'exactitude est tombée à 51,2 %, à peine mieux que le hasard sur certaines catégories, et l'étude a documenté des cas où Elicit hallucinait des résultats absents de l'article source.
Le propre blog d'Elicit revendique une exactitude de 94 % dans son autoévaluation, et une étude de cas client affirme 99,4 % sur une revue spécifique. Les deux sont des chiffres réels issus d'évaluations réelles, mais ils sont sélectionnés par l'éditeur et décrivent un meilleur cas, pas un cas typique. Le résumé honnête : Elicit est un second évaluateur réellement utile pour l'extraction simple, et quelque chose à revérifier à la main pour tout ce qui est interprétatif. Utilisez-le ainsi plutôt que de faire confiance à un tableau généré sans le relire.
ResearchRabbit : découverte par réseau de citations, gratuite
Amorcez-le avec quelques articles que vous savez déjà pertinents, et il construit un graphe visuel des travaux antérieurs, postérieurs et similaires par relations de citation. Réellement utile pour la phase « qu'est-ce qui m'échappe » d'une revue de littérature que la recherche par mot-clé ne fait pas bien ressortir.
Palier gratuit : recherches et collections illimitées, jusqu'à 50 articles de départ. RR+ à 10 $/mois relève le plafond d'articles de départ à 300 et ajoute plusieurs projets et des filtres avancés. Les données proviennent d'OpenAlex, Semantic Scholar (domaines non médicaux) et PubMed (domaines médicaux), des centaines de millions d'articles, bien que le chiffre plus précis d'Elicit, 138 millions (après déduplication), donne une meilleure idée de la couverture réelle que la vague affirmation de ResearchRabbit de « centaines de millions ». Aucune étude indépendante n'a évalué son rappel ou sa précision face à une revue de littérature manuelle. C'est une vraie lacune dans les preuves pour cet outil spécifiquement, pas un reproche contre lui.
Scite : l'article citant soutient-il réellement l'affirmation ?
Les Smart Citations de Scite classent chaque citation d'un article comme la soutenant, la contredisant, ou la mentionnant simplement, une capacité réellement distincte des outils de recherche/synthèse, et ce qui se rapproche le plus dans cette liste de la vérification factuelle d'une citation plutôt que de sa simple découverte. Construit sur plus de 1,2 milliard d'énoncés de citation classifiés à travers plus de 180 millions d'articles, avec plus de 185 millions d'articles en texte intégral indexés là où l'accès éditeur le permet.
La tarification n'a pas de palier gratuit permanent. Un essai de 7 jours du forfait Personal à 20 $/mois (ou 12 $/mois facturé annuellement) est le point d'entrée. La couverture penche vers les STEM ; les citations en sciences humaines et en droit sont moins fiablement indexées. Un test comparatif de la bibliothèque HKUST (un prompt de test unique sur Scite, Elicit, Consensus et Scopus AI, revu manuellement) a constaté que Scite performait relativement bien, précisément grâce à son accès au texte intégral, mais a signalé que les quatre outils tiraient parfois des conclusions d'énoncés introductifs généraux d'un résumé plutôt que des résultats réels d'un article, une mise en garde qui s'applique à toute cette catégorie, pas seulement à Scite.
Scholarcy : synthétise ce que vous avez déjà, ne cherche pas
C'est l'outil le plus souvent mal catégorisé. Scholarcy ne cherche dans aucune base de données. Vous téléversez, collez ou liez un article, et il extrait et restructure le texte existant en un résumé façon fiches (introduction, méthodes, résultats) en utilisant une synthèse extractive plutôt que générative. Cette distinction compte pour la confiance : il puise dans ce qui est réellement dans l'article, sans générer de prose nouvelle susceptible de s'en écarter, même si des erreurs d'analyse de structure sur des PDF mal scannés produisent tout de même de vraies erreurs.
Palier gratuit : 10 résumés par mois. La tarification payante est rapportée de façon incohérente selon les sources (4,99 $ contre 9,99 $/mois), donc vérifiez directement sur scholarcy.com avant de vous fier à l'un ou l'autre chiffre. Un cas d'échec documenté rapporté par un utilisateur : Scholarcy a attribué à tort une grande méta-analyse à « une université relativement petite », un rappel que même les outils extractifs peuvent mal analyser la structure, et que leur résultat a toujours besoin d'une vérification humaine face à la source avant d'être cité.
ScholarAI, Consensus et Perplexity : la recherche enveloppée dans un chat
ScholarAI vit à l'intérieur de ChatGPT comme un plugin plutôt que comme un produit autonome. Le palier gratuit donne 5 crédits à usage unique, Basic coûte 9,99 $/mois pour 50 crédits. La lacune notable : ScholarAI ne publie nulle part sur son propre site ses sources de données, contrairement à tous les autres outils ici, ce qui mérite d'être signalé plutôt que de supposer une couverture équivalente à Elicit ou Consensus.
Consensus répond directement à des questions de recherche par oui/non avec un « Consensus Meter » montrant le consensus scientifique, construit sur le même corpus Semantic Scholar qu'Elicit et Scite. Ses limites de palier gratuit sont réellement floues : différentes sources rapportent 20 recherches/jour, 20/mois, et deux autres chiffres contradictoires. Pro est systématiquement rapporté à 10 $/mois pour une recherche illimitée plus 15 Deep Reviews. Vérifiez directement sur consensus.app/pricing plutôt que de faire confiance à n'importe quelle source secondaire, y compris celle-ci, sur le chiffre du palier gratuit spécifiquement.
Le mode Focus Académique de Perplexity (palier Pro, 20 $/mois, ou Education Pro à 10 $/mois pour les étudiants vérifiés) restreint la récupération aux sources évaluées par les pairs : Semantic Scholar, PubMed, préprints arXiv/bioRxiv/medRxiv. Les propres conseils de Perplexity méritent d'être répétés : citez dans votre article les sources primaires qu'il fait remonter, pas Perplexity lui-même.
Où se situe réellement Gemini Notebook
Cela mérite d'être énoncé précisément car c'est facile à mal comprendre. Gemini Notebook n'a aucune recherche dans une base de données académique intégrée. Il ne répond qu'à partir des sources que vous ajoutez explicitement. Sa fonctionnalité « Discover sources » explore le web général ou votre Google Drive, pas PubMed ni Semantic Scholar, et renvoie des pages web résumées par IA que vous devez encore ajouter manuellement, pas une liste classée d'articles évalués par les pairs avec des comptes de citations.
Cela fait de son plus proche parent fonctionnel dans cette liste Scholarcy, pas Elicit ou Consensus : les deux ne fonctionnent que sur des documents que vous possédez déjà. Là où Gemini Notebook l'emporte, c'est en volume et en synthèse à travers de nombreuses sources à la fois, jusqu'à 300 sources sur le palier Pro, avec des Audio Overviews, Deep Research au sein de votre ensemble de sources, et des citations pointant vers le passage exact utilisé. Le flux de travail pratique qui se dégage de la comparaison des huit outils : utilisez Elicit, ResearchRabbit ou Consensus pour trouver et filtrer des articles, puis apportez ce que vous avez rassemblé dans Gemini Notebook pour tout synthétiser en une fois. Presque aucune page d'outil individuel ne le dit explicitement, mais c'est la forme vers laquelle converge le flux de travail réel de tout chercheur sérieux.
Tableau comparatif
Tool Job Free tier Paid entry point
---------------------------------------------------------------------------------------
Elicit Extraction Unlimited search, 2 reports/mo $49/mo (Pro)
ResearchRabbit Discovery (network) 50 seed articles $10/mo (RR+)
Scite Citation verification None (7-day trial only) $20/mo, $12/mo annual
Scholarcy Summarization 10 summaries/mo ~$5-10/mo (verify)
ScholarAI Search + chat (GPT) 5 one-time credits $9.99/mo (Basic)
Consensus Discovery (answer-first) Limited (unclear, verify) $10/mo (Pro)
Perplexity Discovery (web+academic) Limited Pro Search $20/mo, $10/mo students
Gemini Notebook Summarization/synthesis 50 sources, 50 chats/day $4.99/mo (Plus)Quand ne faire confiance à aucun de ces outils
- Pour les affirmations centrales de votre revue de littérature. Chaque étude d'exactitude trouvée dans cette recherche, l'évaluation SAGE d'Elicit et la comparaison à quatre outils de HKUST, recommande de traiter ces outils comme un second évaluateur ou un point de départ, pas une source à citer sans vérifier l'article original vous-même.
- Sur des sujets émergents ou peu documentés. Les quatre outils du test HKUST ont montré une fiabilité réduite en dehors des domaines de recherche bien établis, où il y a simplement moins de texte indexé pour tirer des résumés exacts.
- Quand l'article résumé est rétracté ou contesté. Aucun de ces outils ne signale fiablement le statut de rétractation. Recoupez tout ce qui compte directement avec la revue ou Retraction Watch.
- Si une évaluation prétendue de ces outils a elle-même été rétractée. Un article prétendant évaluer Elicit, SciSpace et Consensus pour le travail de revue de littérature a été retiré d'une revue canadienne de sciences de l'information sans raison de rétractation publique donnée, un rappel utile que même les méta-preuves de ce domaine doivent être vérifiées, pas seulement les outils eux-mêmes.
Quel est l'outil IA le plus exact pour les articles de recherche ?
Aucun outil n'a un dossier d'exactitude propre et vérifié de façon indépendante sur l'ensemble du domaine. La seule étude rigoureuse qui existe (sur Elicit) a trouvé une exactitude globale de 81,4 %, sans différence statistiquement significative avec les évaluateurs humains, mais avec de réelles faiblesses sur les tâches d'extraction interprétative. Chaque outil ici doit être traité comme un second évaluateur, pas une source finale.
Gemini Notebook peut-il chercher dans des bases de données académiques comme PubMed ?
Non. Gemini Notebook ne fonctionne qu'à partir des sources que vous ajoutez vous-même. Sa fonctionnalité Discover explore le web général ou Google Drive, pas PubMed, Semantic Scholar ni arXiv. Pour la découverte en base de données, utilisez plutôt Elicit, ResearchRabbit ou Consensus, puis apportez ce que vous trouvez dans Gemini Notebook pour synthétiser.
Existe-t-il un moyen gratuit de vérifier si les citations d'un article soutiennent réellement ses affirmations ?
Scite est conçu spécifiquement pour cela (classification soutient/contredit/mentionne), mais n'a pas de palier gratuit permanent au-delà d'un essai de 7 jours. Il n'existe pas d'alternative entièrement gratuite qui fasse ce métier spécifique aussi minutieusement.
Quelle est la différence entre Elicit et Consensus ?
Elicit est conçu pour l'extraction structurée de données à travers de nombreux articles dans un tableau comparatif. Consensus est conçu pour des réponses rapides oui/non à une question de recherche avec un indicateur de consensus. Les deux s'appuient sur le corpus Semantic Scholar, mais ils résolvent des problèmes différents : extraction contre synthèse rapide.
Exportez votre NotebookLM en un clic
Extension Chrome gratuite. PDF, Word et Markdown. Généré sur votre machine — rien n'est envoyé en ligne.