Un cancer au coeur de la recherche contre le cancer : 10 % des articles de PubMed faux ??

Points clés

Compte tenu de quelques charges diverses, j’ai omis de vous commenter un excellent article du BMJ du 30 janvier 2026. De bons commentaires sur le BMJ (rapid responses) et sur PubPeer (PubPeer – Machine learning based screening of potential paper mill pub…). J’ai commenté souvent cet article lors de conférences. Par chance, deux des quatre auteurs sont français (Baptiste Scancar, Rennes, et David Causeur, Australie). Jennifer Byrne, deuxième bmj cancer aiautrice, australienne francophone, a travaillé dans ce domaine. Ils ont eu l’excellente idée d’écrire dans Médecine / Sciences un article d’accès libre, et j’ai emprunté le début de leur titre pour ce billet : « Un cancer au coeur de la recherche contre le cancer : la menace grandissante des fabriques à articles scientifiques« . C’est une bonne publication secondaire (information à déclarer en disant si c’est exactement conforme ou non à la publication primaire). Les quelques divergences normales avec l’article original ne changent rien (merci à lIA).

Contexte et méthodes

Le nombre annuel de publications a augmenté d’environ 47 % entre 2016 et 2022, sans hausse équivalente du nombre de chercheurs. Cette pression à publier alimente les fabriques à articles (paper mills). Elles produisent à la chaîne des articles à partir de modèles de texte, avec de fausses données et des images manipulées. La cancérologie, surtout l’oncologie moléculaire, est l’un des domaines les plus touchés. Les articles produits à partir de modèles laisseraient une « signature » de style et de vocabulaire repérable dans le titre et le résumé.

L’outil est ancien, mais toujours très utile : BERT, un modèle de langage de Google, est utilisé pour classer les textes. Il ne détecte pas la fraude en tant que telle, mais mesure la ressemblance avec des articles frauduleux connus. BERT a été entraîné sur 2 202 articles sur le cancer rétractés pour suspicion de fraude, tirés de Retraction Watch et PubMed ; il a été entraîné sur autant d’articles présumés authentiques, issus de revues à fort facteur d’impact, avec un équilibrage entre pays pour limiter les biais géographiques. La validation a montré que le modèle classait correctement plus de 90 % des articles.

Résultats

Impressionnant : sur 2,6 millions d’articles sur le cancer publiés entre 1999 et 2024, indexés dans PubMed, près de 10 % ont un texte proche de celui des articles faux, soit environ 260 000 articles. Le chiffre exact dans le BMJ est de 261 245 articles, soit 9,87 %. Selon les hypothèses sur la fiabilité de l’outil, la proportion réelle se situerait entre 7 et 13 %. Ce phénomène augmente, mais se stabilise : est-ce que éditeurs, rédacteurs, institutions réagissent ?

Les domaines concernés dans le cancer : recherche fondamentale (84 %), traitement (59 %) et dépistage (42 %). Prévention, épidémiologie et santé publique représentent moins de 5 %. Les catégories peuvent se cumuler. Ce sont surtout les cancers gastriques, osseux et hépatiques. Les affiliations chinoises surreprésentées, puis iraniennes, saoudiennes et égyptiennes.

Limites reconnues par les auteurs

Seuls le titre et le résumé sont analysés, pas les données, les images ni le texte intégral. C’est ce qui permet un criblage à grande échelle, mais c’est aussi la principale faiblesse. L’objectif est de mesurer l’ampleur du problème, pas de fournir un outil pour accuser un article en particulier. Une partie des articles frauduleux échappe probablement au modèle, notamment ceux écrits avec l’IA générative. Y-a-t-il un biais selon le pays d’affiliation ?

Perspectives

Le problème est important. Nous vivions avec des hypothèses de 1 à 3 % d’articles inventés dans la littérature. Attendons avant d’adopter 10 %. Mais les paper mills manipuleraient aussi les citations, et donc les facteurs d’impact. Ce n’est qu’une partie du problème car moins d’une expérience sur deux de recherche préclinique en cancérologie serait reproductible. Nous savons que la détection automatique ne suffira pas : elle risque une course sans fin avec les fraudeurs. Il faut agir en amont, en réduisant la pression au nombre de publications, en évaluant la qualité et la reproductibilité, et en rendant le fonctionnement éditorial plus transparent. Est-ce un rêve ?

Partagez cet article sur les réseaux:
Facebook
Twitter
Pinterest
LinkedIn

Un commentaire

  • J’en parle dans mon bouquin, cher Hervé 🙂
    Science, la Citadelle assiégée, Éditions Héliade, p. 177

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Articles populaires

Archives mensuelles
Suivez-nous
Newsletter
Inscrivez-vous à notre newsletter mensuelle

Tags

Vous pourriez aussi aimer