Depuis plusieurs années, diverses méthodes d’analyse bibliométrique m’aident dans mes activités terminologiques et conceptuelles. La découverte de bibliometrix (Aria & Cuccurullo, 2017 ; Aria et al., 2026), notamment grâce à son interface graphique et intuitive biblioshiny, a considérablement simplifié mon travail. Ce paquet R permet d’effectuer rapidement et facilement de nombreuses analyses sur un corpus de références bibliographiques. Les données peuvent être exportées, si besoin, dans des formats compatibles avec les tableurs. Les graphiques générés peuvent aussi être téléchargés, par exemple, pour les intégrer dans une publication, avec même la possibilité de personnaliser la résolution et la taille des images. La création de rapports d’analyses est aussi offerte.
L’application, gratuite, intègre, depuis peu, des outils d’intelligence artificielle pour faciliter l’interprétation des résultats. Ses développeurs semblent vraiment avoir le souci d’aider l’utilisateur pour lui faciliter la vie au cours de ses travaux de cartographie scientifique. Cerise sur le gâteau, Bibliometrix bénéficie de l’ensemble de l’environnement R, qui comprend des milliers d’autres bibliothèques, élargissant ainsi ses possibilités.
Privé, désormais, d’accès aux principales bases bibliographiques généralistes et commerciales, comme le Web of Science et Scopus, je me suis tourné, contraint et forcé, vers OpenAlex pour réaliser ces travaux bibliométriques. Lancée en 2022, cette base de données est généralement présentée comme étant ouverte et gratuite. Cependant, l’accès à certaines fonctionnalités nécessite un abonnement, tout spécialement pour un usage premium de la ressource.
OpenAlex est saluée pour sa couverture documentaire plus large que d’autres bases bibliographiques concurrentes, notamment dans les domaines des sciences humaines et sociales, ainsi que pour sa plus grande diversité linguistique. Cependant, les données présentes dans la base ne sont pas toujours précises et exemptes de biais (Cicero & Sarlo, 2026 ; Céspedes et al., 2025, Forchino & Torres-Salinas, 2026 ; Maddi et al., 2024).
La base OpenAlex est compatible avec bibliometrix. Mais peut-on réaliser toutes les analyses qui étaient possibles avec les bases commerciales citées plus haut ? Le contenu et les métadonnées de la base peuvent-ils brouiller, parfois, l’interprétation des résultats ?
Pour répondre à ces questions, j’ai importé un corpus OpenAlex avec biblioshiny (version 5.5.0 de bibliometrix). Deux méthodes sont possibles pour réaliser cette étape : télécharger un corpus depuis OpenAlex puis l’importer, ou interroger la base de données directement via son API (Application Programming Interface) grâce à l’interface graphique de biblioshiny. J’ai opté ici pour cette deuxième solution. La Figure 1, ci-dessous, illustre l’interface et les différentes options d’interrogation. Il faut noter qu’OpenAlex, sauf erreur de ma part, ne gère pas la troncature ni les opérateurs de proximité. J’ai désactivé la lemmatisation.

Après le téléchargement et l’importation des données, Biblioshiny présente un rapport sur l’exhaustivité des métadonnées du corpus (Figure 2). Les résultats indiquent que les informations essentielles (type de document, langue, année de publication, titre, citation totale) sont parfaitement renseignées. D’autres métadonnées sont plus critiques. Près de la moitié des références du corpus ne disposent pas de résumé, pénalisant ainsi les analyses qu’il est possible de réaliser sur ce champ. De même, environ un quart du corpus ne dispose pas de citations de références.

Compte tenu de ces résultats, Biblioshiny déconseille de lancer certaines méthodes bibliométriques (Figure 3). J’ai néanmoins pu mener l’analyse de la spectroscopie des références (Figure 4), qui identifie les références historiques et importantes du domaine, à lire en priorité et à citer (voir l’article sur le blog pour plus de détails sur cette méthode). La pertinence du résultat dépend évidemment de l’exhaustivité des références citées dans le corpus.
De plus, l’inspection visuelle du corpus téléchargé révèle des références bibliographiques en double, en triple, voire en quadruple exemplaire. Les statistiques obtenues doivent donc être interprétées avec prudence.


Un problème récurrent dans les corpus OpenAlex se retrouve ici. Parmi les dix sources générant le plus de références, PubMed, base de données bibliographiques en santé, arrive en tête (voir Tableau 1). Elle est donc assimilée à un journal scientifique ! Dans d’autres corpus, des entrepôts de données ou des archives de prépublication figurent souvent parmi les dix premières sources.
| Source | Nombre de documents |
|---|---|
| PUBMED | 59 |
| JOURNAL OF NEUROSCIENCE | 41 |
| SCIENCE | 25 |
| NEURON | 24 |
| NEUROBIOLOGY OF LEARNING AND MEMORY | 23 |
| PROCEEDINGS OF THE NATIONAL ACADEMY OF SCIENCES | 22 |
| CURRENT BIOLOGY | 20 |
| HIPPOCAMPUS | 18 |
| ELSEVIER EBOOKS | 15 |
| ADVANCES IN NEUROBIOLOGY | 14 |
De manière générale, j’ai pu lancer les analyses bibliométriques que j’utilise habituellement sur un corpus (et qui n’épuisent pas toutes les possibilités de bibliometrix, loin de là) : évolution de la production scientifique, co-citations, statistiques diverses sur les sources et les auteurs, spectroscopie des références, carte thématique, évolution thématique, réseau de mots clés, réseau des collaborations, collaborations entre pays, etc.
Cependant, la politique de moissonnage d’OpenAlex, sans apparemment de véritable curation en amont, génère du bruit informationnel. Le travail de nettoyage est finalement reporté sur l’utilisateur final s’il veut exploiter au mieux un corpus constitué à partir du contenu de cette base : c’est le prix à payer pour bénéficier de l’accès gratuit à cette immense répertoire de documents scientifiques en ligne. Mais souhaitons qu’OpenAlex connaisse un destin plus favorable que celui de son ancêtre, la bibliothèque d’Alexandrie, dont elle tire son nom.
Références citées
- Aria, M., & Cuccurullo, C. (2017). bibliometrix: An R-tool for comprehensive science mapping analysis. Journal of Informetrics, 11(4), 959–975. https://doi.org/10.1016/j.joi.2017.08.007
- Aria, M., Cuccurullo, C., D’Aniello, L., & Spano, M. (2026). Biblioshiny and the SAAS Workflow: An integrated framework for transparent and reproducible science mapping. A demonstration through the replication of a study. Journal of Informetrics, 20(3), 101837. https://doi.org/10.1016/j.joi.2026.101837
- Céspedes, L., Kozlowski, D., Pradier, C., Sainte‐Marie, M. H., Shokida, N. S., Benz, P., Poitras, C., Ninkov, A. B., Ebrahimy, S., Ayeni, P., Filali, S., Li, B., & Larivière, V. (2025). Evaluating the linguistic coverage of OpenAlex: An assessment of metadata accuracy and completeness. Journal of the Association for Information Science and Technology, 76(6), 884–895. https://doi.org/10.1002/asi.24979
- Cicero, T., & Sarlo, S. (2026). Beyond traditional metrics: Assessing OpenAlex and Scopus for SSH research evaluation. Journal of Information Science, 52(4), 1200–1212. https://doi.org/10.1177/01655515251411204
- Forchino, M. V., & Torres-Salinas, D. (2026). The OpenAlex database in review: Evaluating its applications, capabilities, and limitations. Journal of Informetrics, 20(2), 101800. https://doi.org/10.1016/j.joi.2026.101800
- Maddi, A., Maisonobe, M., & Zeghmouri, C. B. (2024). Geographical and disciplinary coverage of open access journals: OpenAlex, scopus and WoS. SocArXiv. https://doi.org/10.31235/osf.io/8wa4q
Crédit photo
Ashkan Ala via Unsplash