Gestion et partage des données de recherche
- #Science ouverte
Les fondamentaux de la gestion des données
Selon l’OCDE, les données de la recherche sont des enregistrements de type chiffres, textes, images et sons, qui sont utilisés comme source principale pour la recherche scientifique et sont généralement reconnus par la communauté scientifique comme nécessaires pour valider des résultats de recherche. Ainsi, les documents (cahiers de laboratoire, analyses préliminaires, projets de documents scientifiques, communications personnelles…) et les objets matériels (souches bactériennes, animaux de laboratoire…) ne sont pas considérés comme des données de recherche.
La gestion et le partage des données à l’Institut Pasteur
Publiée en 2021, cette politique fixe les lignes directrices de l’Institut Pasteur sur la gestion et le partage des données de la recherche et des codes logiciels. Elle a pour objectif de faciliter le partage et la réutilisation des données et codes logiciels selon les principes FAIR (Findable, Accessible, Interoperable, Reusable).
Elle résume les bonnes pratiques à mettre en œuvre tout au long du processus de recherche et renvoie vers des fiches pratiques qui donnent aux scientifiques les moyens opérationnels de mettre en œuvre ces bonnes pratiques.
Cette politique a été mise en place dans le cadre d’un projet collaboratif et transversal mené par le CeRIS et la plateforme de data management.
Contact : pgd@pasteur.fr
Depuis septembre 2021, les projets financés dans le cadre des programmes incitatifs de l’Institut Pasteur doivent mettre en place un Plan de Gestion des Données (PGD). Trois versions du PGD sont demandées, en début, milieu et fin de projet. Chaque version est relue par l’équipe d’accompagnement PGD (CeRIS et plateforme de data management) qui peut demander des modifications ou des informations complémentaires afin de valider le PGD.
Depuis décembre 2021, lors de l’évaluation quinquennale des entités par le Conseil scientifique, chaque responsable d’entité doit détailler les actions mises en place pour la gestion des données et codes logiciels dans l’entité. Chaque responsable d’entité doit préparer son PGD d’entité en amont de l’évaluation de l’entité.
L’ensemble du personnel de l’Institut Pasteur peut se faire accompagner dans la mise en place des bonnes pratiques de gestion et partage des données par les équipes dédiées : le centre de ressources en information scientifique (CeRIS) et la plateforme de data management.
L’Institut Pasteur et l’Université Paris Cité ont collaboré pour déployer l’atelier de la donnée FAIRDATACité, de façon à renforcer l’accompagnement des scientifiques, en mutualisant les compétences et expertises de chaque partenaire, sur les services suivants :
- Culture de la donnée : sensibilisation et formation
- PGD : anticiper et structurer la gestion des données de recherche
- Appui méthodologique : création, collecte, analyse et traitement
- Stockage et sauvegarde des données froides et tièdes
- Ouverture et partage des données, codes et logiciels
Cet atelier de la donnée s’inscrit dans le cadre de l’écosystème Recherche Data Gouv et plus particulièrement dans le cadre du réseau national des ateliers de la donnée.
Le blog Open science de l'Institut Pasteur, réalisé par les documentalistes du centre de ressources en information scientifique (CeRIS), inclut de nombreux articles sur la gestion et le partage des données et des logiciels : actualités, explications de concepts et conseils pratiques.
Rédiger un plan de gestion des données
Un Plan de Gestion des Données (PGD) ou Data Management Plan (DMP) est un document synthétique qui aide à organiser et anticiper toutes les étapes du cycle de vie de la donnée. Il peut être établi aussi bien dans une optique de partage des données que pour des données en accès restreint ou fermé. Ce document est évolutif et doit être régulièrement mis à jour. Un PGD peut être mis en place pour un projet de recherche ou pour une entité de recherche.
Le PGD de projet permet de :
- Planifier / anticiper : réfléchir en début de projet aux données qui vont être générées ou collectées, aux problématiques juridiques et de sécurité à prendre en compte, aux démarches à effectuer à chaque étape du projet.
- Harmoniser les pratiques : se mettre d’accord entre partenaires sur la façon d’organiser, décrire, stocker, partager les données… Définir qui s’occupe de quoi, quels outils sont utilisés etc.
- Constituer un document de synthèse sur les données du projet : la version finale du PGD, en fin de projet, sert de document de référence qui décrit les données du projet, leur lieu de stockage, leur accessibilité, etc. Il permet ainsi de faciliter la réutilisation des données du projet.
Le PGD d'entité permet de :
- Échanger en équipe sur la façon dont chacun s’organise et gère ses données. Bénéficier de l’expérience des autres sur certains sujets.
- Harmoniser les pratiques : se mettre d’accord sur la façon dont les différents types de données produits ou collectés dans l’entité doivent être gérés, définir des règles et bonnes pratiques : règles de sécurité pour gérer certains types de données sensibles, recommandations sur les formats privilégiés pour conserver et partager ses données, règles quand quelqu’un part de l’entité…
- Constituer un document de référence sur les bonnes pratiques à suivre dans l’entité et ainsi guider les nouveaux arrivants sur la façon de gérer et partager leurs données.
Le CeRIS accompagne les chercheurs de l’Institut Pasteur dans la rédaction de leur PGD, en mettant à leur disposition des documents et en leur proposant de relire et commenter leur PGD.
Pour le PGD de projet : Le CeRIS recommande l’utilisation de l’outil DMP OPIDoR (template "Science Europe - modèle structuré"), en s’aidant des conseils, fiches pratiques et exemples de réponse du template de PGD de projet de l’Institut.
Pour le PGD d’entité : L’Institut Pasteur met à disposition de ses scientifiques un template de PGD d’entité au format Excel.
Nos templates et guides
Partager ses données de recherche via des entrepôts de données
Les entrepôts de données de recherche sont des services en ligne permettant le stockage de données scientifiques et de leurs métadonnées descriptives. Leur objectif premier est de faciliter la diffusion et la découverte des données de la recherche.
Il existe de très nombreux entrepôts de données (plus de 2000 en sciences de la vie d’après Re3data) et ils peuvent être catégorisés selon deux grands types :
- les entrepôts disciplinaires ou thématiques (en imagerie, chimie, neuroscience, protéomique…) ;
- les entrepôts généralistes ou pluridisciplinaires, ouverts à tous types de données.
Première recommandation : chercher en premier lieu s’il existe un entrepôt disciplinaire adapté
1. Chercher si un entrepôt adapté à son type de données ou à sa thématique de recherche est listé parmi les entrepôts recommandés :
- Liste d’entrepôts thématiques de confiance proposée par le Collège des Données de la recherche du Comité pour la science ouverte
- Liste d’entrepôts recommandés par l’organisation européenne ELIXIR pour le dépôt de données biomoléculaires
2. Si la recherche est infructueuse, utiliser les répertoires re3data et FAIRsharing pour trouver un entrepôt adapté.
3. Analyser les caractéristiques de l’entrepôt pour vérifier qu’il répond aux besoins et aux principes FAIR. Pour cela, le CeRIS met à disposition des chercheurs de l’Institut Pasteur une grille d’analyse qui liste les questions à se poser avant de faire son choix.
S’il n’existe pas d’entrepôt disciplinaire adapté : le choix s’oriente vers un entrepôt pluridisciplinaire
Dans ce cas, deux options sont à disposition des chercheurs pasteuriens :
- L’entrepôt OWEY Dataset, essentiellement pour les données volumineuses et/ou les données nécessitant un accès restreint.
- L’espace Institut Pasteur sur l'entrepôt national Recherche Data Gouv, pour les petits jeux de données, non sensibles.
Nos ressources