<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>« Pour commencer, pourriez-vous définir 'données de la recherche' ? » Une tentative de réponse</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Joachim Schöpfel</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Eric Kergosien</string-name>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Hélène Prost</string-name>
        </contrib>
      </contrib-group>
      <fpage>5</fpage>
      <lpage>18</lpage>
      <abstract>
        <p>2. CNRS, INIST, Nancy, membre associé du laboratoire GERiiCO RESUME. Le projet D4Humanities s'inscrit dans le champ des Humanités numériques comment permettre l'exploration des données de la recherche en SHS (corpus textuels ou oraux, données brutes, images…) avec des techniques numériques (text and data mining, cartographie, visualisation…) afin de construire un sens nouveau ? Il s'inscrit dans la continuité des travaux du laboratoire GERiiCO et de ses partenaires à l'Université de Lille Sciences Humaines et Sociales (SCD, ED SHS, ANRT…) avec comme objectif d'accélérer la démarche des données de la recherche notamment par rapport aux doctorants et jeunes chercheurs, et de faciliter le montage d'un projet de recherche international. En particulier, le projet contient trois volets : (1) Pratiques et besoins dans le domaine des données de la recherche (enquête qualitative des comportements, attitudes, motivations et besoins par rapport à la gestion et au partage des données de la recherche) ; (2) workflow pour le dépôt des données des doctorants en SHS (dépôt, préservation et diffusion des données via le service NAKALA de la TGIR Huma-Num) ; (3) recherche sur les données et les thèses (concept et typologie des données en SHS ; évolution des contenus, formats, structures et prescriptions des thèses dans l'environnement de l'Open Science). Le projet sera mené avec l'ISN Oldenburg et d'autres partenaires étrangers ; il facilitera la création d'un consortium et le montage d'un projet de recherche dans les Humanités numériques sur les thèses de doctorat de l'avenir, avec un financement européen (H2020) ou franco-allemand (ANR/DFG). Cette communication présente les grandes lignes de l'étude sur les données de l'axe 3, c'est-à-dire l'analyse du concept de données de la recherche, pour mieux cerner l'identification (granularité), pour mieux comprendre la distinction et les relations entre données primaires et secondaires et pour affiner la catégorisation des données en SHS. L'accent est mis sur une triple approche, conceptuelle, typologique et fonctionnelle.</p>
      </abstract>
      <kwd-group>
        <kwd>MOTS-CLES</kwd>
        <kwd>Données de la recherche</kwd>
        <kwd>humanités numériques</kwd>
        <kwd>open science</kwd>
        <kwd>sciences humaines et sociales</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>1. Laboratoire GERiiCO, Université de Lille
prenom.nom@univ-lille3.fr</p>
    </sec>
    <sec id="sec-2">
      <title>1. Introduction</title>
      <p>
        Les données de la recherche intriguent. Tout le monde en parle. Tout le monde
est d’accord sur l’importance du sujet et sur la nécessité « de faire quelque chose »
et « de se positionner ». Open science oblige. Mais se positionner par rapport à
quoi ? Faire quelque chose, oui, mais avec quoi ? Autant de certitudes sur l’action et
la politique, autant d’approximations sur le concept même des données de la
recherche. D’ailleurs, faut-il dire « les données de la recherche » ou « la donnée de
la recherche » ? En d’autres termes, existe-t-il une définition unique et exhaustive
permettant de faire le lien entre tous les objets désignés par les chercheurs,
informaticiens et bibliothécaires comme « données de la recherche » ? Ou s’agit-il
d’un concept multiple, aux contours flous, une sorte de plus petit dénominateur
commun avec un grand volume de données en formats multiples et flux continu qui
n’ont en commun, outre les « 3V » du Big Data
        <xref ref-type="bibr" rid="ref7 ref8">(volume, variété et vélocité, cf.
Cointot &amp; Eychenne 2014 et Davenport 2014)</xref>
        que le fait de constituer un « vaste
océan d’opportunités » ?
      </p>
      <p>
        Dans le cadre du projet D4Humanities nous poursuivons l’analyse du concept de
données de la recherche, pour mieux cerner l’identification (granularité), pour mieux
comprendre la distinction et les relations entre données primaires et secondaires et
pour affiner la catégorisation des données en SHS. Concrètement, cette étude est
menée entre avril et décembre 2017, par une équipe scientifique de GERiiCO en
partenariat avec plusieurs initiatives et organismes allemands et néerlandais (cf. plus
loin). Il s’agit en premier lieu d’une analyse de dispositifs et d’outils existants, et
également d’exploiter les résultats d’autres recherches, y compris par une nouvelle
analyse de nos propres enquêtes de 2015 sur les données dans les thèses (Schöpfel et
al. 2015) et sur les pratiques et attentes des chercheurs de l’Université de Lille SHS
        <xref ref-type="bibr" rid="ref15 ref19">(Prost &amp; Schöpfel 2015)</xref>
        .
      </p>
      <p>
        Dans nos séminaires, colloques et enquêtes, nous sommes régulièrement
interpellés sur ce point : « Pour commencer, pourriez-vous définir ce que veut dire
‘données de la recherche’ ? » Une bonne question : pouvons-nous les définir ? Que
savons-nous de ces objets à la fois scientifiques, politiques et économiques que sont
les données ? Souvent, nous répondons avec
        <xref ref-type="bibr" rid="ref4">Borgman et al. (2012)</xref>
        que les données,
c’est un concept difficile à définir à cause de leur grande variété, qu’elles fussent
physiques ou numériques. Mais est-ce vraiment satisfaisant ?
      </p>
      <p>
        Selon Chignard (2012, p.10), « tout est donnée ». Dans l’introduction de son
livre Big data, little data, no data, C.
        <xref ref-type="bibr" rid="ref3">Borgman (2015)</xref>
        constate qu’il est impossible
de s’accorder sur une seule définition, en particulier en sciences humaines et
sociales. Certains guides, manuels et présentations omettent tout simplement de
définir leur objet, se limitant à énumérer quelques exemples pour délimiter le
périmètre. Or, ce genre d’absence de consensus sur la définition de concepts-clés est
caractéristique pour des domaines émergents
        <xref ref-type="bibr" rid="ref14 ref9">(De Mauro et al. 2016)</xref>
        mais ne suffit
pas ni pour la curation des données, ni pour la recherche, ni pour la mise en oeuvre
d’une politique raisonnée d’information scientifique et technique.
      </p>
    </sec>
    <sec id="sec-3">
      <title>2. Quelques définitions</title>
      <p>Par rapport aux publications sur le Big Data, De Mauro et al. (2016) évoquent un
concept aussi populaire que nébuleux et un état de l’art chaotique, avec beaucoup de
définitions « implicites » faites d’anecdotes, de success stories, de descriptions,
d’aspects technologiques, de tendances et d’impact sur les organisations et la
société. Sur la base d’une analyse de 1437 articles et communications, De Mauro et
al. proposent une définition consensuelle : « Big Data is the Information asset
characterised by such a High Volume, Velocity and Variety to require specific
Technology and Analytical Methods for its transformation into Value ».</p>
      <p>
        L’idée du « information asset » se retrouve chez
        <xref ref-type="bibr" rid="ref3">Borgman (2015)</xref>
        qui d’une
manière générale définit les données de la recherche comme « inputs, outputs, and
assets of scholarship » (p.4). Les données comme « capital » ou « biens » de la
recherche, à exploiter, analyser, travailler pour en révéler ou extraire une valeur
scientifique ; un « avoir » en amont ou à la base de l’information. C’est une
conception rejoignant l’approche de
        <xref ref-type="bibr" rid="ref5">Chignard (2012)</xref>
        qui voit la donnée comme « un
fait brut, qui n’est pas – encore – interprété » (p.10) ; un matériel à l’état brut que
l’on peut (doit) manipuler, traiter, analyser et interpréter.
      </p>
      <p>L’approche du gouvernement américain va dans le même sens quand il définit
les données de la recherche comme « matériel », c’est-à-dire comme « the recorded
factual material commonly accepted in the scientific community as necessary to
validate research findings » (OMB Circular 1101). En français, dans la traduction de
Pain (2016, p.17) : « Les données de la recherche sont des enregistrements factuels
(chiffres, textes, images et sons) utilisés comme sources principales pour la
recherche scientifique et généralement reconnus par la communauté scientifique
comme nécessaires à la validation des résultats de recherche. » En fait, cette
définition est particulièrement intéressante dans la mesure où elle enrichit le concept
des données comme matériel brut dans quatre directions :


l’enregistrement comme préalable – d’une certaine façon, il s’agit de
l’équivalent de la fixation matérielle d’une idée sur un support comme
préalable de la reconnaissance et protection d’une oeuvre de l’esprit ;
la nature factuelle, malgré la grande diversité des données – mais comme la
Royal Society (2012) précise, il peut s’agir d’une nature factuelle
« supposée » quand elle définit les données de la recherche comme
« qualitative or quantitative statements or numbers that are (or assumed to
be) factual » ;
11 https://www.whitehouse.gov/omb/circulars_a110#36


le lien avec la communauté scientifique – la définition de l’OMB conteste
l’idée d’un concept absolu et établit le lien avec les chercheurs eux-mêmes,
au sens d’un minimum de pratiques, valeurs, méthodes, outils et concepts
partagés ; en d’autres termes, une donnée est ce qui est acceptée par un
groupe de chercheur (« communauté ») comme telle (consensus) ;
et la finalité – les données de la recherche ont une fonction, jouent un rôle
dans le processus scientifique, en particulier pour la validation des
hypothèses et résultats.</p>
      <p>Le lien avec la communauté (ou plutôt les communautés) peut être fondé par un
cadre conceptuel, une thématique ou discipline ; souvent il s’appuiera avant tout sur
un instrument, une procédure ou une méthodologie. Nous y reviendrons dans la
section sur les approches classificatoires.</p>
      <p>
        Le quatrième critère, la finalité, introduit une dimension fonctionnelle, et nous y
reviendrons également un peu plus loin. Ici, soulignons un autre aspect, l’intégration
organique des données dans le processus de recherche. Cet aspect ressort très
clairement dans l’adaptation de la définition américaine par
        <xref ref-type="bibr" rid="ref16">Reymonet (2017)</xref>
        :
« Les données de la recherche sont un ensemble d’informations factuelles
enregistrées sur des supports, produites ou collectées, selon divers procédés au cours
d’un processus de recherche » (p.1).
        <xref ref-type="bibr" rid="ref3">Borgman (2015)</xref>
        ne dit pas autre chose quand
elle décrit les données de la recherche comme « inputs (and) outputs ». Cette
approche accentue le caractère dynamique du concept ; avec les mots d’
        <xref ref-type="bibr" rid="ref1">André
(2015)</xref>
        : « la donnée scientifique est un objet dont les caractéristiques évoluent selon
l’étape du processus de recherche auquel on s’intéresse (…) un objet complexe,
dynamique, vivant » (p.82-83).
      </p>
      <p>
        Les deux aspects, le lien avec la communauté aussi bien que la finalité, mettent
en question toute tentative de définir les données de la recherche dans l’absolu,
comme objets avec des caractéristiques propres, sans relation avec le contexte du
travail scientifique. Il s’agit d’un concept relatif, impossible à comprendre hors
contexte. Cette relativité ou contextualité explique sans doute une partie des
problèmes de l’évaluation des données – en fait, les systèmes de recherche
n’évaluent que la gestion des données (leur description, préservation, diffusion etc.),
mais pas les données elles-mêmes, ni leur volume, ni leur qualité, ni leur pertinence
ou valeur (
        <xref ref-type="bibr" rid="ref20">Schöpfel et al. 2016</xref>
        ).
      </p>
      <p>
        La diversité (« variété ») est un aspect essentiel du concept du Big Data. Cette
diversité se traduit entre autres comme un mélange d’éléments plus ou moins
structurés : « Le big data est la combinaison des informations structurées des bases
de données avec des informations semi-structurées de logs et des informations non
structurées »
        <xref ref-type="bibr" rid="ref7">(Cointot &amp; Eychenne 2014, p.221)</xref>
        . Cet aspect se retrouve dans la
conception des données de la recherche à deux niveaux – dans la description d’un
ensemble de manifestations quantitatives et qualitatives
        <xref ref-type="bibr" rid="ref18">(cf. Royal Society 2012)</xref>
        et
dans les différentes ébauches d’une arborescence ou hiérarchie de données.
      </p>
      <p>
        Cette granularité pose un problème particulier pour la définition mais aussi pour
la curation. Certains catalogues de métadonnées fournissent un niveau et une
spécificité assez bas pour décrire les différents aspects des données et des ensembles
de données
        <xref ref-type="bibr" rid="ref10">(Elbaek et al. 2010)</xref>
        . Le projet-pilote de Rutherford-Appleton
        <xref ref-type="bibr" rid="ref13">(Matthews
et al. 2002)</xref>
        propose un modèle de collection de données avec deux niveaux et trois
éléments différents (figure 1).
Selon ce modèle, chaque collection de données prend la forme d'une hiérarchie ;
une enquête génère une séquence d'ensembles de données logiques et chaque
ensemble de données est instancié via un ensemble de fichiers numériques. Ces
fichiers de données peuvent être des données brutes, des données intermédiaires ou
finales. Ils sont liés par des métadonnées, mais ont des adresses différentes et
peuvent être situés sur différents serveurs. Leur limite globale dépend de l'enquête
initiale. Pourtant, les données ne sont pas des publications, leurs exigences ne sont
pas identiques à celles des publications, elles n'ont pas toujours de limites nettes, et
leurs métadonnées doivent être en mesure de supporter les changements.
      </p>
      <p>
        Le European Plate Observing System (EPOS) définit un autre modèle de
données avec quatre niveaux de données, compatible avec le projet C4D
        <xref ref-type="bibr" rid="ref2">(Bailo &amp;
Jeffery 2014)</xref>
        :



      </p>
      <p>Niveau 0 : données brutes, ou données de base (ex. sismogramme) ;
Niveau 1 : produits de données issus de procédures presque
automatisées (ex. localisation des tremblements de terre) ;
Niveau 2 : produits de données issus des recherches scientifiques (ex.
modèles de la croûte terrestre) ;
</p>
      <p>Niveau 3 : produits de données intégrés issus d'analyses complexes ou
partagées (ex. cartes de risque).</p>
      <p>
        Ces quatre niveaux dépendent explicitement du champ d'investigation (sciences
de l’univers, sismologie) et le lien avec la communauté scientifique et ses
instruments et méthodes est évident. Mais l’arborescence est exemplaire pour deux
raisons – les quatre niveaux peuvent être transposés à d'autres domaines, comme une
sorte de modèle hiérarchique indépendant des domaines ; et ils posent clairement la
question de la définition du concept et de son identification, et ceci d’une manière
très concrète, dans la mesure où le problème de l’attribution d’un identifiant unique
et pérenne (DOI ou autre) ne trouve pas de solution – faut-il attribuer un DOI à une
donnée de niveau 1 ? Ou plutôt de niveau 2 ? Quid des ensembles et produits de
données plus complexes
        <xref ref-type="bibr" rid="ref6">(cf. CODATA 2013)</xref>
        ?
      </p>
      <p>
        Ces questions n’ont que l’apparence technique ; en réalité elles touchent au
concept même des données de la recherche, en particulier en ce qui concerne leur
relation avec la communauté et ses instruments, méthodes et conventions. Cette
relation peut-être assez complexe dans un environnement multi-, inter- ou
transdisciplinaire : « What constitutes data is determined by a given community of
interest that produces the data. However, an investigator may be part of multiple,
overlapping communities of interest, each of which may have different notions of
what are data »
        <xref ref-type="bibr" rid="ref12">(Koltay 2016, p.73)</xref>
        .
      </p>
      <p>Nous retrouverons ce lien dans la section suivante, cette fois-ci sous l’angle des
approches typologiques ou classificatoires. Mais essayons une première
schématisation d’une définition des données de la recherche qui devrait inclure
quatre éléments (figure 2).
les données d’observation ;
les données d’expérimentation ;
les données de simulation ;
les données dérivées ;
les données de référence.</p>
    </sec>
    <sec id="sec-4">
      <title>3. L’approche typologique</title>
      <p>
        Comme les données de la recherche sont difficiles à conceptualiser, leur
définition passe souvent par la description d’exemples : « Data are most often
defined by example, such as facts, numbers, letters and symbols »
        <xref ref-type="bibr" rid="ref3">(Borgman 2015,
p.19)</xref>
        . Des faits et symboles, des chiffres et des lettres – ce que Borgman et ses
collègues citent comme exemples de données, d’autres auteurs transforment en
typologies, avec des approches classificatoires plus ou moins sophistiquées.
      </p>
      <p>Ainsi, André a adapté une classification du Research Information Network en
cinq larges catégories transversales (2015, pp.81-82) :</p>
      <p>
        Ces différents types de données sont davantage liés aux méthodes et outils de la
recherche scientifique qu’aux disciplines et thématiques. Cependant, plus les
approches classificatoires sont détaillées et spécifiques, plus elles révèlent le
caractère disciplinaire de certains types de données. Là où le Research Information
Network a tenté une synthèse en fonction des finalités et procédures de leur
génération
        <xref ref-type="bibr" rid="ref17">(RIN 2008)</xref>
        , le répertoire international re3data propose quatorze types de
données, à partir de l’indexation des bientôt 2000 entrepôts de données référencés
        <xref ref-type="bibr" rid="ref11">(Kindling et al. 2017, cf. figure 3)</xref>
        .
      </p>
      <p>L’indexation par re3data révèle deux caractéristiques des données de la
recherche :</p>
      <p>Une répartition très inégale, avec plusieurs larges catégories,
transversales aux disciplines, présentes dans une grande partie des
domaines scientifiques, aux contours mal définis ; comme les Scientific
and statistical data formats, les Standard office documents, le Plain
text, les Images ou encore les Raw data ;
Une longue traîne d’autres types de données présents dans ces
entrepôts. D’après la catégorie Other, plus d’un tiers des sites indexés
contient d’autres types de données, en dehors des quatorze catégories de
la typologie ; ou bien sans correspondance avec la définition de ces
catégories.</p>
      <p>
        Le rapprochement avec les disciplines montre que certains types de
données sont surreprésentés, comme Standard office documents, Plain
text et Images en SHS
        <xref ref-type="bibr" rid="ref11">(Kindling et al. 2017)</xref>
        . Mais avec une taille
d’effet relativement faible, la réalité et la portée de cette observation
restent à démontrer.
      </p>
      <p>Nos propres études sur le campus de l’Université de Lille 3 confirment une
typologie propre aux sciences humaines et sociales mais illustrent surtout l’intérêt
d’une distinction entre données primaires (sources) et secondaires (résultats), avec
une classification différente (figure 4).
La correspondance entre nos catégories et la typologie de re3data est imparfaite.
Les différences sont certainement dues à la finalité (description du contenu des
entrepôts de données vs. étude des pratiques des chercheurs) et l’approche
méthodologique (indexation vs. enquête).</p>
      <p>La correspondance entre ces catégories et les disciplines est forte, sans que l’on
puisse parler de données spécifiques aux disciplines. Les analyses attestent
davantage de profils disciplinaires pour les différents types de données, voire de
profils de données pour certaines disciplines (cf. Schöpfel et al. 2015).</p>
    </sec>
    <sec id="sec-5">
      <title>4. L’approche fonctionnelle</title>
      <p>Nous avons évoqué plus haut un triple désir scientifique, politique et
économique. Quelles sont les fonctions associées ? Et comment peuvent être
définies les données de la recherche selon ces finalités ?</p>
      <p>
        Concernant la production scientifique, les données ont un rô le central quelque
soit les disciplines. De plus en plus, les chercheurs ont besoin de disposer de grandes
masses de données, à cô té de données de dimensions plus modestes, pour explorer,
visualiser et comparer et/ou vérifier des résultats, valider des hypothè ses : « the
recorded factual material commonly accepted in the scientific community as
necessary to validate research findings. » (OMB Circular 110)2, voir en formuler de
nouvelles. Au regard du cycle de vie des données, les données de la recherche
peuvent être catégorisées de la façon suivante : « les données préliminaires ou
données préparatoires (exclues dans un contexte de diffusion) ; les données brutes
(données acquises lors du processus de recherche et déjà potentiellement traitées) ;
et enfin les données traitées et analysées : c'est-à-dire ayant subi une transformation
telle qu'il n'est plus possible d'accéder aux données brutes, un graphique par
exemple »
        <xref ref-type="bibr" rid="ref14">(Pain 2016, p.18)</xref>
        (cf. figure 5).
      </p>
      <p>
        Pour répondre à l’objectif d’accès aux données de la recherche, des accords
successifs ont vu le jour. A la suite de plusieurs mouvements de chercheurs visant à
l’ouverture de corpus de données scientifiques, la déclaration internationale sur le
libre accès de Budapest (Budapest Open Access Initiative) propose le 14 février
2002 une première définition de l’Open data3. Aujourd’hui le terme d’Open data est
réservé à l’ouverture des données obtenues sur fonds publics en général. De
nombreuses autres initiatives suivent, comme la Déclaration de Berlin de 2003 sur le
libre accès à la connaissance dans toutes les sciences. En février 2012, le texte de la
Déclaration de Berlin avait été signé par plus de 360 universités ou assimilées. Pour
les chercheurs, cette mouvance de l’open data a deux objectifs principaux, la
réutilisation des données de la recherche et la possibilité de garantir la qualité
scientifique d’une hypothèse en la justifiant par les données qui en sont à la source.
2https://www.whitehouse.gov/omb/circulars_a110#36
3 http://www.budapestopenaccessinitiative.org/
renforcer la démocratie (transparence, concertation, implication des
citoyens) ;
soutenir l’innovation économique et sociale, favoriser l’émergence d’un
environnement propice à la croissance économique ;
rendre l’action publique plus efficace (décloisonnement et adoption de
stratégies fondées sur la donnée), notamment pour l’aide à la prise de
décision pour l’évaluation et le bon fonctionnement des services
        <xref ref-type="bibr" rid="ref5">(Chignard 2012)</xref>
        .
      </p>
      <p>Au regard de ces finalités, les politiques valorisant l’ouverture des données
publiques n’ont pas les mêmes objectifs que celles du partage des données
scientifiques. Dans ce sens, il serait utile de différencier données scientifiques et
données publiques, comme le précise le comité éthique du CNRS (COMETS)4. Les
données scientifiques produites sur des fonds publics ont dans la majorité des cas
vocation à devenir publiques. Les données publiques ont vocation à devenir
scientifiques lorsqu’elles concernent l’environnement, le climat, la santé ou encore
l’aménagement du territoire. Parmi les nombreux exemples existants, les données
disponibles sur le portail de la métropole européenne de Lille (MEL)5, notamment
les données géolocalisées, sont utilisées par les chercheurs du projet BiblioMEL
pour l’analyse des pratiques des citoyens dans et à l’extérieur des bibliothèques6. A
noter qu’en France, c’est le service Etalab qui gère l’Open data public sous l’autorité
du Premier ministre, avec pour mission de communiquer les données
subventionnées sur fonds public avec mise à disposition libre et (quasi) gratuite.</p>
      <p>Sur le point de vue économique, pour de nombreux services de l’Etat, ainsi que
pour le secteur privé, les données créées dans le cadre d’activités ont une forte
valeur lorsqu’elles sont ensuite régulièrement réutilisées, comme le précisent les
auteurs de l’étude de l’US National Research Council, intitulée Bits of Power7 : « La
valeur des données réside dans leur exploitation. L’accès total et ouvert aux données
scientifiques devrait devenir la norme internationale pour l’échange des données
scientifiques issues de la recherche financée sur fonds publics. » Pour les
organismes de recherche mais surtout pour les autorités politiques nationales et
européennes, l’ouverture des données scientifiques a, du point de vue économique,
deux finalités majeures :


optimiser la recherche (réduction de la recherche redondante, nouvelles
recherches sans collecte de données etc.) ;
accélerer l’innovation industrielle notamment dans le domaine de la
santé (traitement et prévention contre Zika ou Ebola etc.) et de
l’environnement.</p>
      <p>
        Une autre fonction est liée au concept du Big Data : « l’association dans une
même analyse de données variées pour en déduire des informations que l’on n’était
pas en mesure de trouver avec les analyses classiques de données structurées (…)
souvent pour prendre une action en temps réel »
        <xref ref-type="bibr" rid="ref7">(Cointot &amp; Eychenne 2014, p.221)</xref>
        .
En d’autres mots, la gestion et mise à disposition des données scientifiques peuvent
faciliter l’émergence de nouvelles formes d’analyses, avec des résultats novateurs,
4http://www.cnrs.fr/comets/IMG/pdf/2015-05_avis-comets-partage-donnees-scientifiques2.pdf
5 https://opendata.lillemetropole.fr/page/home/
6 https://bibliomel.hypotheses.org
7 https://www.nap.edu/read/5504/chapter/1
du simple fait de leur masse (volume) et leur diversité (variété), peut-être aussi (mais
pas nécessairement) leur interopérabilité.
      </p>
    </sec>
    <sec id="sec-6">
      <title>5. Conclusion</title>
      <p>La suite de notre étude sera l’intégration de ces trois approches en un seul
modèle, avec une définition qui non seulement fera le lien entre concepts, typologies
et fonctions mais déterminera aussi les limites et questions ouvertes, en particulier
dans le domaine des sciences humaines et sociales. Cette étude sera menée entre
avril et décembre 2017 en partenariat avec l’Université Humboldt de Berlin (projet
eDissPlus8), le Karlsruhe Institut of Technology (projet bwDataDiss9), la Bielefeld
University (projet CONQUAIRE) et le service DANS aux Pays Bas. Il s’agit en
premier lieu d’une analyse de dispositifs et d’outils existants et d’exploiter les
résultats d’autres recherches, y compris par une nouvelle analyse de nos propres
résultats de 2015 (données dans les thèses, enquête sur le campus de l’Université de
Lille SHS). L’analyse s’appuiera notamment sur les 480 archives avec des données
SHS répertoriées par re3data10 et sur les travaux de CODATA11, DataCite12,
DARIAH13 et CESSDA14. L’objectif est de conceptualiser plus finement le terme de
données de la recherche dans le champ des SHS, par une définition aussi bien que
par une description des principaux types et niveaux de données et une
problématisation de la distinction entre données primaires et secondaires. L’enjeu
d’une telle définition est double : contribuer à une meilleure compréhension des
données de la recherche, et contribuer à une meilleure prise en charge, aussi bien au
niveau des chercheurs et leurs équipes qu’au niveau des laboratoires, établissements
et organismes.
8 https://www2.hu-berlin.de/edissplus/
9 https://bwdatadiss.kit.edu/
10 http://www.re3data.org/
11 http://www.codata.org/
12 https://www.datacite.org/
13 https://datacite.hypotheses.org/
14 http://cessda.net/</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>André F.</surname>
          </string-name>
          (
          <year>2015</year>
          ). Déluge des données de la recherche ? In L. Calderan,
          <string-name>
            <given-names>P.</given-names>
            <surname>Laurent</surname>
          </string-name>
          ,
          <string-name>
            <given-names>H.</given-names>
            <surname>Lowinger</surname>
          </string-name>
          , and J.
          <string-name>
            <surname>Millet</surname>
          </string-name>
          (Eds.),
          <article-title>Big data : nouvelles partitions de l'information</article-title>
          .
          <source>Actes du Séminaire IST Inria</source>
          , octobre
          <year>2014</year>
          , pp.
          <fpage>77</fpage>
          -
          <lpage>95</lpage>
          .
          <article-title>Louvain-la-</article-title>
          <string-name>
            <surname>Neuve: De Boeck; ADBS.</surname>
          </string-name>
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <given-names>Bailo D.</given-names>
            and
            <surname>Jeffery</surname>
          </string-name>
          <string-name>
            <surname>K. G.</surname>
          </string-name>
          (
          <year>2014</year>
          ).
          <article-title>EPOS: a novel use of CERIF for data intensive science</article-title>
          .
          <source>In CRIS2014: 12th International Conference on Current Research Information Systems</source>
          ,
          <volume>13</volume>
          -
          <fpage>15</fpage>
          May
          <year>2014</year>
          , Rome.
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Borgman C. L.</surname>
          </string-name>
          (
          <year>2015</year>
          ).
          <article-title>Big data, little data, no data: scholarship in the networked world</article-title>
          . Cambridge MA: The MIT Press.
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <given-names>Borgman C. L.</given-names>
            ,
            <surname>Wallis</surname>
          </string-name>
          <string-name>
            <given-names>J. C.</given-names>
            , and
            <surname>Mayernik</surname>
          </string-name>
          <string-name>
            <surname>M. S.</surname>
          </string-name>
          (
          <year>2012</year>
          ).
          <article-title>Who's got the data? Interdependencies in science and technology collaborations</article-title>
          .
          <source>Computer Supported Cooperative Work (CSCW) 21 (6)</source>
          ,
          <fpage>485</fpage>
          -
          <lpage>523</lpage>
          . https://doi.org/10.1007/s10606-012-9169-z
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Chignard S.</surname>
          </string-name>
          (
          <year>2012</year>
          ).
          <article-title>Open data : comprendre l'ouverture des données publiques</article-title>
          .
          <source>Limoges: Fyp éd.</source>
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>CODATA-ICSTI Task</surname>
          </string-name>
          <article-title>Group on Data Citation Standards and Practices (</article-title>
          <year>2013</year>
          ).
          <article-title>Out of cite, out of mind: The current state of practice, policy, and technology for the citation of data</article-title>
          .
          <source>Data Science Journal</source>
          <volume>12</volume>
          ,
          <fpage>CIDCR1</fpage>
          -
          <lpage>CIDCR75</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>Cointot J.-C</surname>
          </string-name>
          . and
          <string-name>
            <surname>Eychenne</surname>
            <given-names>Y.</given-names>
          </string-name>
          (
          <year>2014</year>
          ).
          <article-title>La révolution Big Data : les données au coeur de la transformation de l'entreprise</article-title>
          . Paris: Dunod.
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <surname>Davenport</surname>
            <given-names>T. H.</given-names>
          </string-name>
          (
          <year>2014</year>
          ).
          <article-title>Stratégie Big Data</article-title>
          . Paris: Pearson.
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>De Mauro</surname>
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Greco</surname>
            <given-names>M.</given-names>
          </string-name>
          , and
          <string-name>
            <surname>Grimaldi</surname>
            <given-names>M.</given-names>
          </string-name>
          (
          <year>2016</year>
          ).
          <article-title>A formal definition of big data based on its essential features</article-title>
          .
          <source>Library Review</source>
          <volume>65</volume>
          (
          <issue>3</issue>
          ),
          <fpage>122</fpage>
          -
          <lpage>135</lpage>
          . http://dx.doi.org/10.1108/LR-06-2015- 0061
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <string-name>
            <surname>Elbaek</surname>
            <given-names>M. K.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sandfaer</surname>
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>and Simons E.</surname>
          </string-name>
          (
          <year>2010</year>
          ).
          <article-title>CRIS/OAR interoperability workshop</article-title>
          .
          <source>In CRIS 2010: 10th International Conference on Current Research Information Systems</source>
          ,
          <volume>2</volume>
          -
          <fpage>5</fpage>
          June 2010, Aalborg.
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <string-name>
            <surname>Kindling</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <given-names>H.</given-names>
            <surname>Pampel</surname>
          </string-name>
          , S. van de Sandt, J. Rücknagel,
          <string-name>
            <given-names>P.</given-names>
            <surname>Vierkant</surname>
          </string-name>
          , G. Kloska,
          <string-name>
            <given-names>M.</given-names>
            <surname>Witt</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P.</given-names>
            <surname>Schirmbacher</surname>
          </string-name>
          ,
          <string-name>
            <given-names>R.</given-names>
            <surname>Bertelmann</surname>
          </string-name>
          , and
          <string-name>
            <given-names>F.</given-names>
            <surname>Scholze</surname>
          </string-name>
          (
          <year>2017</year>
          ).
          <article-title>The landscape of research data repositories in 2015: A re3data analysis</article-title>
          .
          <source>D-Lib Magazine</source>
          <volume>23</volume>
          (
          <issue>3</issue>
          /4). http://www.dlib.org/dlib/march17/kindling/03kindling.html
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          <string-name>
            <surname>Koltay</surname>
            <given-names>T.</given-names>
          </string-name>
          (
          <year>2016</year>
          ).
          <article-title>Digital research data</article-title>
          . In D. Baker and
          <string-name>
            <given-names>W.</given-names>
            <surname>Evans</surname>
          </string-name>
          (Eds.),
          <source>Digital Information Strategies</source>
          , pp.
          <fpage>71</fpage>
          -
          <lpage>84</lpage>
          . Oxford: Chandos Publishing.
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          <string-name>
            <surname>Matthews</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>M. D. Wilson</surname>
            , and
            <given-names>K.</given-names>
          </string-name>
          <string-name>
            <surname>Kleese Van Dam</surname>
          </string-name>
          (
          <year>2002</year>
          ).
          <article-title>Accessing the outputs of scientific projects</article-title>
          .
          <source>In CRIS2002: 6th International Conference on Current Research Information Systems (Kassel, August 29-31</source>
          ,
          <year>2002</year>
          ). http://dspacecris.eurocris.org/handle/11366/149
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          <string-name>
            <surname>Pain</surname>
            <given-names>M.</given-names>
          </string-name>
          (
          <year>2016</year>
          ).
          <article-title>Les données de la recherche et leurs entrepôts, de la documentation à la réutilisation: étude de cas pour l'archive HAL</article-title>
          . Mémoire de Master. Enssib, Villeurbanne. https://memsic.ccsd.cnrs.fr/mem_01374509
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          <string-name>
            <given-names>Prost H.</given-names>
            ,
            <surname>Schöpfel</surname>
          </string-name>
          <string-name>
            <surname>J.</surname>
          </string-name>
          ,
          <year>2015</year>
          .
          <article-title>Les données de la recherche en SHS</article-title>
          .
          <article-title>Une enquête à l'Université de Lille 3</article-title>
          . Rapport final. Université de Lille 3,
          <string-name>
            <surname>Villeneuve</surname>
            <given-names>d</given-names>
          </string-name>
          'Ascq. http://hal.univlille3.fr/hal-01198379v1
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          <string-name>
            <surname>Reymonet N.</surname>
          </string-name>
          (
          <year>2017</year>
          ).
          <article-title>Améliorer l'exposition des données de la recherche : la publication de data papers</article-title>
          . Université Paris Diderot. https://archivesic.ccsd.cnrs.fr/sic_01427978
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          <string-name>
            <surname>RIN</surname>
          </string-name>
          (
          <year>2008</year>
          ).
          <article-title>Stewardship of digital research data: a framework of principles and guidelines</article-title>
          . Research Information Network, London. http://www.rin.ac.uk/our-work/datamanagement-and
          <article-title>-curation/stewardship-digital-research-data-principles-and-guidelines</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          <string-name>
            <given-names>Royal</given-names>
            <surname>Society</surname>
          </string-name>
          (
          <year>2012</year>
          ).
          <article-title>Science as an open enterprise</article-title>
          .
          <source>Summary report. The Royal Society Science Policy Centre</source>
          , London, https://royalsociety.org/~/media/policy/projects/sape/2012-06-20
          <string-name>
            <surname>-</surname>
          </string-name>
          saoe-summary.pdf
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          <string-name>
            <given-names>Schöpfel J.</given-names>
            ,
            <surname>Prost</surname>
          </string-name>
          <string-name>
            <given-names>H.</given-names>
            , and
            <surname>Malleret</surname>
          </string-name>
          <string-name>
            <surname>C.</surname>
          </string-name>
          (
          <year>2015</year>
          ).
          <article-title>Making data in PhD dissertations reusable for research</article-title>
          .
          <source>In 8th Conference on Grey Literature and Repositories, National Library of Technology (NTK)</source>
          ,
          <source>21 October</source>
          <year>2015</year>
          , Prague. http://hal.univ-lille3.fr/hal-01248979
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          <string-name>
            <given-names>Schöpfel J.</given-names>
            ,
            <surname>Prost</surname>
          </string-name>
          <string-name>
            <given-names>H.</given-names>
            , and
            <surname>Rebouillat</surname>
          </string-name>
          <string-name>
            <surname>V.</surname>
          </string-name>
          ,
          <year>2016</year>
          .
          <article-title>Research data in current research information systems</article-title>
          .
          <source>In: CRIS 2016: 13th International Conference on Current Research Information Systems</source>
          ,
          <volume>8</volume>
          -
          <fpage>11</fpage>
          June 2016,
          <string-name>
            <given-names>St</given-names>
            <surname>Andrews</surname>
          </string-name>
          . http://dspacecris.eurocris.org/handle/11366/501
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>