Glossaire

Format d’identifiant créé en 2001 par la California Digital Library (CDL) qui a vocation à identifier des ressources physiques, numériques ou même immatérielles (concepts). Son but est de fournir des identifiants adaptés aux besoins des producteurs et diffuseurs de données sur le web, mais également capables de durer sur le long terme.

Interface logicielle qui permet :

  • d’accéder aux fonctions d’une application et de développer de nouvelles applications utilisant ces fonctions
  • et/ou l’échange de données entre applications

Identifiant international régi par la norme ISO 26324, à la fois mécanisme de nommage des ressources et protocole de résolution des identifiants en adresses plus concrètes. Il identifie de manière univoque toute ressource stable, et en particulier de ressources numériques comme des articles scientifiques ou des rapports. L’attribution d’un DOI est le fait d’agences d’enregistrement : CrossRef pour les DOI des publications et DataCite pour les DOI des données scientifiques et des produits de la recherche (l’INIST est l’agence française des DOI DataCite).

Un dump de données est une copie complète ou partielle d’une base de données, mise à disposition sous forme de fichiers téléchargeables.

Contrairement aux API, qui permettent d’accéder aux données au cas par cas, un dump permet de récupérer un grand volume de données en une seule fois.

Dans les données de la BnF

La BnF propose plusieurs dumps de données, notamment :

  • notices bibliographiques ;

  • autorités ;

  • données RDF ;

  • produits bibliographiques mensuels.

Ces fichiers peuvent être disponibles en formats comme :

  • UNIMARC

  • XML

  • RDF

  • CSV

IIIF est un standard permettant d’accéder et de manipuler des images numériques haute définition à distance

Dans les données de la BnF
IIIF est utilisé notamment dans Gallica pour diffuser :

  • manuscrits

  • livres numérisés

  • estampes

  • cartes

IFLA LRM est un modèle conceptuel de données bibliographiques élaboré par l’International Federation of Library Associations and Institutions (IFLA).
Il sert à décrire de manière structurée les œuvres, les auteurs et les documents dans les catalogues de bibliothèques.

LRM constitue aujourd’hui le modèle de référence international pour l’organisation des données bibliographiques et remplace les modèles plus anciens comme FRBR.

Dans les données de la BnF

IFLA LRM sert de base :

  • à la transition bibliographique ;

  • à l’évolution des formats bibliographiques ;

  • au développement de modèles compatibles avec le Web sémantique.

Il influence notamment :

  • RDA-FR

  • les futurs modèles de catalogage

  • les données liées de type RDF.

Identifiant international normalisé régi par la norme ISO 2108. Il permet d’identifier de manière univoque une monographie quel qu’en soit le support de publication : imprimé ou multimédia. En France, l’ISBN est attribué par l’Agence Francophone pour la Numérotation Internationale du Livre (AFNIL).

Identifiant international normalisé régi par la norme ISO 3297 : 2017. Il permet d’identifier de manière univoque et non ambiguë toute publication en série. L’e-ISSN s’applique plus spécifiquement aux publications numériques. Il est attribué pour les publications françaises par le Centre ISSN-France.

Modèle de représentation des données rattachées à des objets, s’appuyant sur une formalisation très légère. Il est tout particulièrement adapté au stockage et aux transferts de données. 

Le mapping des données consiste à mettre en correspondance les champs de plusieurs bases de données. C’est la première étape pour faciliter la migration puis l’intégration des données d’un SIGB à un autre.

OAI-PHM (Open Archives Initiative – Protocol for Metadata Harvesting) est un protocole créé pour la collecte de métadonnées de l’initiative pour les Archives ouvertes. Il repose sur une communication de client à serveur. Le client envoie des requêtes au serveur en http, le serveur répond par un flux de données en XML

Une ontologie est un modèle de données contenant les concepts d’un domaine et leurs relations, dans un langage adapté aux machines. L’ontologie RDA-FR permet de définir les règles qui vont structurer l’information contenu dans les notices et qui seront ensuite comprises et utilisées par les programmes informatiques. D’autres ontologies existent : SKOS (thésaurus), FOAF (personnes)…

RDF est un modèle de données utilisé pour décrire des informations sous forme de relations entre des ressources, selon le principe des triplets : sujet – prédicat – objet.
Dans les données de la BnF
RDF est utilisé notamment dans data.bnf.fr, où les auteurs, œuvres et sujets sont reliés entre eux via des identifiants uniques.

SPARQL est un langage permettant d’interroger des données structurées en RDF

Dans les données de la BnF
SPARQL permet d’interroger les données de data.bnf.fr pour extraire des informations sur :

  • auteurs

  • œuvres

  • sujets

  • lieux

Un SIGB (système intégré de gestion de bibliothèque) est un logiciel qui permet de gérer de manière informatique et intégrée le fonctionnement d’une bibliothèque. Le même outil permet d’acquérir, de cataloguer, de diffuser (catalogue), de gérer toutes les opérations de prêt, réservations incluses.Il permet également de gérer les documents de l’entrée à la sortie des fonds et de produire des indicateurs statistiques. Ces différentes activités sont généralement organisées en modules intégrés au sein d’un même logiciel. Malgré son nom,certaines activités restent hors périmètre, par exemple la gestion du planning ou la bibliothèque numérique. Le SIGB est alors complété par des outils (briques) avec lesquels il peut éventuellement communiquer.

Le protocole SRU (Search/Retrieval via URL) est basé sur l’usage d’URLs. Il utilise techniquement le protocole de communication client/serveur HTTP (HyperText Transfer Protocol) en mode GET ou en mode POST. Son protocole jumeau SRW (Search/Retrieve Web service est quant à lui basé, non pas sur l’usage d’URLs mais sur l’offre de web services faisant transiter les requêtes http encapsulées dans un format xml. Il utilise le protocole de communication SOAP (Simple Object Access Protocol).

UNIMARC est un format bibliographique utilisé pour décrire les documents dans les catalogues de bibliothèques.
Dans les données de la BnF
UNIMARC est le format principal de diffusion des notices bibliographiques.

Le Web sémantique est une extension du Web qui permet aux données d’être structurées et compréhensibles par des machines, afin de pouvoir être reliées, interrogées et réutilisées automatiquement.

Contrairement au Web classique, centré sur des documents (pages web), le Web sémantique est centré sur des données reliées entre elles.

Dans les données de la BnF

Le Web sémantique est utilisé notamment dans data.bnf.fr, où :

  • auteurs, œuvres et sujets sont reliés entre eux ;

  • chaque entité possède un identifiant stable ;

  • les données peuvent être interrogées et réutilisées.

Famille de langages à balises initiée par Tim Bray, alliant rigueur et lisibilité pour les humains. Les différents formats XML sont généralement définis par des règles contenues dans des DTD ou des XML Schemas : quelles balises sont autorisées, quel est leur contenu, peuvent-elles être répétées… Pour le stockage et les transferts de métadonnées, cette structuration permet une meilleure fiabilité, c’est pourquoi XML est choisi fréquemment comme format pivot. Mais attention il y a XML (les formats reconnus, Dublin Core, TEI, EAD, METS…) et XML (obscur format maîtrisé par le seul prestataire d’un logiciel avec des “exports XML”).

Z39.50 est un protocole informatique permettant d’interroger à distance des catalogues de bibliothèques et de récupérer des notices bibliographiques dans des formats normalisés (comme UNIMARC ou MARC21).

Il permet à un logiciel documentaire (par exemple un SIGB) de rechercher automatiquement des notices dans le catalogue d’une autre institution.

Dans les données de la BnF

Le protocole Z39.50 est utilisé pour :

  • récupérer des notices du Catalogue général de la BnF ;

  • alimenter des catalogues locaux ;

  • automatiser le catalogage.

Catalogage

Catalogage

Description bibliographique d’un document, par la saisie des données descriptives utiles à son identification selon une structuration définie selon les prescriptions de normes nationales ou internationales, par exemple la norme ISBD (description bibliographique internationale normalisée) pour l’élaboration des notices bibliographiques.

Ensemble des opérations relatives aux documents réalisées dans une structure donnée (bibliothèque, etc.) : acquisition, réception, traitement documentaire, équipement, mise en rayon, désherbage.

Ensemble de règles de catalogage à valeur normative : le code RDA-FR, inscrit dans la logique du modèle IFLA-LRM, a vocation à remplacer les différentes normes Afnor en vigueur. Il est la transposition française du code RDA (Resource Description and Access) code de catalogage anglo-saxon à vocation internationale paru en 2010 et révisé en 2019.

Méthode qui permet d’identifier et de supprimer les doublons non souhaités présents dans une liste, un fichier, une base de données. Dans les catalogues, les doublons sont constitués de plusieurs enregistrements décrivant une même entité (document, notice bibliographique, notice autorité, etc.). Le dédoublonnage se traduit par exemple par la fusion des enregistrements identifiés, la suppression de l’un d’entre eux, etc.

Opération consistant lors du catalogage à récupérer la notice relative au document à traiter dans un autre catalogue et à la télécharger, à l’importer dans son environnement de catalogage (et de la modifier si besoin). Par exemple, du catalogue de la BnF.

L’exemplarisation est la création d’un exemplaire en se localisant sous la notice bibliographique correspondant au document considéré. Cette opération peut être réalisée dans le catalogue local ou dans un catalogue collectif. 

Agencement structuré de données. Pour les données bibliographiques, structures de notices bibliographiques définies en vue d’échanges et de traitements informatiques : les formats MARC (MAchine-Readable Cataloging) sont aujourd’hui utilisés, UNIMARC dans le SUDOC, INTERMARC à la BnF, MARC 21 dans le monde anglo-saxon.

Indexation (au sens documentaire) : Description du contenu intellectuel d’un document à partir de l’analyse de son contenu au moyen de descripteurs, termes, mots-clés, indices et afin d’en favoriser la recherche. Par exemple, le langage encyclopédique d’indexation RAMEAU est largement utilisé en France et dans d’autres pays francophones.

Source : Parler l’info-doc – Vocabulaire et notions de base – ADBU