INGÉNIEUR/INGÉNIEURE D'ÉTUDE BASES DE DONNÉES ET PIPELINES DE TRAITEMENT DES CORPUS TEXTUELS MÉDIÉVAUX - H/F
Description
CONTEXTE : L'ingénieur.e sera recruté.e dans la cadre du projet Phil-IA (ANR JCJC, 42 mois) qui développe une approche méthodologique innovante pour l'étude des textes hagiographiques français des XIIIe-XVe siècles dans leur contexte manuscrit, en croisant philologie et humanités numériques. Le contrat proposé à l'ingénieur/ingénieure d'étude est un contrat de deux ans. Le projet articule trois volets : constitution et interconnexion d'une base de données hagiographique, acquisition et édition des textes (ATR, normalisation, encodage TEI), analyse et valorisation des données (publication en ligne des données, édition des textes, stylométrie, alignement des versions, etc.). L'ingénieur.e rejoint une équipe resserrée composée de la coordinatrice et d'un.e doctorant.e (recruté.e en septembre 2027), et travaille en lien avec des partenaires extérieurs (Inria/ALMAnaCH pour la normalisation des textes médiévaux, consortium Biblissima+ pour l'enrichissement du portail textes). Le poste s'inscrit au CIHAM (UMR 5648), au sein de l'axe Humanités Numériques (Sources, Corpus, données : Modélisations numériques). L'ingénieur.e bénéficiera des infrastructures Huma-Num (Nakala, Oxygen XML, TEI Publisher, Heurist) et d'eScriptorium, ainsi que d'un environnement de recherche national via les partenaires du projet (Inria, consortium Biblissima+). L'ingénieur.e sera accueilli dans les bureaux de l'ENS de Lyon. La personne recrutée sera encadrée par Ariane Pinche (CNRS, CIHAM). MISSIONS : Dans le cadre du projet ANR Phil-IA, l'ingénieur.e assurera le développement et la maintenance de l'infrastructure numérique du projet : BASE DE DONNÉES HAGIOGRAPHIQUE (WP1)• Développement d'une base de données open source dédiée à l'exploration de corpus hagiographiques
• Modélisation garantissant l'interopérabilité avec les bases existantes (Jonas, Biblissima+)
• Intégration des données textuelles et codicologiques dans la base CHAÎNE D'ACQUISITION ET DE TRAITEMENT DES TEXTES (WP2)
• Déploiement d'une chaîne de traitement allant de la reconnaissance automatique de texte (ATR) à partir de modèles existants (CATMuS-Medieval) jusqu'à l'encodage XML TEI
• Mise en œuvre de l'annotation linguistique (lemmatisation, étiquetage morphosyntaxique)
• Encodage TEI des transcriptions et intégrations dans la base de données SCHÉMA TEI D'ÉDITION STRATIFIÉE (WP3)
• Implémentation du schéma TEI supportant l'édition stratifiée (transcription diplomatique, semi-normalisée, annotée, texte critique)
• Interconnexion des couches textuelles avec la base de données TRANSVERSAL
• Publication en accès ouvert des données, scripts et jeux d'entraînement sur des dépôts ouverts (Nakala, Zenodo, GitLab)
• Contribution à la documentation technique et à la pérennité des outils développés Profil recherché : COMPETENCES REQUISES : COMPÉTENCES TECHNIQUES REQUISES
• Maîtrise des principes de modélisation et de développement de bases de données (interopérabilité, standards ouverts)
• Compétences en développement de scripts et pipelines de traitement de données, maîtrise de Python demandée
• Pratique de l'encodage XML TEI et du langage de transformation XSLT
• Pratique de Git, GitHub et/ou GitLab COMPÉTENCES TECHNIQUES APPRÉCIÉES
• Connaissance des principes de la reconnaissance automatique d'écriture (eScriptorium, Kraken, modèles CATMuS)
• Connaissance des outils de traitement automatique du langage pour l'annotation linguistique (lemmatisation, étiquetage morphosyntaxique)
• Connaissance d'eXist-db/XQuery (environnement TEI Publisher)
• Connaissance souhaitée des corpus médiévaux ou des problématiques de philologie numérique COMPÉTENCES LINGUISTIQUES
• Niveau de français B2 ou C1 minimum
• Niveau d'anglais B2 COMPÉTENCES RELATIONNELLES
• Autonomie, rigueur et capacité à travailler en équipe
Cette annonce provient de France Travail. Voir l'annonce originale ↗