• Date de dépôt du sujet : octobre 2022
Présentation du thème de recherche
Exploiter des données historiques avec l’intelligence artificielle : perspectives ouvertes par les grands modèles de langage (LLM)
Cette thèse porte sur la conception d’un système de génération augmentée par récupération (RAG) pour aider de grands modèles de langage (LLM) à fournir des réponses correctes à des questions en histoire à partir du corpus d’archives historiques constitués au travers du projet de l’Atlas historique de la Nouvelle-Aquitaine (AHNA).
Les travaux font appel à de nombreuses compétences transversales mêlant l’informatique à des spécificités de la recherche historique. Les travaux s’appuient sur un corpus de documents et d’archives historiques qui a dû être entièrement numérisé, transformé par OCR (reconnaissance optique des caractères) puis qui a subi des post-traitements pour nettoyer au maximum les données. C’est à partir de ces données non structurées et partiellement bruitées qu’il a fallu constituer une chaîne de traitement.
L’objectif principal de la thèse est d’être capable de fournir une assistance à des grands modèles de langage pré-entrainés sur le corpus historique afin de répondre à des questions d’histoire en citant des sources provenant des documents à disposition. Pour réaliser un système de RAG efficace, plusieurs étapes sont à réaliser et reposent sur des spécialités propres :
- Récupération de données historiques dans des bases de données (liste d’entités nommées) et de triplets dans des bases de connaissances (métadonnées relatives à des entités nommées notamment).
- En parallèle, l’équipe de l’Atlas historique de la Nouvelle-Aquitaine a conçu et alimente sa propre base de connaissances pour répondre aux objectifs du projet.
- Extraction de données issues du corpus historique, à l’aide de modèles de traitement automatique du langage naturel (machine et deep learning), d’algorithmes de recherche dans des chaînes de caractères (Aho-Corasick) ou d’expressions régulières.
- Développement d’un moteur de recherche avancé au sein du corpus historique. Cet outil de recherche d’information doit fournir des résultats visuels et servir de base au système de génération augmentée par récupération (RAG).
- – Mise en place d’un moteur de recherche hybride, utilisant de la recherche plein texte en SQL et sémantique à partir d’index de vecteurs. L’objectif est de pouvoir effectuer aussi bien des recherches avec des mots clés qu’en langue naturelle (phrases, questions, etc.).
– Conception de systèmes d’extraction de connaissances à partir des textes du corpus (expansion de contenu) mais aussi des requêtes utilisateurs (reformulation et expansion de requête automatiques).
– Développement d’algorithmes de reclassement pour augmenter la pertinence des résultats.
– Développement d’une application pour que le moteur de recherche soit accessible à tous les historiens. - Pré-entraînement et réglage fin (fine-tuning) de grands modèles de langage open source à partir du corpus. L’objectif est de faire apprendre les connaissances historiques du corpus aux modèles afin de pouvoir leur poser des questions spécifiques. Mise en place du RAG pour améliorer les réponses aux questions des historiens.
Au terme de ce vaste travail, l’AHNA doit posséder un outil clé en main capable d’aller chercher des informations pertinentes dans un corpus historique numérisé mais brut (non structuré, bruité), de classer les ressources avec un maximum de précision mais aussi de pouvoir directement répondre à des questions qui portent sur des thématiques d’histoire traitées dans les documents.
École doctorale
ED 612 Humanités – Université de Poitiers
