Formation Graphes de connaissances et GraphRAG

Trois jours pour interroger vos documents autrement : reconnaissance d'entités, extraction de relations, construction d'un graphe et GraphRAG.

Formation Graphes de connaissances et GraphRAG

Description

Cette formation Graphes de connaissances et GraphRAG vous permettra d'extraire entités et relations de vos documents pour en faire une base interrogeable.

Pendant 3 jours, vous apprendrez à :

  • répondre à des questions qui traversent plusieurs documents, là où une recherche par similarité rend des passages sans lien entre eux,
  • cesser de faire relire des dossiers à la main pour en extraire toujours les mêmes informations,
  • rendre interrogeable un fonds documentaire dormant : contrats, comptes rendus, rapports d'incident.

La formation part de vos documents et va jusqu'au graphe branché sur un pipeline de recherche documentaire, en comparant à chaque étape l'approche par modèle spécialisé et l'approche par LLM.

Public

Cette formation s'adresse aux développeur·euse·s, data scientists et ingénieur·e·s IA qui doivent exploiter un fonds documentaire structuré et construire des pipelines d'extraction d'information : entités, relations, graphes de connaissances.

Les objectifs

  • Construire et évaluer un pipeline NER sur des entités spécifiques à un domaine
  • Organiser une campagne d'annotation et en contrôler la qualité
  • Arbitrer entre modèle NER fine-tuné et extraction par LLM selon le coût et la maintenance
  • Mettre en place un pipeline d'extraction de relations et de construction de graphe
  • Modéliser et requêter un graphe de connaissances avec Neo4j et Cypher
  • Brancher un graphe sur un pipeline RAG et mesurer le gain sur les questions multi-documents

Pré-requis

  • Connaître les concepts de base des LLM et du RAG
  • Maîtriser Python
  • Avoir une expérience avec un framework de machine learning
  • Pour la partie fine-tuning de modèles, Fine-tuning de LLM est un complément utile mais pas obligatoire
  • Ordinateur portable à apporter

Le programme de la formation Graphes de connaissances et GraphRAG

Jour 1 — NER : extraire les entités de vos documents

  • Fondamentaux du NER
    • Définition et applications : extraction d'entités, anonymisation, indexation
    • Approches : règles, CRF, transformers, LLM
    • Schémas d'annotation : BIO, BILOU
  • Annotation de données
    • Guidelines d'annotation cohérentes
    • Outils : Label Studio, Prodigy, Doccano
    • Gestion de la qualité (inter-annotator agreement)
  • Modèles de NER avec HuggingFace
    • Token classification avec modèles pré-entraînés
    • Modèles spécialisés : CamemBERT-NER, GLiNER
    • SpaCy pour le NER en production
  • Fine-tuning d'un modèle NER
    • Fine-tuning d'un transformer pour la classification de tokens
    • Gestion des entités rares et du déséquilibre de classes
    • Évaluation : precision, recall, F1 par type d'entité
  • NER avec LLM (few-shot extraction)
    • Extraction d'entités via prompting structuré
    • Comparaison des deux approches : coût, latence, maintenance

Mises en pratique :

  • Annoter un corpus de documents avec des guidelines métier
  • Fine-tuner un modèle NER sur les entités spécifiques au projet
  • Comparer les performances du modèle fine-tuné et de l'extraction par LLM

Jour 2 — Des entités au graphe : relations, résolution, Neo4j

  • Extraction de relations
    • Définition et taxonomie des relations
    • Approches supervisées (classification de relations)
    • Approches LLM-based (extraction par prompting structuré)
    • Pipeline NER puis extraction de relations
  • Graphes de connaissances
    • Concepts : entités, relations, triplets (sujet, prédicat, objet)
    • Modélisation d'un schéma de graphe adapté au domaine
    • Stockage : Neo4j, NetworkX
  • Construction automatique de graphes
    • Pipeline document, NER, relations, graphe
    • Résolution d'entités et déduplication
    • Enrichissement et mise à jour incrémentale
  • Requêtage et exploration
    • Requêtes Cypher et traversées de graphe
    • Visualisation et exploration interactive

Mises en pratique :

  • Construire un pipeline complet allant du document au graphe de connaissances
  • Requêter le graphe en Cypher pour répondre à des questions complexes
  • Résoudre et dédupliquer les entités d'un corpus réel

Jour 3 — GraphRAG : brancher le graphe sur la recherche documentaire

  • Limites du RAG vectoriel
    • Questions qui traversent plusieurs documents
    • Agrégation, comptage et questions de chemin
    • Diagnostiquer les cas où la similarité ne suffit pas
  • Architectures GraphRAG
    • Récupération par entité et expansion de voisinage
    • Recherche hybride graphe et vecteur
    • Construction du contexte envoyé au modèle
  • Évaluation
    • Constituer un jeu de questions multi-documents
    • Comparer RAG vectoriel et GraphRAG sur ce jeu
  • Exploitation et maintenance
    • Fraîcheur du graphe et mise à jour incrémentale
    • Traçabilité des réponses vers les documents sources
    • Gouvernance : qui valide le schéma et les entités

Mises en pratique :

  • Brancher le graphe de connaissances sur un pipeline RAG existant
  • Comparer les réponses du RAG vectoriel et du GraphRAG sur un jeu de questions multi-documents
  • Élaborer un plan de mise à jour et de gouvernance du graphe

Télécharger le programme

FAQ

Nos formations sont éligibles à plusieurs dispositifs de financement, selon votre situation. Human Coders est certifié Qualiopi, ce qui permet la prise en charge par des organismes comme Pôle emploi, votre OPCO ou encore le CPF (Compte Personnel de Formation) pour certaines formations.

Pour en savoir plus, veuillez consulter notre page : Comment financer votre formation ?

Oui, la formation peut être proposée en présentiel ou en distanciel. Pour les inter-entreprises, les modalités (présentiel ou à distance) sont fonction de la session.

Nous pouvons organiser des sessions à d'autres dates ou dans d'autres villes (Bordeaux, Lille, Lyon, Marseille, Montpellier, Nantes, Nice, Paris, Strasbourg, Toulouse...)

Les formations se déroulent toujours en petit groupe de 3 à 6 stagiaires. Nous souhaitons que les formateurs et formatrices puissent passer un maximum de temps avec chacun·e.

Voici une journée type :

  • 9h : vous êtes accueillis par votre formateur·rice autour d'un petit déjeuner (croissants, pains au chocolat, jus de fruit, thé ou café...)
  • 9h30 : la formation commence
  • 12h30 : pause de midi. Le·a formateur·rice mangera avec vous. C'est l'occasion d'avoir des discussions plus informelles.
  • 14h : reprise de la formation
  • 18h : fin de la journée

8 raisons de participer à une formation Human Coders

  • Satisfaction client élevée : Un taux de statisfaction de 4,6/5 depuis 2012 (sur 1927 sessions réalisées). 99% des participants se disent satisfaits de nos formations
  • Approche pédagogique unique : Des formations en petit groupe, des formateurs passionnés et expérimentés, de véritables workshops... (Plus d'infos sur notre manifeste)
  • Catalogue de formations complet : 276 formations au catalogue, de quoi vous accompagner sur tout vos projets
  • Écosystème dynamique : Nous accompagnons les dev depuis 14 ans avec des initiatives comme Human Coders News, les Human Talks, le podcast ou encore notre serveur Discord
  • Financement facilité : Organisme certifié Qualiopi, indispensable pour que vous puissiez obtenir des aides au financement via votre OPCO
  • Références clients prestigieuses : De nombreux clients qui nous font confiance depuis des années
  • Accompagnement sur mesure : Nous vous proposons un accompagnement personnalisé par nos consultants pour vous aider dans vos projets au-delà de la formation
  • Valorisation professionnelle : Remise d'un diplôme, d'une attestation et d'une certification, suivant les formations effectuées, que vous pourrez afficher sur vos CV et réseaux sociaux

* Nombre de personnes ayant répondu au questionnaire de satisfaction sur cette formation depuis 2012