Formation Infrastructure IA souveraine

Formation IA souveraine : déployez des LLM open weight sur votre infrastructure en 3 jours. SLM, quantization, vLLM, GPU, monitoring et coût réel.

Formation Infrastructure IA souveraine

Description

Cette formation IA souveraine vous permettra de concevoir, déployer et exploiter une infrastructure d'inférence LLM maîtrisée de bout en bout, sur vos machines ou dans votre cloud, pour des données que vous ne pouvez pas confier à une API tierce.

Pendant 3 jours, vous apprendrez à :

  • déterminer quels flux exigent réellement du souverain, et lesquels peuvent rester sur API une fois désensibilisés,
  • dimensionner et déployer une infrastructure d'inférence dédiée qui tient la charge de vos équipes,
  • prouver ce que votre plateforme coûte et ce qu'elle sait tenir comme niveau de service, face à une offre cloud.

Public

Cette formation s'adresse aux ingénieur·e·s DevOps, SRE, MLOps, architectes et développeur·euse·s backend chargé·e·s de déployer et d'exploiter des modèles de langage sur une infrastructure maîtrisée.

Les objectifs

  • Déterminer quelles données imposent une infrastructure maîtrisée et lesquelles peuvent être anonymisées avant d'être envoyées à une API
  • Concevoir une architecture d'inférence dédiée réversible, du poste de travail au cluster GPU
  • Sélectionner et quantizer des modèles open weight adaptés à une tâche et à un budget matériel
  • Dimensionner un parc GPU à partir d'un besoin en contexte, en débit et en concurrence
  • Déployer un service d'inférence avec vLLM et l'exposer à plusieurs applications internes
  • Mesurer la qualité, la charge et le coût réel de la plateforme pour le comparer à une offre API

Pré-requis

  • Administrer des serveurs Linux au quotidien (ligne de commande, systemd, réseau)
  • Être à l'aise avec Docker et les notions de conteneurisation
  • Pratiquer Python suffisamment pour écrire et modifier des scripts d'intégration
  • Avoir déjà appelé une API de modèle de langage depuis du code
  • Ordinateur portable à apporter

Le programme de la formation Infrastructure IA souveraine

Jour 1 — Cadrer le périmètre souverain

  • Ce que « souverain » veut dire techniquement
    • Les quatre niveaux de contrôle : données, poids du modèle, plan d'exécution, plan de contrôle
    • Degrés de souveraineté : API éditeur, cloud mutualisé, cloud de confiance, infrastructure dédiée
    • Réversibilité et plan de sortie : la seule garantie vérifiable
  • Le piège de la résidence des données
    • Résidence européenne annoncée et dépendance juridique réelle (Cloud Act, FISA 702)
    • Ce qui traverse malgré tout le périmètre : télémétrie, journaux, plan de contrôle, mises à jour
    • Traduire une exigence contractuelle en contrainte d'architecture vérifiable
  • Quels usages nécessitent vraiment du souverain
    • Classification des données et cartographie des flux d'une application IA
    • Cas où la réglementation ou la sensibilité l'imposent, cas où elle ne l'impose pas
    • Coût d'opportunité : ce qu'on perd en qualité et en vitesse d'évolution
  • L'alternative souvent ignorée : désensibiliser en amont
    • Détection et substitution des données personnelles avant appel au modèle
    • Modèles dédiés à l'anonymisation et exécution locale de cette seule brique
    • Mesure du risque résiduel : taux de fuite, réidentification, jeux de tests adverses
    • Architecture hybride : routage des requêtes selon la sensibilité du flux

Mises en pratique :

  • Cartographie des flux d'une application IA en secteur régulé et qualification du niveau de souveraineté requis par flux
  • Mise en place d'un pipeline d'anonymisation en amont d'un appel API et mesure du taux de fuite résiduel
  • Conception de l'architecture cible : ce qui reste dedans, ce qui peut sortir, et à quelles conditions

Jour 2 — Construire l'infrastructure d'inférence

  • Choisir ses modèles
    • Panorama des modèles open weight et des SLM : familles, tailles, licences
    • Adéquation tâche / taille de modèle : quand un petit modèle suffit largement
    • Protocole de sélection : jeu de tests métier avant choix, pas après
    • Fine-tuning : à quelles conditions il devient pertinent, et ce qu'il ne résout pas
  • Quantization et empreinte mémoire
    • Formats et compromis : GGUF, AWQ, GPTQ, FP8
    • Impact mesuré sur la qualité, la VRAM et le débit
    • Calcul de l'empreinte réelle : poids, cache d'attention, longueur de contexte, concurrence
  • Dimensionner le matériel
    • Quel modèle tourne sur quelle machine : méthode de calcul et marges de sécurité
    • Arbitrage GPU dédié, GPU loué, CPU : seuils de bascule
    • Répartition multi-GPU et modèles qui ne tiennent pas sur une carte
  • Servir en production avec vLLM
    • Architecture d'un serveur d'inférence : batching continu, gestion du cache d'attention
    • Paramètres de service qui comptent réellement et leurs effets
    • Exposition par une passerelle compatible OpenAI et bascule des applications existantes
    • Conteneurisation, accès GPU, isolation et quotas entre équipes

Mises en pratique :

  • Sélection d'un modèle open weight sur un jeu de tests métier, à qualité comparée entre deux tailles
  • Comparaison de trois formats de quantization d'un même modèle : qualité, VRAM, débit
  • Déploiement d'un service vLLM conteneurisé et bascule d'une application existante vers ce service
  • Calcul de dimensionnement d'un parc pour un nombre d'utilisateurs et une longueur de contexte donnés

Jour 3 — Exploiter, mesurer et défendre le coût

  • Observer une plateforme d'inférence
    • Métriques qui comptent : débit en tokens, temps au premier token, latence inter-token, saturation GPU
    • Instrumentation et tableaux de bord avec Prometheus et Grafana
    • Journalisation en environnement sensible : ce qu'on garde, ce qu'on ne garde jamais
  • Tenir la charge
    • Tests de charge et détermination du point de saturation
    • Concurrence, files d'attente, priorisation des usages critiques
    • Stratégies de dégradation : modèle de repli, réduction du contexte, refus contrôlé
  • Mesurer la qualité des réponses
    • Harnais d'évaluation et traçage applicatif avec Langfuse
    • Jeu de tests métier et détection de régression au changement de modèle ou de quantization
    • Boucle de retour utilisateur en environnement fermé
  • Sécuriser et maintenir
    • Cloisonnement des accès, gestion des secrets, journal d'audit
    • Fonctionnement en réseau isolé : mises à jour de modèles et de dépendances hors ligne
    • Cycle de vie : arrivée d'un nouveau modèle, tests de non-régression, bascule progressive
    • Exigences réglementaires (RGPD, AI Act, DORA/NIS2) traduites en contraintes techniques
  • Le vrai coût et le service qu'on peut promettre
    • Décomposition du coût au million de tokens sur infrastructure dédiée
    • Amortissement matériel, taux d'occupation, coût d'exploitation humaine
    • Seuil de bascule face à une offre API ou cloud, selon le volume et la sensibilité
    • Quel niveau de service on peut réellement s'engager à tenir, et sur quelles bases

Mises en pratique :

  • Instrumentation de la plateforme et construction d'un tableau de bord débit / latence / saturation
  • Test de charge jusqu'au point de saturation et définition de la capacité annonçable
  • Construction d'un harnais d'évaluation et détection d'une régression après changement de quantization
  • Calcul du coût au million de tokens de la plateforme et comparaison chiffrée avec une offre API

Télécharger le programme

Formateur

Raphaël LEO

Raphaël LEO

Raphaël Leo est un développeur fullstack (PHP, Python, Angular, Node) qui développe des applications web depuis une vingtaine d’années.

Depuis fin 2023, il s’est spécialisé dans le développement d’agents IA. Sur des projets concrets, il conçoit des solutions RAG avec serveurs souverains, modèles auto-hébergés et contraintes RGPD strictes, en s’appuyant notamment sur Claude, LangChain et LangGraph.

Raphaël aime partager ses découvertes avec ses pairs. Son approche pédagogique s’appuie sur des retours d’expérience réels et une volonté d’interactivité. Il vous proposera d’explorer les technologies de l'IA en pleine évolution avec une vision pragmatique et opérationnelle.

FAQ

Nos formations sont éligibles à plusieurs dispositifs de financement, selon votre situation. Human Coders est certifié Qualiopi, ce qui permet la prise en charge par des organismes comme Pôle emploi, votre OPCO ou encore le CPF (Compte Personnel de Formation) pour certaines formations.

Pour en savoir plus, veuillez consulter notre page : Comment financer votre formation ?

Oui, la formation peut être proposée en présentiel ou en distanciel. Pour les inter-entreprises, les modalités (présentiel ou à distance) sont fonction de la session.

Nous pouvons organiser des sessions à d'autres dates ou dans d'autres villes (Bordeaux, Lille, Lyon, Marseille, Montpellier, Nantes, Nice, Paris, Strasbourg, Toulouse...)

Les formations se déroulent toujours en petit groupe de 3 à 6 stagiaires. Nous souhaitons que les formateurs et formatrices puissent passer un maximum de temps avec chacun·e.

Voici une journée type :

  • 9h : vous êtes accueillis par votre formateur·rice autour d'un petit déjeuner (croissants, pains au chocolat, jus de fruit, thé ou café...)
  • 9h30 : la formation commence
  • 12h30 : pause de midi. Le·a formateur·rice mangera avec vous. C'est l'occasion d'avoir des discussions plus informelles.
  • 14h : reprise de la formation
  • 18h : fin de la journée

8 raisons de participer à une formation Human Coders

  • Satisfaction client élevée : Un taux de statisfaction de 4,6/5 depuis 2012 (sur 1906 sessions réalisées). 99% des participants se disent satisfaits de nos formations
  • Approche pédagogique unique : Des formations en petit groupe, des formateurs passionnés et expérimentés, de véritables workshops... (Plus d'infos sur notre manifeste)
  • Catalogue de formations complet : 272 formations au catalogue, de quoi vous accompagner sur tout vos projets
  • Écosystème dynamique : Nous accompagnons les dev depuis 14 ans avec des initiatives comme Human Coders News, les Human Talks, le podcast ou encore notre serveur Discord
  • Financement facilité : Organisme certifié Qualiopi, indispensable pour que vous puissiez obtenir des aides au financement via votre OPCO
  • Références clients prestigieuses : De nombreux clients qui nous font confiance depuis des années
  • Accompagnement sur mesure : Nous vous proposons un accompagnement personnalisé par nos consultants pour vous aider dans vos projets au-delà de la formation
  • Valorisation professionnelle : Remise d'un diplôme, d'une attestation et d'une certification, suivant les formations effectuées, que vous pourrez afficher sur vos CV et réseaux sociaux

* Nombre de personnes ayant répondu au questionnaire de satisfaction sur cette formation depuis 2012