
Modèles en production
- Code : INOP-DS 301
- Durée : 12 semaines · 48 h en direct
- Prix : 549 $US
- Adresse de la page : https://inopnixacademy.com/fr/formations/inop-ds301/programme
Programme
Modèles en production
En-tête
- 12 semaines · 24 séances de 2 h · 48 h en direct
- 72 h de travail personnel · 30 h de chef-d'œuvre
- TOTAL 150 h
- Parcours complet : 549 $US — certification incluse
- En ligne (séances en direct) et hors ligne (supports et travaux pratiques à faire à son rythme)
Savoir-faire
- Transformer une demande métier en problème d'apprentissage, ou établir par écrit qu'il n'en est pas un et qu'une règle suffit
- Construire un jeu d'entraînement sans fuite de données et découper le temps correctement
- Entraîner un modèle supervisé, puis choisir son seuil de décision à partir du coût métier des deux types d'erreur, pas à partir d'un score global
- Reproduire à l'identique, six mois plus tard, un résultat obtenu aujourd'hui : données, code et modèle versionnés ensemble
- Mettre un modèle derrière une interface appelable, conteneurisée, testée et documentée
- Surveiller un modèle en service : dérive des entrées, baisse de performance, temps de réponse — et déclencher l'alerte au bon seuil
- Revenir à la version précédente d'un modèle en moins de dix minutes, et écrire la fiche qui dit sur quelles populations ce modèle ne doit PAS être utilisé
Public
- Celui qui entraîne déjà des modèles dans des carnets de notes et dont aucun n'a jamais été appelé par une application
- L'ingénieur de données à qui on demande maintenant de faire tourner et de surveiller les modèles des autres
- Le développeur qui doit intégrer un modèle dans un produit et qui veut savoir ce qu'il signe
Prérequis
- ✅ Python courant : fonctions, classes simples, environnements isolés, lecture de messages d'erreur
- ✅ SQL avec jointures et agrégats
- ✅ Git : branche, fusion, résolution d'un conflit
- ✅ Avoir déjà lancé un conteneur Docker
- ✅ Un ordinateur avec 16 Go de mémoire et 60 Go disponibles sur le disque
- ❌ AUCUN prérequis en mathématiques au-delà du niveau lycée. Les formules nécessaires sont réétablies en séance.
- ❌ AUCUN prérequis en réseaux profonds
- ❌ AUCUN diplôme exigé — INOP-DS 201 est fortement recommandé. Sans lui, prévois plus que les 72 h de travail personnel annoncées : voir ⚠️ ÉCART.
Modules
1. MODULE 0 — Poser le problème avant d'entraîner
1 semaine(s) · 2 séance(s) · 4 h
Séances
- Six demandes métier réelles. Pour chacune : est-ce un problème de prédiction, un problème de mesure, ou une règle de gestion déguisée ? Trois des six ne réclament aucun modèle.
- Écrire la fiche de cadrage : la décision que le modèle sert, l'unité prédite, l'horizon, la mesure de succès métier, et le coût respectif d'un faux positif et d'un faux négatif.
Travail pratique
TP-0 — « Deux sur cinq n'en sont pas. » Cinq demandes métier écrites. Tu rends cinq fiches de cadrage.
Critère de réussite : les deux demandes qui ne relèvent pas de l'apprentissage sont identifiées avec la solution alternative proposée, et si les trois autres portent chacune un coût chiffré pour chaque type d'erreur.
2. MODULE 1 — Les données de l'apprentissage
2 semaine(s) · 4 séance(s) · 8 h
Séances
- La fuite de données : les six formes courantes. Une variable calculée après la décision, une moyenne calculée sur tout le jeu, un identifiant qui encode la cible. On en fabrique une, on constate le score irréaliste, on la retire.
- Le découpage : aléatoire, par temps, par groupe. Pourquoi un découpage aléatoire sur des données temporelles produit un modèle qui ne servira jamais.
- Construire les variables explicatives : agrégats à date, fenêtres glissantes, encodage des catégories, valeurs manquantes traitées explicitement plutôt que remplies par défaut.
- Le déséquilibre des classes et ce qu'on peut en faire honnêtement. Les jeux de référence : figer un jeu d'évaluation qu'on ne regarde plus.
Travail pratique
TP-1 — « Trouve la fuite. » On te donne un carnet de notes qui obtient un score très élevé sur un jeu de données de désabonnement. Il contient deux fuites.
Critère de réussite : les deux fuites sont nommées avec la ligne de code fautive, et si le score recalculé après correction est fourni avec le découpage temporel utilisé.
3. MODULE 2 — Entraîner et évaluer honnêtement
2 semaine(s) · 4 séance(s) · 8 h
Séances
- Deux familles suffisent pour ce parcours : la régression pénalisée et les arbres renforcés. Ce que chacune suppose, ce qu'elle pardonne, ce qu'elle ne pardonne pas.
- Validation croisée, respect du temps, et le réglage des hyperparamètres sans se mentir : le jeu d'évaluation reste fermé.
- Les mesures d'évaluation : précision, rappel, courbes, calibration. Un score global agrégé masque toujours quelque chose — on montre quoi, sur un cas.
- Le seuil décidé par le coût. À partir des coûts écrits au module 0, on calcule le seuil de décision qui minimise le coût total. On le compare au seuil par défaut de 0,5 et on mesure l'écart en unités métier.
Travail pratique
TP-2 — « Le seuil qui coûte le moins cher. » Sur le jeu corrigé du TP-1, tu entraînes deux modèles et tu produis la note de choix.
Critère de réussite : la note donne le seuil retenu, le coût métier total à ce seuil et au seuil par défaut, et la différence chiffrée entre les deux, sur le jeu d'évaluation resté fermé jusque-là.
4. MODULE 3 — Reproduire : versions, suivi, registre
2 semaine(s) · 4 séance(s) · 8 h
Séances
- Le projet organisé : code dans Git, configuration hors du code, dépendances figées, graine aléatoire fixée. On relance l'entraînement de la veille et on vérifie que le résultat est identique.
- Le suivi d'expériences avec MLflow : paramètres, mesures, artefacts. Retrouver, parmi 60 essais, celui qu'on a présenté en réunion.
- Le versionnage des données : empreinte du jeu, instantané daté, et la question « sur quelles données ce modèle a-t-il été entraîné ? » à laquelle il faut savoir répondre.
- Le registre de modèles : étapes, promotion, signature d'entrée et de sortie. Ce qu'il faut stocker avec le modèle pour qu'un autre puisse le servir sans t'appeler.
Travail pratique
TP-3 — « Refais-le sans moi. » Tu enregistres ton modèle du TP-2 avec son suivi d'expérience, l'empreinte de ses données et sa signature.
Critère de réussite : un binôme, à partir de ton dépôt seul et sans te poser de question, réentraîne le modèle et obtient la même mesure d'évaluation à la troisième décimale.
5. MODULE 4 — Mettre en service
2 semaine(s) · 4 séance(s) · 8 h
Séances
- Deux modes de service : en lot planifié et à la demande. On choisit selon la fréquence de décision et le délai acceptable, et on écrit le choix.
- L'interface appelable : une API qui reçoit les entrées, valide leur forme, renvoie la prédiction, la version du modèle et un identifiant de trace.
- Conteneuriser et faire tourner : image légère, variables d'environnement, sonde de vie, sonde de disponibilité. On mesure le temps de réponse au 95ᵉ centile.
- La chaîne d'intégration : tests unitaires sur les transformations, test sur des exemples de référence, seuil de performance minimal, et refus automatique de publier si le seuil n'est pas atteint.
Travail pratique
TP-4 — « Appelle-le. » Tu exposes ton modèle derrière une API conteneurisée, avec sa chaîne d'intégration.
Critère de réussite : l'API renvoie une prédiction, la version du modèle et un identifiant de trace en moins de 300 ms au 95ᵉ centile sur 200 appels, refuse une entrée malformée avec un message explicite, et si la chaîne d'intégration bloque une publication dont la mesure d'évaluation passe sous le seuil écrit.
6. MODULE 5 — Surveiller, réentraîner, débrancher
2 semaine(s) · 4 séance(s) · 8 h
Séances
- Ce qu'on surveille et à quelle fréquence : disponibilité, temps de réponse, volume d'appels, distribution des entrées, distribution des sorties, et — quand elle arrive — la performance réelle.
- La dérive : dérive des entrées et dérive de la relation. On la fabrique sur un jeu de test, on la mesure, on fixe le seuil d'alerte et on assume les fausses alertes que ce seuil produit.
- Le décalage de vérité : que faire quand le résultat réel n'est connu que 90 jours plus tard. Mesures indirectes, échantillon annoté, et ce qu'on accepte de ne pas savoir avant trois mois.
- Le retour arrière. Réentraînement planifié, publication progressive sur une fraction du trafic, et procédure de retour à la version précédente. Chacun l'exécute, chronomètre en main.
Travail pratique
TP-5 — « Reviens en arrière en dix minutes. » On dégrade ta version en service pendant la séance. Tu détectes, tu décides, tu reviens.
Critère de réussite : l'alerte se déclenche sans intervention de ta part, la version précédente est en service en moins de dix minutes chronométrées, et le compte rendu nomme l'indicateur déclencheur et sa valeur au moment de l'alerte.
7. MODULE 6 — Gouverner un modèle
1 semaine(s) · 2 séance(s) · 4 h
Séances
- La fiche de modèle : usage prévu, usages interdits, populations sur lesquelles la performance a été mesurée et celles sur lesquelles elle ne l'a pas été, données personnelles utilisées, durée de conservation, date de réexamen.
- Le budget : coût d'entraînement, coût de service, coût de surveillance. Ce qu'on coupe quand le budget baisse de moitié, et pourquoi la surveillance n'est pas la première chose qu'on coupe.
Travail pratique
TP-6 — « Ce modèle ne doit pas servir à ça. » Tu écris la fiche de ton modèle et le tableau de son coût mensuel.
Critère de réussite : la fiche nomme au moins deux usages interdits avec leur motif, cite les segments de population non évalués, et si le tableau de coût sépare entraînement, service et surveillance avec la formule de chaque ligne.
Chef-d’œuvre
- Tu reçois un jeu de données historique, une décision métier réelle à outiller, et le coût des deux types d'erreur. Tu rends trois choses :
- le dépôt complet : cadrage, préparation, entraînement suivi, modèle enregistré avec sa signature et l'empreinte de ses données
- le service : API conteneurisée, chaîne d'intégration, tableau de surveillance et procédure de retour arrière — exécutée devant le jury
- la fiche de modèle et la note de limites : sur quoi il a été évalué, sur quoi il ne l'a pas été, à quelles populations il ne doit PAS être appliqué, et à quelle date il doit être réexaminé
- Le troisième livrable pèse autant que les deux premiers. Un modèle sans limite écrite finit toujours par être utilisé sur une population pour laquelle personne ne l'a mesuré.
Épreuve
- Seuil de réussite : 700 points sur 1 000.
- Minimum obligatoire : 50 % à CHACUNE des trois épreuves.
- Repasser après échec : 59 $US
- Celui qui vient par l'examen seul passe exactement la même épreuve que celui qui a fait 12 semaines. C'est ce qui fait qu'un employeur peut lire ton certificat sans demander par où tu es entré.
- Chef-d'œuvre — 350
- Défense orale — 250
- Épreuve surveillée — 400
- Total — 1000 · 700 · 50 %
Outils
- Python 3, environnements isolés, scikit-learn et une bibliothèque d'arbres renforcés
- Docker Desktop (Windows, Mac) ou Docker Engine (Linux)
- MLflow, exécuté en conteneur — installation guidée en séance 12
- Git et un dépôt distant avec sa chaîne d'intégration
- FastAPI (ou équivalent) pour l'interface appelable
- Prometheus et Grafana en conteneurs pour la surveillance — installation guidée en séance 19
- Fourni : les jeux de données, le carnet piégé du TP-1, les jeux d'évaluation fermés, les fichiers de conteneurs, les énoncés et les corrigés
- Aucun compte payant, aucune carte bancaire, aucun service distant facturé n'est exigé. Tout tourne en local. Un environnement d'exercice distant est mis à disposition pour les postes à 8 Go de mémoire, sur les modules 4 et 5.
Ce que ce n’est pas
- Ce n'est pas un cours de théorie de l'apprentissage. On n'y démontre pas les algorithmes. Deux familles de modèles sont enseignées et servent de support à la mise en production.
- Ce n'est pas une formation aux réseaux de neurones profonds ni à la vision par ordinateur. Voir la section ⚠️ ÉCART en fin de fichier.
- Ce n'est pas une formation d'ingénieur de données. Tu consommeras des tables, tu ne construiras pas l'entrepôt qui les produit. C'est INOP-DS 201.
- Ce n'est pas une formation d'analyse ni de restitution. Tu ne construiras pas de tableau de bord de décision. C'est INOP-DS 101.
Le marché
Ce que le métier demande aujourd'hui
Relevé sur des annonces d'ingénieur d'apprentissage automatique et d'ingénieur de mise en production de modèles, en anglais et en français, marchés du Golfe, d'Afrique francophone et d'Europe francophone.
- Mettre un modèle derrière une interface appelable, conteneurisée et documentée, avec sa version renvoyée dans la réponse
- Versionner données, code et modèle ensemble, de façon à reproduire un résultat plusieurs mois plus tard
- Construire la chaîne d'intégration et de publication : tests, seuil de performance, refus automatique de publier
- Surveiller en service la disponibilité, le temps de réponse, la dérive des entrées et la performance, avec des alertes réglées
- Déclencher un réentraînement ou un retour à la version précédente, et savoir le faire vite
- Documenter les limites d'usage du modèle et tenir un budget de calcul
Ce que l'offre existante laisse de côté
- L'apprentissage s'arrête au carnet de notes et au score de validation. La mise en service est présentée comme le travail d'un autre métier, alors que les annonces la demandent à la même personne.
- L'évaluation est enseignée comme un score agrégé à maximiser, presque jamais comme un arbitrage entre deux types d'erreur dont le coût métier diffère. Le seuil de décision reste à sa valeur par défaut.
- On apprend à publier, pas à débrancher. Le retour à la version précédente, l'arrêt d'un modèle et la déclaration de ses usages interdits sont rarement exercés, jamais chronométrés.
Ce qu'INOPNIX ajoute
- Le seuil décidé par le coût métier, pas par défaut. → MODULE 0, séance 2 (coût de chaque type d'erreur écrit dès le cadrage), MODULE 2, séance 10, et TP-2 : la note doit chiffrer l'écart de coût entre le seuil retenu et le seuil par défaut.
- Le retour arrière, exécuté et chronométré. → MODULE 5, séance 22, et TP-5 : ta version en service est dégradée pendant la séance ; la version précédente doit être rétablie en moins de dix minutes, alerte déclenchée sans ton intervention.
- La fiche de modèle avec ses usages interdits. → MODULE 6, séance 23, TP-6, et troisième livrable du chef-d'œuvre : au moins deux usages interdits motivés et les segments de population non évalués.
Examen seul
- Tu ne suis aucun cours. Tu passes l'épreuve.
- L'examen seul : 129 $US
- Préparation accompagnée : 229 $US (certification incluse)
- Compte 50 à 65 heures de travail personnel pour te préparer seul. C'est une ESTIMATION, pas un horaire : personne ne peut savoir combien de temps tu mets à lire.
- CE QUE TU REÇOIS AVEC LA PRÉPARATION : le référentiel complet de la certification · deux examens blancs corrigés · une séance de correction collective de 2 h · les énoncés des travaux pratiques du parcours (TP-0 à TP-6), le carnet piégé du TP-1 et les fichiers de conteneurs
- CE QUE TU NE REÇOIS PAS : les séances en direct · l'accompagnement individuel du chef-d'œuvre · l'exercice de retour arrière du TP-5, qui suppose un incident injecté en séance
- L'épreuve est LA MÊME. Même barème, même seuil, même minimum par épreuve.