
Ingénierie de la donnée
- Code : INOP-DS 201
- Durée : 10 semaines · 40 h en direct
- Prix : 449 $US
- Adresse de la page : https://inopnixacademy.com/fr/formations/inop-ds201/programme
Programme
Ingénierie de la donnée
En-tête
- 10 semaines · 20 séances de 2 h · 40 h en direct
- 48 h de travail personnel · 20 h de chef-d'œuvre
- TOTAL 108 h
- Parcours complet : 449 $US — certification incluse
- En ligne (séances en direct) et hors ligne (supports et travaux pratiques à faire à son rythme)
Savoir-faire
- Construire une chaîne d'alimentation qui va d'une source (fichier, base, interface web) jusqu'à une table exploitable, et la relancer sans créer de doublon
- Modéliser un entrepôt en couches et écrire, pour chaque table, la phrase qui dit ce qu'une ligne représente
- Planifier et orchestrer des traitements avec Airflow, y compris le rattrapage d'une période passée
- Faire échouer une chaîne volontairement, la reprendre au bon point, et expliquer par écrit ce qui s'est passé
- Écrire des tests de données — fraîcheur, unicité, complétude, valeurs attendues — qui arrêtent la chaîne au lieu de laisser passer un chiffre faux
- Restreindre l'accès et masquer les données personnelles dans un environnement de travail
- Chiffrer ce que coûte une chaîne en stockage et en calcul, et proposer une version moins chère
Public
- L'analyste qui passe plus de temps à récupérer et recoller la donnée qu'à l'analyser
- Le développeur ou l'administrateur système à qui on demande maintenant de « faire tourner les flux »
- Celui qui a terminé INOP-DS 101 et veut construire ce qui alimente le tableau de bord au lieu de le consommer
Prérequis
- ✅ Écrire une requête SQL avec jointures et agrégats sans aide
- ✅ Lire et modifier un script Python simple (boucles, fonctions, lecture de fichier)
- ✅ Se déplacer en ligne de commande : cd, ls, chemins
- ✅ Un ordinateur avec 16 Go de mémoire et 40 Go disponibles sur le disque
- ❌ AUCUN prérequis en administration de serveur
- ❌ AUCUN prérequis en conteneurs : Docker est enseigné à partir de zéro en séance 8
- ❌ AUCUN diplôme exigé — INOP-DS 101 est recommandé, pas obligatoire
Modules
1. MODULE 0 — Ce qu'est une chaîne de données
1 semaine(s) · 2 séance(s) · 4 h
Séances
- On dessine au tableau la chaîne complète d'une entreprise fictive : cinq sources, trois couches, un entrepôt, quatre rapports. On nomme, à chaque flèche, qui appelle qui et à quelle heure.
- Les trois modes d'alimentation : reprise complète, ajout incrémental, et ajout avec correction rétroactive. On établit pour chaque source laquelle s'applique et pourquoi. Notion d'idempotence : relancer sans dupliquer.
Travail pratique
TP-0 — « Le schéma qui tient debout. » On te donne la description écrite d'un système existant (six sources, deux entrepôts, des exports manuels). Tu produis le schéma de flux et la liste des points de rupture.
Critère de réussite : le schéma nomme, pour chacun des six flux, sa fréquence, son mode d'alimentation et la conséquence chiffrée d'une exécution manquée.
2. MODULE 1 — SQL d'ingénierie et modélisation d'entrepôt
2 semaine(s) · 4 séance(s) · 8 h
Séances
- Au-delà de la requête : index, plan d'exécution, et pourquoi la même requête met 40 secondes chez toi et 4 minutes en production.
- Fonctions de fenêtrage (`ROW_NUMBER`, `LAG`, cumuls) : dédoublonner en gardant la dernière version d'une ligne, calculer une évolution sans jointure sur soi-même.
- Modélisation en couches : la couche brute qu'on ne modifie jamais, la couche nettoyée, la couche métier. Table de faits, tables de dimensions, granularité.
- L'historisation : comment garder qu'un client a changé d'adresse en mars sans écraser l'ancienne. Clés techniques, dates de validité.
Travail pratique
TP-1 — « Une ligne, une phrase. » À partir de trois exports bruts, tu construis les trois couches d'un petit entrepôt et tu documentes chaque table.
Critère de réussite : chaque table porte une phrase qui dit ce qu'une ligne représente, et si une requête de contrôle prouve qu'aucune table de faits ne contient deux lignes pour la même clé et la même période.
3. MODULE 2 — Ingérer : sources, formats, environnements
2 semaine(s) · 4 séance(s) · 8 h
Séances
- Ingérer depuis un fichier déposé, depuis une base source en lecture, et depuis une interface web paginée. Gestion des reprises : jeton, curseur, date de dernière exécution.
- Docker à partir de zéro : image, conteneur, volume. On lance PostgreSQL et un espace de travail Python en conteneurs, sur Windows, Mac et Linux.
- Les formats de stockage : CSV, JSON, Parquet. On mesure sur le même jeu de données la taille sur disque et le temps de lecture, et on décide.
- Écrire une ingestion qui se relance : détection des lignes déjà chargées, écriture atomique, journal d'exécution lisible par quelqu'un d'autre.
Travail pratique
TP-2 — « Relance-la trois fois. » Tu écris une ingestion Python qui charge une interface web paginée vers une table PostgreSQL, le tout dans des conteneurs.
Critère de réussite : après trois exécutions consécutives, la table contient exactement le même nombre de lignes qu'après la première, et le journal indique pour chaque exécution combien de lignes ont été ignorées et pourquoi.
4. MODULE 3 — Orchestrer : Airflow, et la panne
2 semaine(s) · 4 séance(s) · 8 h
Séances
- Airflow : installation en conteneur, premier graphe de tâches, dépendances, planification. Ce que fait l'ordonnanceur pendant que tu dors.
- Paramétrer par date d'exécution plutôt que par « aujourd'hui ». Rattrapage d'une période passée sans réécrire le code.
- Nouvelles tentatives, délais, alertes, tâches qui dépendent d'un capteur. Écrire une tâche qui échoue proprement plutôt qu'une tâche qui produit un fichier vide.
- La panne provoquée. On coupe la source au milieu d'une exécution, on remplit le disque, on change un type de colonne sans prévenir. Chacun reprend sa chaîne en séance et écrit le compte rendu.
Travail pratique
TP-3 — « Elle est tombée à 3 h du matin. » Ta chaîne du TP-2 est orchestrée dans Airflow. Un incident est injecté par le formateur sans que tu saches lequel.
Critère de réussite : la chaîne se termine correctement après reprise, aucune ligne n'est dupliquée ni perdue par rapport à l'exécution de référence, et le compte rendu d'une page nomme la cause, l'heure et la correction.
5. MODULE 4 — Transformer, tester, documenter
2 semaine(s) · 4 séance(s) · 8 h
Séances
- La transformation versionnée : le SQL vit dans un dépôt Git, pas dans une interface. Modèles, dépendances entre modèles, environnement de développement séparé de la production.
- Les tests de données : unicité d'une clé, absence de valeur nulle, appartenance à une liste, fraîcheur maximale, écart de volume par rapport à la veille.
- Le test qui casse. On introduit une régression dans la source. Le test doit arrêter la chaîne avant que le rapport ne soit publié. On mesure combien de temps il a fallu pour s'en apercevoir.
- Documentation et lignage : générer le graphe des dépendances, écrire la description d'une colonne pour quelqu'un qui n'était pas là, et retrouver en trois clics quels rapports dépendent d'une table qu'on veut supprimer.
Travail pratique
TP-4 — « Le rapport ne part pas. » Tu ajoutes une couche de transformation versionnée et une batterie de tests à ta chaîne.
Critère de réussite : une altération volontaire de la source (clé dupliquée, colonne vidée) fait échouer la chaîne avant l'étape de publication, et si le message d'échec nomme le test, la table et le nombre de lignes fautives.
6. MODULE 5 — Gouverner : accès, données personnelles, coût
1 semaine(s) · 2 séance(s) · 4 h
Séances
- Qui voit quoi : rôles, droits en lecture par schéma, masquage et pseudonymisation des colonnes personnelles, journal des accès. Durée de conservation et suppression : où l'écrire pour que ce soit appliqué et pas seulement promis.
- Ce que coûte une chaîne : volume stocké, données relues à chaque exécution, fréquence. On chiffre trois chaînes existantes et on en réécrit une pour diviser son coût.
Travail pratique
TP-5 — « La note de deux pages. » Pour ta chaîne complète, tu produis une note de gouvernance : matrice des accès, liste des colonnes personnelles avec leur traitement, durée de conservation, et estimation chiffrée du coût mensuel.
Critère de réussite : chaque colonne personnelle de l'entrepôt apparaît dans la note avec son traitement, et si l'estimation de coût est décomposée en stockage et calcul avec la formule utilisée.
Chef-d’œuvre
- Tu reçois trois sources hétérogènes — un dépôt de fichiers, une base source en lecture, une interface web — et le besoin écrit d'une équipe métier. Tu rends trois choses :
- la chaîne complète, orchestrée, dans un dépôt Git : ingestion, transformation, tests, planification
- l'entrepôt alimenté et sa documentation : ce que représente une ligne de chaque table, le graphe de lignage, la matrice des accès
- la note d'exploitation : ce qui casse en premier, ce qui se répare tout seul, ce qui exige une intervention humaine — et ce que ta chaîne ne garantit PAS
- Le troisième livrable pèse autant que les deux premiers. Une chaîne dont personne ne connaît les modes de panne se répare toujours dans l'urgence, un dimanche, par celui qui l'a écrite.
Épreuve
- Seuil de réussite : 700 points sur 1 000.
- Minimum obligatoire : 50 % à CHACUNE des trois épreuves.
- Repasser après échec : 59 $US
- Celui qui vient par l'examen seul passe exactement la même épreuve que celui qui a fait 10 semaines. C'est ce qui fait qu'un employeur peut lire ton certificat sans demander par où tu es entré.
- Chef-d'œuvre — 350
- Défense orale — 250
- Épreuve surveillée — 400
- Total — 1000 · 700 · 50 %
Outils
- Docker Desktop (Windows, Mac) ou Docker Engine (Linux) — installation guidée en séance 8
- PostgreSQL, exécuté en conteneur : identique sur les trois systèmes
- Python 3, avec un environnement isolé par projet
- Apache Airflow, exécuté en conteneur — installation guidée en séance 11
- Git et un dépôt distant
- Un éditeur de code (VS Code ou équivalent)
- Fourni : les trois sources du chef-d'œuvre, les jeux de données, les fichiers de conteneurs prêts à l'emploi, les énoncés et les corrigés
- Aucun compte payant n'est exigé. Tout tourne sur ta machine. Pour les postes à 8 Go de mémoire, un environnement d'exercice distant est mis à disposition pour les modules 3 et 4.
Ce que ce n’est pas
- Ce n'est pas une formation d'analyse. Tu ne construiras pas de tableau de bord ni de rapport de décision. C'est INOP-DS 101.
- Ce n'est pas une formation d'apprentissage automatique. Aucun modèle n'est entraîné ici. C'est INOP-DS 301.
- Ce n'est pas une formation d'administration système ni de réseau. Tu utiliseras des conteneurs, tu n'administreras pas de serveurs. C'est la filière systèmes et réseaux.
- Ce n'est pas une formation au traitement en flux continu. On travaille par lots planifiés. Voir la section ⚠️ ÉCART en fin de fichier.
Le marché
Ce que le métier demande aujourd'hui
Relevé sur des annonces d'ingénieur de données, en anglais et en français, marchés du Golfe, d'Afrique francophone et d'Europe francophone.
- Ingérer depuis plusieurs sources de natures différentes et rendre l'ingestion relançable sans doublon ni perte
- Modéliser un entrepôt en couches et documenter le sens de chaque table pour des équipes qui ne l'ont pas construite
- Orchestrer des traitements planifiés avec gestion des échecs, des nouvelles tentatives, du rattrapage d'historique et des alertes
- Écrire des tests de données — fraîcheur, unicité, complétude, distribution — et pas seulement des tests de code : les annonces demandent explicitement de « traiter les chaînes comme du logiciel de production »
- Mettre en place les droits d'accès par rôle, le masquage des données personnelles et la traçabilité du lignage
- Surveiller et réduire le coût de stockage et de calcul
Ce que l'offre existante laisse de côté
- On montre l'outil d'orchestration en marche, presque jamais en panne. La reprise après échec et le rattrapage d'une période passée restent hors des exercices, alors que c'est l'essentiel du travail réel.
- La qualité des données est traitée comme un chapitre de cours, pas comme un test qui arrête la chaîne. On apprend à mesurer la qualité, pas à bloquer une publication.
- Le coût et les droits d'accès sont renvoyés à « l'administrateur » ou à « l'équipe sécurité », alors que les annonces les demandent à l'ingénieur de données lui-même.
Ce qu'INOPNIX ajoute
- La panne provoquée, en séance. → MODULE 3, séance 14 : source coupée, disque plein, type de colonne changé. TP-3 : l'incident est injecté sans que tu saches lequel, et tu rends le compte rendu.
- Le test qui bloque la publication, pas le tableau de bord de qualité. → MODULE 4, séance 17, et TP-4 : une altération de la source doit faire échouer la chaîne AVANT l'étape de publication, avec un message nommant le test et le nombre de lignes fautives.
- La gouvernance et le coût comme livrable chiffré. → MODULE 5 et TP-5 : matrice des accès, traitement de chaque colonne personnelle, durée de conservation, et coût mensuel décomposé en stockage et calcul.
Examen seul
- Tu ne suis aucun cours. Tu passes l'épreuve.
- L'examen seul : 109 $US
- Préparation accompagnée : 189 $US (certification incluse)
- Compte 35 à 45 heures de travail personnel pour te préparer seul. C'est une ESTIMATION, pas un horaire : personne ne peut savoir combien de temps tu mets à lire.
- CE QUE TU REÇOIS AVEC LA PRÉPARATION : le référentiel complet de la certification · deux examens blancs corrigés · une séance de correction collective de 2 h · les énoncés des travaux pratiques du parcours (TP-0 à TP-5) et les fichiers de conteneurs
- CE QUE TU NE REÇOIS PAS : les séances en direct · l'accompagnement individuel du chef-d'œuvre
- L'épreuve est LA MÊME. Même barème, même seuil, même minimum par épreuve.