Connaissances et compétences a acquérir
Connaissances que doit acquérir le lauréat :
A1. Gestion avancée des bases de données
Concevoir et administrer des bases de données relationnelles avancées (PostgreSQL, SQL Server) : triggers, procédures stockées, vues matérialisées, partitionnement
Modéliser des schémas dimensionnels (étoile, flocon, constellation) adaptés aux besoins décisionnels
Maîtriser les bases de données NoSQL (MongoDB, Redis, Cassandra) et choisir le modèle adapté à chaque cas d'usage
Optimiser les performances des requêtes : indexation, plans d'exécution, vacuum et maintenance
A2. Architectures de systèmes de données
Comparer et choisir entre les architectures Data Lake, Data Warehouse, Data Lakehouse, Lambda et Kappa
Implémenter un Data Lakehouse avec Apache Iceberg et formats ouverts (Parquet, Delta, ORC)
Concevoir des architectures ETL/ELT scalables et maintenables
Appliquer les principes Medallion Architecture (Bronze/Silver/Gold) dans la conception de pipelines
A3. Traitement Big Data et calcul distribué
Utiliser l'écosystème Hadoop (HDFS, YARN) pour le stockage et le traitement distribué
Développer des applications PySpark (RDD, DataFrame API, Spark SQL) pour le traitement de données volumineuses
Implémenter des pipelines de streaming avec Apache Kafka
Optimiser les performances des jobs Spark : partitionnement, caching, broadcast joins
A4. Ingénierie des pipelines et DataOps
Développer et documenter des modèles de transformation avec dbt Core (models, tests, macros, seeds, snapshots)
Orchestrer des workflows de données complexes avec Apache Airflow (DAGs, operators, sensors, XComs)
Implémenter des pratiques DataOps : CI/CD pour les données, versioning, environnements de test
Assurer la qualité des données avec Great Expectations et le catalogage avec OpenMetadata
A5. Statistiques et Machine Learning appliqués à la data
Appliquer les méthodes statistiques descriptives et inférentielles pour l'analyse de données
Développer des modèles de Machine Learning supervisé (régression, classification) et non supervisé (clustering)
Évaluer et valider les modèles : validation croisée, métriques de performance, courbes ROC
Utiliser Python scientifique : Pandas, NumPy, Scikit-learn, MLflow pour la traçabilité des expériences
A6. Business Intelligence et visualisation
Maîtriser Power BI Desktop de bout en bout : Power Query (M), modèle sémantique, DAX (mesures, colonnes calculées, KPIs)
Créer des tableaux de bord interactifs avec Power BI et Metabase pour différents secteurs (finance, industrie, logistique)
Appliquer les principes du data storytelling : narration visuelle, choix du graphique, hiérarchie de l'information
Développer des visualisations avec Python (Matplotlib, Seaborn, Plotly) pour l'exploration et la communication des données
A7. Ingénierie cloud et déploiement
Utiliser Azure for Students : Azure Synapse Analytics, Azure Data Factory (ADF), Azure Blob Storage, Azure ML AutoML
Conteneuriser des applications data avec Docker et Docker Compose
Déployer des modèles ML en production sous forme d'API REST (Flask/FastAPI)
Appliquer les principes MLOps : monitoring, retraining, gestion des versions de modèles
Compétences que doit acquérir le lauréat :
B. Compétences En Gouvernance Et Conformité
Appliquer le cadre DAMA-DMBOK pour la gouvernance des données d'entreprise
Mettre en oeuvre les exigences du Règlement Général sur la Protection des Données (RGPD) et de la loi marocaine 09-08 (CNDP)
Analyser les implications de l'EU AI Act 2024 sur les systèmes d'IA et de données
Implémenter des mesures d'anonymisation, de pseudonymisation et de sécurisation des données personnelles
Identifier et atténuer les biais algorithmiques dans les modèles de données et d'IA
C. COMPÉTENCES TRANSVERSALES
Rédiger des documentations techniques rigoureuses en français et en anglais (rapports d'analyse, spécifications, documentations de pipeline)
Communiquer des résultats analytiques à des audiences non techniques (data storytelling, présentations exécutives)
Travailler en mode projet agile (Scrum/Kanban) dans des équipes pluridisciplinaires
Exercer un esprit critique face aux données : vérification des sources, détection des anomalies, remise en question des biais
Pratiquer une veille technologique active dans un domaine en évolution rapide
D. COMPÉTENCES PROFESSIONNELLES ET ENTREPRENEURIALES
Analyser un besoin métier et le traduire en solution data technique (du cahier des charges à la mise en production)
Gérer un projet data de bout en bout : cadrage, conception, développement, livraison, maintenance
Comprendre les modèles économiques de l'économie numérique et identifier les opportunités entrepreneuriales liées à la data
Identifier et respecter les contraintes réglementaires, éthiques et de propriété intellectuelle dans un projet data.