Batch Energy Analytics Pipeline (AWS)
TerminéPipeline batch serverless qui ingère les données mensuelles de production d'électricité depuis l'API Ember pour 8 pays européens, transforme le JSON imbriqué en format Parquet via AWS Glue et visualise les tendances de production énergétique dans un tableau de bord Amazon QuickSight.
Technologies
Problème
Les données brutes de l'API Ember arrivent en JSON imbriqué non directement interrogeable. Aucune vue unifiée des tendances de production d'électricité européenne par pays et source d'énergie n'existait.
Approche
Script d'ingestion Python → couche S3 brute (partitionnement Hive par date) → ETL AWS Glue (transformations Explode + Flatten) → couche S3 traitée (Parquet/Snappy) → Glue Crawler → validation Athena → tableau de bord QuickSight.
Résultat
Tableau de bord interactif montrant les tendances de production d'électricité dans 8 pays européens de 2020 à 2026, avec un plafond budgétaire mensuel de 50 USD.
Apprentissages
AWS Glue nécessite des transformations Explode + Flatten explicites pour les API JSON imbriquées ; les colonnes de date QuickSight doivent être typées comme Date (pas string) pour les graphiques à axe temporel ; les permissions QuickSight sont configurées séparément d'AWS IAM.
Pertinence
Pipeline AWS de bout en bout cloud-native de l'ingestion API à la visualisation métier ; démontre l'architecture ETL serverless et l'intégration des services analytics AWS.