Maquerria — Data & Analytics

Ressources et listes de vérification

Cette page rassemble des outils prêts à l'emploi pour concevoir, tester et maintenir vos pipelines de données au quotidien. Vous y trouverez des listes de vérification actionnables, des repères techniques concrets et des réponses aux questions les plus fréquentes des équipes data. L'objectif : vous éviter les oublis coûteux et vous donner des points de contrôle fiables à chaque étape.

Liste de vérification pour concevoir un nouveau pipeline

Liste de contrôle qualité et mise en production

Repères essentiels

Faut-il choisir ETL ou ELT pour un nouveau projet ?

Cela dépend de la puissance de votre entrepôt et de votre besoin de conserver les données brutes. L'ELT est adapté aux entrepôts cloud élastiques (BigQuery, Snowflake, Redshift) où le calcul est disponible à la demande. L'ETL reste pertinent quand vous devez transformer ou anonymiser les données avant qu'elles n'entrent dans la cible.

Comment savoir si un pipeline en temps réel est vraiment nécessaire ?

Posez-vous la question de la valeur métier d'une latence réduite. Si une décision ou une action se déclenche à la seconde (détection de fraude, alertes opérationnelles), le streaming se justifie. Dans la majorité des cas analytiques, un batch horaire ou un micro-batch suffit et coûte bien moins cher à exploiter.

Quels tests de qualité mettre en place en priorité ?

Commencez par les contrôles à fort impact : fraîcheur des données, unicité des clés, absence de nulls sur les colonnes critiques et cohérence des volumes. Ces quatre tests détectent la grande majorité des incidents avant qu'ils n'atteignent les tableaux de bord.

Quel outil d'orchestration choisir ?

Le choix se fait selon votre écosystème et vos compétences. Airflow reste une référence pour l'orchestration en Python via des DAG, tandis que des outils comme Dagster ou Prefect apportent une meilleure gestion des données et du typage. L'important est de disposer d'une gestion claire des dépendances, des reprises et de la visibilité sur les exécutions.

Comment gérer l'évolution d'un schéma source ?

Anticipez le schema evolution dès la conception : décidez si les nouvelles colonnes doivent être ignorées, ajoutées automatiquement ou déclencher une alerte. Utilisez une zone de quarantaine pour les enregistrements non conformes et versionnez vos transformations pour pouvoir rejouer un historique en cas de changement.

À quelle fréquence faut-il surveiller et maintenir un pipeline ?

La surveillance doit être continue via des alertes automatiques sur les échecs et les anomalies de volume. La maintenance active (revue des coûts, nettoyage des tâches obsolètes, mise à jour des tests) gagne à être planifiée de façon régulière, par exemple mensuellement, pour éviter l'accumulation de dette technique.

En savoir plus