
Mundhir Ali
Je vais construire un pipeline automatisé de données ETL en Python
Ce qui est inclus :
Extraction automatisée à partir de journaux multi-formats, CSV ou fichiers texte hérités
Sanitisation et validation des données (lignes défectueuses ou mal formées signalées automatiquement)
Transformation à grande vitesse avec DuckDB (traite 1M+ lignes en moins d’une seconde sans charger dans la RAM)
Insertion propre et structurée dans votre base de données PostgreSQL avec des garanties d’idempotence
Journalisation complète et gestion des erreurs, planifiée via les minuteurs systemd
Tout est auto-hébergé, open source et documenté. Vos données restent sur votre métal, derrière votre pare-feu. Transformons automatiquement vos journaux bruts en données exploitables.


