Ingénieur de données - Python Spark - Mid
Détails
Description
Résumé du poste
• Participer à la conception des flux de travail d’ingestion et de traitement des données dans PySpark, en fonction de règles d’affaires définies.
• Développer et encapsuler des scripts à l’aide de PySpark pour mettre en œuvre des transformations de données et une logique de traitement.
• Mettre en œuvre et gérer les pipelines Oozie pour planifier et orchestrer efficacement les étapes de traitement.
• Utilisez Git pour le contrôle de version et la gestion collaborative du code.
• Appliquer sa connaissance des principes CI/CD pour soutenir la livraison continue et l’intégration dans les environnements Big Data.
• Démontrer une compréhension des concepts du Big Data tels que l’encapsulation des composants, la gestion des files d’attente, la gestion des sessions Spark et les pipelines CI/CD adaptés aux flux de travail du Big Data.
• Préparer et exécuter des tests unitaires (UT), y compris la création des ensembles de données nécessaires, et utiliser les outils ALM le cas échéant.
• Documenter minutieusement le travail à travers des livrables en Git, Confluence et/ou des formats de documents standard tels que .doc et .xls.
Compétences/expérience requises :
•
• Python – Spark - PySpark
• Expérience du développement à l’aide des composants ASP.NET 8, Blazor et Syncfusion.
• Familiarité avec les plateformes CI/CD telles que Azure DevOps et SonarQube.
• Connaissance pratique des technologies de conteneurisation, en particulier de Docker.
• Expérience avec des frameworks de test tels que xUnit et Moq pour les tests unitaires et d’intégration.
• Maîtrise de la manipulation et de l’interrogation de données SQL.
Ancienneté d’exercice : expérience d’au moins 3,5 ans
Compétences / expérience souhaitées :
• Clusters Big Data sécurisés avec l’authentification Kerberos, basés sur les distributions HortonWorks HDP 3.1.5 et HDF 3.5.1, actuellement en migration vers Cloudera.
• Les technologies et outils de base comprennent :
• Apache Spark avec Python
• HDFS (Hadoop Distributed File System)
•Ruche
• HBase
• Planificateur de flux de travail Oozie
• Gestion des ressources YARN
• Apache Atlas pour la gestion des métadonnées
• Jenkins pour CI/CD
• Kerberos pour la sécurité et l’authentification
