أو
⚙️

مهندس بيانات - Python Spark - Mid

📍 عن بُعد · 📅 نُشرت في 12-11-2025
منتهي
300 $ يومياً
انتهت مدة هذه المهمة
انتهت فترة النشر، الترشيحات مغلقة. تُنشر مهام جديدة يوميًّا.
عرض المهام المماثلة

الوصف

ملخص الوظيفة

• المشاركة في تصميم سير عمل استيعاب البيانات ومعالجتها في PySpark ، بناء على قواعد العمل المحددة.
• تطوير وتغليف البرامج النصية باستخدام PySpark لتنفيذ تحويلات البيانات ومنطق المعالجة.
• تنفيذ وإدارة مسارات Oozie لجدولة خطوات المعالجة وتنسيقها بكفاءة.
• استخدم Git للتحكم في الإصدار وإدارة التعليمات البرمجية التعاونية.
• تطبيق المعرفة بمبادئ CI / CD لدعم التسليم المستمر والتكامل داخل بيئات البيانات الضخمة.
• إظهار فهم مفاهيم البيانات الضخمة مثل تغليف المكونات وإدارة قوائم الانتظار ومعالجة جلسة Spark ومسارات CI / CD المصممة خصيصا لسير عمل البيانات الضخمة.
• إعداد وتنفيذ اختبارات الوحدة (UT) ، بما في ذلك إنشاء مجموعات البيانات اللازمة ، واستخدام أدوات ALM عند الاقتضاء.
• عمل المستندات بدقة من خلال التسليمات في Git و / أو Confluence و / أو تنسيقات المستندات القياسية مثل .doc و .xls.

الكفاءات / الخبرة المطلوبة:

• بايثون - سبارك - بايسبارك
• خبرة في التطوير باستخدام مكونات ASP.NET 8 و Blazor و Syncfusion.
• الإلمام بمنصات CI / CD مثل Azure DevOps و SonarQube.
• المعرفة العملية بتقنيات الحاويات ، وتحديدا Docker.
• خبرة في أطر الاختبار مثل xUnit و Moq لاختبار الوحدة والتكامل.
• يتقن معالجة بيانات SQL والاستعلام عنها.

أقدمية الممارسة : خبرة لا تقل عن 3,5 سنوات

الكفاءات / الخبرة المطلوبة:
• مجموعات البيانات الضخمة المؤمنة بمصادقة Kerberos، استنادا إلى توزيعات HortonWorks HDP 3.1.5 و HDF 3.5.1، والتي يتم ترحيلها حاليا إلى Cloudera.
• تشمل التقنيات والأدوات الأساسية ما يلي:
• أباتشي سبارك مع بايثون
• HDFS (نظام الملفات الموزعة Hadoop)
•خلية
• HBase
• جدولة سير عمل Oozie
• إدارة موارد YARN
• أطلس أباتشي لإدارة البيانات الوصفية
• جينكينز ل CI / CD
• Kerberos للأمان والمصادقة