وصف الوظيفة
ملخص الدور نحن نبحث عن مهندس بيانات عملي يمتلك خبرة قوية في ETL وPySpark لتصميم وبناء ودعم خطوط البيانات ومستنقعات البيانات ضمن بيئة مصرفية.
المرشح المثالي سيكون مالك دورة حياة SDLC كاملة — من البناء حتى اختبار القبول قبل الإنتاج، ونشر الإنتاج، والدعم بعد الإنتاج — مع العمل عبر البيانات المهيكلة والمهيأة جزئياً وغير المهيكلة.
المسؤوليات الرئيسية تصميم وتطوير وصيانة خطوط ETL ومستودعات البيانات باستخدام PySpark وبايثون كتابة كود بايثون نظيف وقابل للصيانة وذا جودة إنتاج باتباع ممارسات هندسة البرمجيات أفضل الممارسات امتلاك أنشطة SDLC من البداية إلى النهاية: البناء، دعم UAT، إصلاحات أخطاء UAT، نشر الإنتاج، والدعم بعد الإنتاج إجراء تحليل البيانات وتصحيحها باستخدام Oracle SQL وPySpark العمل عبر مصادر بيانات مهيكلة، ومهيأة جزئياً، وغير مهيكلة بناء وصيانة حلول مستودعات البيانات التي تدعم احتياجات التقارير المصرفية/المالية تصحيح وتحسين وظائف PySpark لأداء وموثوقية التعاون مع فرق متعددة التخصصات (QA، DBAs، محللو الأعمال) خلال دورة الإصدار المشاركة في عمليات سلسلة الأدلة CI/CD، بما في ذلك الاختبار والتحقق من صحة خطوط البيانات ضمان موثوقية وتوسع خطوط البيانات والامتثال لمعايير حوكمة البيانات المصرفية/الإمتثال المتطلبات والمهارات خبرة تزيد عن 5 سنوات في دور هندسة يعتمد على البيانات خبرة عملية في بناء مستودعات البيانات وخطوط ETL مستوى خبير في PySpark وبايثون لأ scripting ETL قدرة قوية على SQL Oracle لتحليل البيانات وتصحيحها خبرة مثبتة عبر كامل SDLC — البناء، UAT، إصلاحات، النشر، الدعم بعد الإنتاج فهم قوي لمفاهيم وممارسات هندسة البرمجيات لخطوط الإنتاج العمل مع البيانات المهيكلة، والمهيأة جزئياً، وغير المهيكلة خبرة سابقة مع عملاء مصرفيين أو معرفة عميقة بمجال المصارف أساسيات مستودعات البيانات التقنية (الاستخدام اليومي) لغات البرمجة: بايثون البيانات الضخمة: Spark / PySpark، Hadoop، MapReduce، Hive مكتبات البيانات: Pandas قواعد البيانات: SQL وNoSQL DBMS أدوات: Jupyter الممارسات: CI/CD، اختبارات البيانات والتحقق من صحتها من الأفضل امتلاكها في حال وجودها (اختياري — أضف إن كان ذلك مناسباً) خبرة سحابية (AWS/Azure/GCP) — لم تذكر في مدخلاتك، تأكيد مع العميل الشغور Airflow أو أدوات تنظيم أخرى خبرة في التقارير التنظيمية/الامتثال في المصارف
Job description
Role Summary We are looking for a hands-on Data Engineer with strong ETL and PySpark expertise to design, build, and support data pipelines and data marts within a banking environment.
The ideal candidate will own the full SDLC lifecycle — from build through UAT, production deployment, and post-production support — while working across structured, semi-structured, and unstructured data.
Key Responsibilities Design, develop, and maintain ETL pipelines and data marts using PySpark and Python Write clean, maintainable, and production-grade Python code following software engineering best practices Own end-to-end SDLC activities: build, UAT support, UAT bug fixes, production deployment, and post-production support Perform data analysis and debugging using Oracle SQL and PySpark Work across structured, semi-structured, and unstructured data sources Build and maintain data warehousing solutions supporting banking/financial reporting needs Debug and optimize PySpark jobs for performance and reliability Collaborate with cross-functional teams (QA, DBAs, business analysts) through the release cycle Participate in CI/CD pipeline processes, including testing and validation of data pipelines Ensure data pipeline reliability, scalability, and adherence to banking data governance/compliance standards Required Skills & Experience 5+ years of commercial experience in a data-driven engineering role Hands-on experience building data marts and ETL pipelines Expert-level PySpark and Python for ETL scripting Strong command of Oracle SQL for data analysis and debugging Proven experience across the full SDLC — build, UAT, bug fixing, deployment, post-prod support Strong understanding of software engineering concepts and best practices for production pipelines Experience working with structured, semi-structured, and unstructured data Prior experience with banking clients or strong banking domain knowledge Strong data warehousing fundamentals Tech Stack (Daily Use) Languages: Python Big Data: Spark / PySpark, Hadoop, MapReduce, Hive Data Libraries: Pandas Databases: SQL and NoSQL DBMS Tools: Jupyter Practices: CI/CD, data testing & validation Nice to Have (optional — add if applicable) Cloud experience (AWS/Azure/GCP) — not mentioned in your input, confirm with client Airflow or other orchestration tools Experience with regulatory/compliance reporting in banking