الغرض من الوظيفة:
يتولى الأخصائي الأول - عمليات النظام (تطوير العمليات) مسؤولية إدارة وتحسين وتأمين البنية التحتية للمؤسسة، ومنصات السحابة، وسلاسل أدوات تطوير العمليات (DevOps)، وأطر الأتمتة، وبيئات الحاويات. يضمن هذا الدور الموثوقية وقابلية التوسع والأداء والتميز التشغيلي عبر المنصات الداخلية والمستضافة للعملاء، مع تقديم دعم فني متقدم للحوادث وطلبات الخدمة والتحديات التشغيلية.
المسؤوليات الرئيسية: -
البنية التحتية والعمليات: المشاركة في تصميم وتخطيط وتنفيذ المشاريع والتقنيات الجديدة، وضمان أن تكون الحلول ذات توافر عالٍ وآمنة وقابلة للتوسع وذات أداء عالٍ. تقديم الدعم التشغيلي اليومي من المستوى الثاني والثالث (L2/L3)، بما في ذلك إدارة الحوادث وطلبات الخدمة والمشكلات والتغييرات والمهام التشغيلية. مراقبة أداء البنية التحتية، وتحديد الاختناقات وحلها، واستكشاف أخطاء الانقطاعات وإصلاحها، وإجراء تحليل الأسباب الجذرية، والتوصية بالتحسينات. تأمين البنية التحتية من خلال وضع السياسات وإنفاذها، وتحديد الوصول ومراقبته، ودعم معالجة الثغرات والمخاطر. الحفاظ على فحوصات سلامة البنية التحتية واتخاذ إجراءات استباقية لتقليل وقت التوقف عن العمل ومشكلات الأداء. التأكد من نسخ الخدمات احتياطياً وإمكانية استردادها وفقاً لسياسات النسخ الاحتياطي والاسترداد المعتمدة. إبلاغ الإدارة بحالة البنية التحتية التشغيلية والمخاطر والتقدم والاعتمادات والتحديات. المشاركة بفعالية في المشاريع الجديدة ومبادرات التكنولوجيا وإلحاق عملاء وخدمات جديدة.
منصة السحابة وهندسة المنصات: تصميم ونشر وإدارة وتحسين البنية التحتية وخدمات المنصة في Microsoft Azure. دعم مبادرات ترحيل السحابة، والتحديث، وتكامل السحابة الهجينة، والحوكمة، والأمان، والتوافر، وتحسين التكلفة. تنفيذ بنيات سحابية مرنة وخدمات منصة موحدة تعمل على تحسين قابلية التوسع والكفاءة التشغيلية.
الحاويات، والتنسيق، وGit Ops: نشر وإدارة وترقية واستكشاف أخطاء أعباء العمل في الحاويات باستخدام Kubernetes وDocker وHelm. تنفيذ ممارسات النشر وإدارة التكوين القائمة على Git Ops لعمليات منصة متسقة وقابلة للتدقيق ومتكررة. مراقبة وتحسين توافر العنقود (Cluster) والأداء واستخدام الموارد والسعة والأمان.
البنية التحتية ككود (IaC) وإدارة التكوين: تطوير وصيانة البنية التحتية ككود باستخدام Terraform وAnsible وBicep. إنشاء وحدات ونماذج وكتيبات تشغيل وسير عمل توفير مؤتمتة قابلة لإعادة الاستخدام. الحفاظ على تعريفات البنية التحتية ومعايير التكوين الخاضعة للتحكم في الإصدار لضمان الاتساق عبر البيئات.
CI/CD وDevSecOps: تصميم وبناء وصيانة وتحسين خطوط أنابيب CI/CD باستخدام Jenkins وGitHub وGitLab وAzure DevOps. أتمتة عمليات البناء والاختبار والتحقق من الأمان والنشر والتراجع والإصدار. التعاون مع فرق التطوير والأمان والعمليات لدمج عناصر التحكم في الأمان والامتثال والجودة في خطوط أنابيب التسليم. تعزيز ممارسات DevOps وGit Ops لتحسين سرعة النشر والاتساق وإمكانية التتبع والموثوقية.
البرمجة النصية وأتمتة سير العمل: تطوير وصيانة نصوص الأتمتة وملفات التكوين باستخدام Bash وPowerShell وPython وYAML. أتمتة البنية التحتية المتكررة والنشر والمراقبة وإعداد التقارير وأنشطة إدارة الخدمة لتقليل الجهد اليدوي والمخاطر التشغيلية. دمج منصات المؤسسة وواجهات برمجة التطبيقات (APIs) وسير العمل لتبسيط تقديم الخدمات والعمليات التشغيلية.
المراقبة والقابلية للملاحظة (Observability): تنفيذ وصيانة حلول المراقبة ولوحات المعلومات والتنبيهات والقابلية للملاحظة باستخدام Prometheus وGrafana وAzure Monitor وLog Analytics. إجراء المراقبة الاستباقية وتخطيط السعة وتحليل الاتجاهات وتحسين الأداء للحفاظ على استقرار الخدمة وتوافرها.
الذكاء الاصطناعي والأتمتة: نشر ودعم خدمات Azure AI والحلول التي تدعم الذكاء الاصطناعي تشغيلياً وفقاً لمتطلبات الأمان والحوكمة. تصميم وتنفيذ أتمتة سير العمل التي تعمل على تحسين الكفاءة التشغيلية وأوقات الاستجابة وجودة الخدمة. تقييم التقنيات الناشئة في مجال الذكاء الاصطناعي والسحابة والأتمتة من أجل الاعتماد العملي وتعزيز الخدمة. إدارة الخدمة والتوثيق ودعم أصحاب المصلحة: ضمان الامتثال لسياسات وعمليات وإجراءات ITSM المعتمدة وإرشادات إدارة الخدمة. كتابة تقارير فنية شاملة وإجراءات تشغيلية ونتائج التقييم ومقالات قاعدة المعارف وسجلات الأخطاء المعروفة وتوثيق استكشاف الأخطاء وإصلاحها.
المهارات/الشهادات (التقنية وغير التقنية): شهادة مسؤول نظام معتمد من Red Hat (RHCSA) أو مهندس معتمد من Red Hat (RHCE)، شهادة Microsoft: مسؤول Azure مشارك.
الحد الأدنى لخبرة العمل: -
5 سنوات فأكثر من الخبرة ذات الصلة.
التعليم: -
درجة البكالوريوس في علوم الحاسب، أو هندسة الحاسب، أو تكنولوجيا المعلومات، أو نظم المعلومات، أو شهادة الثانوية العامة مع خبرة عمل ذات صلة قوية.
Job Purpose:
The Senior Specialist - Sys Ops (Dev Ops) is responsible for managing, optimizing, and securing enterprise infrastructure, cloud platforms, Dev Ops toolchains, automation frameworks, and containerized environments. The role ensures reliability, scalability, performance, and operational excellence across internal and customer-hosted platforms while providing advanced technical support for incidents, service requests, and operational challenges.
Key Responsibilities: -
Infrastructure and Operations Participate in the design, planning, and implementation of new projects and technologies, ensuring that solutions are highly available, secure, scalable, and performant. Provide day-to-day L2/L3 operational support, including incidents, service requests, problems, changes, and operational tasks. Monitor infrastructure performance, identify and resolve bottlenecks, troubleshoot outages, perform root cause analysis, and recommend improvements. Secure infrastructure by establishing and enforcing policies, defining and monitoring access, and supporting vulnerability and risk remediation. Maintain infrastructure health checks and proactively take action to minimize downtime and performance issues. Ensure services are backed up and recoverable in accordance with approved backup and recovery policies. Report operational infrastructure status, risks, progress, dependencies, and challenges to management. Actively participate in new projects, technology initiatives, and the onboarding of new customers and services. Cloud Platform and Platform Engineering Design, deploy, administer, and optimize Microsoft Azure infrastructure and platform services. Support cloud migration, modernization, hybrid-cloud integration, governance, security, availability, and cost optimization initiatives. Implement resilient cloud-native architectures and standardized platform services that improve scalability and operational efficiency. Containers, Orchestration, and Git Ops Deploy, manage, upgrade, and troubleshoot containerized workloads using Kubernetes, Docker, and Helm. Implement Git Ops-based deployment and configuration management practices for consistent, auditable, and repeatable platform operations. Monitor and optimize cluster availability, performance, resource utilization, capacity, and security. Infrastructure as Code and Configuration Management Develop and maintain Infrastructure as Code using Terraform, Ansible, and Bicep. Create reusable modules, templates, playbooks, and automated provisioning workflows. Maintain version-controlled infrastructure definitions and configuration standards to ensure consistency across environments. CI/CD and Dev Sec Ops Design, build, maintain, and optimize CI/CD pipelines using Jenkins, Git Hub, Git Lab, and Azure Dev Ops. Automate build, test, security validation, deployment, rollback, and release processes. Collaborate with development, security, and operations teams to embed security, compliance, and quality controls into delivery pipelines. Promote Dev Ops and Git Ops practices to improve deployment speed, consistency, traceability, and reliability. Scripting and Workflow Automation Develop and maintain automation scripts and configuration files using Bash, Power Shell, Python, and YAML. Automate repetitive infrastructure, deployment, monitoring, reporting, and service-management activities to reduce manual effort and operational risk. Integrate enterprise platforms, APIs, and workflows to streamline service delivery and operational processes. Monitoring and Observability Implement and maintain monitoring, dashboards, alerting, and observability solutions using Prometheus, Grafana, Azure Monitor, and Log Analytics. Perform proactive monitoring, capacity planning, trend analysis, and performance optimization to maintain service stability and availability.
AI and Automation Deploy and operationally support Azure AI services and AI-enabled solutions in accordance with security and governance requirements. Design and implement workflow automation that improves operational efficiency, response times, and service quality. Evaluate emerging AI, cloud-native, and automation technologies for practical adoption and service enhancement. Service Management, Documentation, and Stakeholder Support Ensure compliance with approved ITSM policies, processes, procedures, and service-management guidelines. Write comprehensive technical reports, operational procedures, assessment findings, knowledge-base articles, known-error records, and troubleshooting documentation.
Skills/Certifications (Technical & Non-Technical) Red Hat Certified System Administrator (RHCSA) or Red Hat Certified Engineer (RHCE) Microsoft Certified: Azure Administrator Associate
Minimum Work Experience: -
5+ Years of Relevant Experience
Education: -
Bachelor’s degree in computer science, Computer Engineering, Information Technology, Information Systems or High School Diploma and Solid Related Work Experience.