من نحن
في دايسون، يدفنا السعي المستمر نحو الابتكار—لتجاوز الحدود في الهندسة والذكاء الاصطناعي والروبوتات. يقع فريق ذكاء البيانات الجديد لدينا في قلب هذه المهمة: صياغة مستقبل دايسون من خلال البيانات. هنا، ندمج الإبداع والدقة والجرأة لدعم المنتجات الذكية. نحن نصمم استراتيجيات وخطوط أنابيب البيانات التي تغذي الجيل القادم من الأجهزة المتصلة.
ستعمل جنبًا إلى جنب مع عقول ألمعية من فريق الهندسة العالمي في دايسون وشركاء البرمجيات/الأجهزة الخارجيين في بيئة مبنية على الاستكشاف والاكتشاف والتقديم والأثر.
عن الدور الوظيفي
نحن نبحث عن مهندس أول لتعلم الآلة وذكاء البيانات متخصص لتصميم وتنفيذ أدوات داخلية تعمل على أتمتة خطوط أنابيب تسمية البيانات لدينا. سيكون هدفك الرئيسي هو تقليل اعتمادنا على التسمية التوضيحية اليدوية من خلال الاستفادة من تقنيات مثل التعلم النشط، والإشراف الضعيف، وتوليد البيانات الاصطناعية. ستسد الفجوة بين جمع البيانات الخام ومجموعات البيانات الجاهزة للنماذج، مما يضمن تصنيفات عالية الجودة على نطاق واسع.
المسؤوليات الرئيسية
- تصميم خطوط أنابيب التسمية: تصميم ونشر أنظمة تسمية مؤتمتة متكاملة باستخدام أطر عمل مثل Snorkel أو Cleanlab أو حلقات التعلم النشط المخصصة.
- تطوير أنظمة "العنصر البشري في الحلقة" (HITL): بناء واجهات وسير عمل حيث تقوم النماذج بالتسمية المسبقة للبيانات وتدخل البشر فقط في العينات ذات الشك العالي.
- ضمان الجودة وإزالة الضوضاء: تنفيذ عمليات تحقق خوارزمية للتعرف على البيانات الخاطئة التسمية أو "الصاخبة" وتصحيحها ضمن مجموعات البيانات الحالية.
- الأدوات والتكامل: التعاون مع مهندسي البرمجيات لدمج أدوات التسمية مع بحيرات البيانات الحالية وبنية التخزين التحتية لتدريب تعلم الآلة.
- تحسين النماذج: ضبط "النماذج المعلمة" لتوليد تسميات زائفة عالية الجودة للنماذج "التلميذة".
- إعداد وصيانة بنية تحتية قوية لإعداد البيانات—مع التحسين من أجل جودة البيانات والسرعة والتكامل السلس مع خطوط أنابيب MLOps اللاحقة.
- إجراء تصور البيانات والتحليل المتعمق باستخدام تقنيات هندسة البيانات والميزات المتقدمة. ستساعد في تحويل البيانات الخام إلى رؤى قابلة للتنفيذ، مما يدعم كلاً من البحث والنشر.
- العمل عن كثب مع علماء البيانات ومهندسي البرمجيات وفرق المنتجات لضمان جودة عالية للبيانات وقابلية استخدامها عبر المنتجات والمشاريع.
نبذة عنك
- خبرة مهنية لا تقل عن 8 سنوات أو أكثر في هندسة تعلم الآلة، وبشكل خاص التركيز على الذكاء الاصطناعي المرتكز على البيانات أو خطوط أنابيب الرؤية الحاسوبية/معالجة اللغة الطبيعية (NLP).
- إتقان لغة Python: إتقان حزمة تعلم الآلة (PyTorch أو TensorFlow و NumPy و Pandas و Scikit-learn).
- خبرة في التسمية المؤتمتة: خبرة مثبتة في الإشراف الضعيف (دوال التسمية) أو استراتيجيات التعلم النشط (أخذ عينات عدم اليقين، أخذ عينات التنوع).
- هندسة البيانات: خبرة في قواعد بيانات SQL و NoSQL، وإدارة البيانات غير المهيكلة واسعة النطاق (الصور أو النصوص أو الصوت).
- البنية التحتية السحابية: دراية بـ AWS (SageMaker Ground Truth) أو GCP (Vertex AI) أو خدمات التسمية في Azure ML.
- التحكم في إصدارات البيانات: خبرة في DVC (التحكم في إصدار البيانات) أو أدوات مماثلة لتتبع تكرارات مجموعة البيانات.
- خبرة عملية في بناء حلول التسمية التلقائية أو العمل مع سير عمل التسمية التوضيحية للبيانات واسعة النطاق.
- مهارات متقدمة في Python (و/أو اللغات الأخرى ذات الصلة)، وخبرة في مكتبات تعلم الآلة/علم البيانات الرئيسية (مثل TensorFlow و PyTorch و scikit-learn و pandas).
- خبرة في تصميم ونشر وصيانة خطوط أنابيب البيانات القابلة للتوسع، بما في ذلك تنظيف البيانات وتحويلها وتخزينها (في السحابة أو المحلية أو الهجينة).
- خلفية قوية في هندسة الميزات وتحليل البيانات وتصور البيانات—الارتياح في استخدام أدوات مثل Jupyter أو Tableau أو Power BI.
- متواصل ممتاز يوثق الحلول بوضوح ويتعاون بسهولة عبر الفرق الفنية وغير الفنية.
- القدرة على الموازنة بين السرعة والجودة، والبقاء فضوليًا بشأن التطورات الجديدة، وتحقيق النتائج في بيئة سريعة الحركة.
- درجة البكالوريوس أو الماجستير في علوم الكمبيوتر أو الهندسة أو الرياضيات أو علم البيانات أو مجال ذي صلة.
دايسون هي شركة تكافئ الفرص بالتساوي. نحن نعلم أن العقول العظيمة لا تفكر بالطريقة نفسها، وأن الأمر يتطلب جميع أنواع العقول لجعل تقنيتنا فريدة للغاية. نرحب بالطلبات من جميع الخلفيات ويتم اتخاذ قرارات التوظيف دون النظر إلى العرق أو اللون أو الدين أو الأصل الوطني أو العرقي أو الجنس أو التوجه الجنسي أو الهوية الجنسية أو التعبير عنها أو العمر أو الإعاقة أو وضع المحاربين القدامى المحميين أو أي بعد آخر من أبعاد التنوع.
About Us
At Dyson, we’re driven by a relentless pursuit of innovation—pushing boundaries in engineering, AI, and robotics. Our new Data Intelligence team sits at the heart of this mission: shaping Dyson’s future through data. Here, we blend creativity, precision, and audacity to power intelligent products. We craft data strategies and pipelines that fuel the next generation of connected devices.
You’ll work alongside brilliant minds from Dyson global engineering team and external software/hardware partners in an environment built for exploration, discovery, delivery and impact.
About The Role
We are looking for a specialized Lead Data Intelligence Machine Learning Engineer to design and implement in-house tools that automate our data labelling pipelines. Your primary goal will be to reduce our reliance on manual annotation by leveraging techniques like Active Learning, Weak Supervision, and Synthetic Data Generation. You will bridge the gap between raw data collection and model-ready datasets, ensuring high-quality labels at scale.
Key Responsibilities
- Architect Labelling Pipelines: Design and deploy end-to-end automated labelling systems using frameworks like Snorkel, Cleanlab, or custom active learning loops.
- Develop "Human-in-the-Loop" (HITL) Systems: Build interfaces and workflows where models pre-label data and humans only intervene on high-uncertainty samples.
- Quality Assurance & Denoising: Implement algorithmic checks to identify and correct mislabelled or "noisy" data within existing datasets.
- Tooling & Integration: Collaborate with software engineers to integrate labelling tools with our existing data lakes and ML training infrastructure.
- Model Optimization: Fine-tune "teacher" models to generate high-quality pseudo-labels for "student" models.
- Set up and maintain robust data preparation infrastructure—optimising for data quality, speed, and seamless integration with downstream MLOps pipelines.
- Perform data visualization and in-depth analysis using advanced data and feature engineering techniques. You’ll help transform raw data into actionable insight, supporting both research and deployment.
- Work closely with Data Scientists, Software Engineers, and Product teams to ensure high data quality and usability across products and projects.
About you
- At least 8+ years of professional experience in Machine Learning engineering, specifically focused on data centric-AI or computer vision/NLP pipelines.
- Proficiency in Python: Mastery of the Machine Learning stack (PyTorch or TensorFlow, NumPy, Pandas, Scikit-learn).
- Automated Labelling Expertise: Proven experience with Weak Supervision (labelling functions) or Active Learning strategies (uncertainty sampling, diversity sampling).
- Data Engineering: Experience with SQL and NoSQL databases, and managing large-scale unstructured data (images, text, or audio).
- Cloud Infrastructure: Familiarity with AWS (SageMaker Ground Truth), GCP (Vertex AI), or Azure ML labelling services.
- Version Control for Data: Experience with DVC (Data Version Control) or similar tools to track dataset iterations.
- Hands-on expertise building auto-labelling solutions or working with large-scale data annotation workflows.
- Advanced skills in Python (and/or other relevant languages), and experience with key ML/data science libraries (e.g. TensorFlow, PyTorch, scikit-learn, pandas).
- Experience designing, deploying, and maintaining scalable data pipelines, including data cleansing, transformation, and storage (cloud, on-prem, or hybrid).
- Strong background in feature engineering, data analysis, and data visualization—comfortable using tools like Jupyter, Tableau, or Power BI.
- Great communicator who documents solutions clearly and collaborates effortlessly across technical and non-technical teams.
- Able to balance speed and quality, stay curious about new developments, and deliver results in a fast-moving environment.
- Bachelor’s or Master's degree in computer science, Engineering, Mathematics, Data Science, or a related field.
Dyson is an equal opportunity employer. We know that great minds don’t think alike, and it takes all kinds of minds to make our technology so unique. We welcome applications from all backgrounds and employment decisions are made without regard to race, colour, religion, national or ethnic origin, sex, sexual orientation, gender identity or expression, age, disability, protected veteran status or other any other dimension of diversity.