ما به یک باSenior Data Engineer با بیش از 5 سال سابقه کاری نیاز داریم که بتواند در طراحی، توسعه و نگهداری زیرساخت داده پروژه هوشمندسازی زنجیره تأمین نقش کلیدی داشته باشد و دادههای مورد نیاز برای تحلیلهای پیشرفته، مدلهای پیشبینی، سیستمهای هوشمند و محصولات مبتنی بر AI را فراهم کند.
این نقش ترکیبی از مهندسی داده، طراحی و توسعه Pipelineهای داده، مدیریت معماری Data Platform و همکاری نزدیک با تیمهای Data Science، Backend و Product است. فرد مناسب برای این موقعیت باید توانایی طراحی سیستمهای داده مقیاسپذیر، کار با دادههای حجیم، حل مسائل کیفیت داده و ایجاد فرآیندهای قابل اتکا برای جمعآوری، پردازش و ارائه داده را داشته باشد.
مسئولیتها:
طراحی، توسعه و نگهداری Pipelineهای ETL/ELT برای استخراج، پردازش و انتقال داده از منابع مختلف
توسعه فرآیندهای Data Ingestion برای دریافت دادههای ساختاریافته و غیرساختاریافته از منابع مختلف شامل Database، API، فایلها و سرویسهای خارجی
پیادهسازی فرآیندهای پردازش داده به صورت Batch و Near Real-time
طراحی و توسعه معماری Data Lake / Lakehouse برای مدیریت دادههای حجیم پروژه
طراحی و نگهداری لایههای مختلف داده شامل Raw، Processed، Analytics و Feature Layer
توسعه فرآیندهای پاکسازی، استانداردسازی، نرمالسازی و آمادهسازی دادهها
پیادهسازی مکانیزمهای Data Quality، Data Validation و کنترل صحت دادهها
شناسایی و رفع مشکلات مربوط به دادههای ناقص، تکراری، ناسازگار و غیرقابل اعتماد
طراحی و بهینهسازی Data Model و Schemaهای مورد استفاده در تحلیل و پردازش داده
توسعه و بهینهسازی Queryهای SQL برای پردازش و تحلیل دادههای حجیم
طراحی و پیادهسازی فرآیندهای Monitoring، Logging و Alerting برای Pipelineها و Jobهای داده
پایش عملکرد فرآیندهای پردازش داده، شناسایی خطاها و انجام Root Cause Analysis
همکاری نزدیک با تیم Data Science برای آمادهسازی Datasetها، Feature Engineering و ارائه داده مورد نیاز مدلهای Machine Learning
فراهمسازی زیرساخت داده مورد نیاز برای توسعه RAG، LLM و AI Agentهای سازمان
توسعه فرآیندهای خودکارسازی داده و کاهش فعالیتهای دستی در چرخه پردازش اطلاعات
مستندسازی معماری داده، Pipelineها، فرآیندهای پردازشی و استانداردهای داده
همکاری با تیمهای Product، Backend و Business برای تبدیل نیازمندیهای کسبوکار به راهکارهای دادهای قابل استفاده
شرایط موردنیاز:
حداقل 5 سال سابقه کار مرتبط در حوزه Data Engineering
تسلط پیشرفته به SQL و توانایی نوشتن، بررسی و بهینهسازی Queryهای پیچیده
تجربه عملی کار با PostgreSQL و دیتابیسهای رابطهای
تجربه طراحی و توسعه Pipelineهای ETL/ELT
تسلط به Python برای پردازش داده، توسعه ابزارهای Data Engineering و Automation
تجربه کار با معماریهای Data Warehouse، Data Lake یا Lakehouse
تجربه کار با دادههای حجیم و فرآیندهای پردازش داده
توانایی طراحی Data Model و ساختارهای ذخیرهسازی مناسب
تجربه کار با ابزارهای مدیریت Workflow و Orchestration مانند Airflow
تجربه کار با Docker و محیطهای توسعه نرمافزاری
آشنایی با Git و فرآیندهای توسعه نرمافزار
توانایی تحلیل مشکلات داده، Debug کردن Pipelineها و حل مسئله به صورت مستقل
توانایی مستندسازی و ارتباط موثر با تیمهای فنی و کسبوکار
مواردی که امتیاز محسوب میشوند:
تجربه کار با Apache Spark و پردازش Distributed Data
تجربه کار با Kafka و Streaming Data Pipeline
تجربه CDC و ابزارهایی مانند Debezium
تجربه کار با Data Lakehouse
تجربه کار با ClickHouse یا سایر
تجربه کار با Elasticsearch و Vector Databaseها
تجربه طراحی Data Platform در مقیاس سازمانی
تجربه کار با Data Governance، Data Lineage و Metadata Management
تجربه همکاری در پروژههای AI، Machine Learning و LLM-based Applications
آشنایی با RAG Pipeline و معماری Agent-based AI Systems