استخدام کارشناس DevOps
شرح موقعیت شغلی
ما به یک مهندس DevOps باتجربه، معمارگونه و خودراهبر نیاز داریم که بتواند مالکیت فنی پلتفرم زیرساختی ما را بر عهده بگیرد. شما نهتنها مسئول پایداری و بهینهسازی زیرساخت فعلی مبتنی بر Docker هستید، بلکه نقشی کلیدی در طراحی و اجرای نقشه راه مهاجرت به Kubernetes و ذخیرهسازی توزیعشده Ceph ایفا میکنید.
مسئولیتها:
- طراحی و راهبری پلتفرم کانتینری: معماری، پیادهسازی و بهینهسازی کلاستر Docker Swarm به عنوان پلتفرم میزبانی سرویسهای سازمان
- خودکارسازی کامل زیرساخت (IaC): توسعه و نگهداری کدهای Ansible و Playbookها برای مدیریت تمام سرورها با رویکرد GitOps
- طراحی و پیادهسازی CI/CD پیشرفته: ایجاد تمپلیتهای استاندارد GitLab CI/CD برای تیمهای توسعه با قابلیت Self-Service Deployment و محیطهای چندمرحلهای
- معماری Observability: طراحی و پیادهسازی استک جامع مانیتورینگ و لاگ (Prometheus, Grafana, Loki, fluentd) با تعریف SLO و قوانین هوشمند Alertmanager
- مدیریت خطا و پایداری: پیادهسازی و نگهداری Sentry برای ردیابی متمرکز خطاهای اپلیکیشن و تحلیل ریشهای آنها
- مدیریت دسترسی امن: طراحی و پیادهسازی مکانیزمهای Just-in-Time Access و Session Audit برای دسترسی تیمها به محیط Production
- رهبری فنی رخدادها (Tier-2 Escalation): عیبیابی عمیق مشکلات پیچیده زیرساختی، ریشهیابی خطاهای سیستمی و انتقال دانش به اعضای تیم
- مستندسازی و آموزش: ایجاد Runbookها و مستندات فنی جامع و آموزش تیمهای توسعه برای استفاده از پلتفرم خودسرویس
- بهبود مستمر: ارزیابی مداوم ابزارها، متدها و معماری و ارائه پیشنهادات فنی برای افزایش کارایی و کاهش بدهی فنی
- طراحی نقشه راه آینده: تحقیق، نمونهسازی و تدوین برنامه مهاجرت پلتفرم به Kubernetes و Ceph
الزامات:
- تسلط کامل به اصولlpic
- تسلط به یک زبان برنامهنویسی ترجیحا golang یا python و مسلط به bash scripting
- تسلط به gitlab و gitlabci و آشنایی با github و github actions و bitbucket و ابزار های گیت centralized
- تسلط به Prometheus, Grafana, Loki, fluentd: طراحی داشبوردهای اختصاصی، نوشتن PromQL پیشرفته و مدیریت لاگ در مقیاس بالا
- آشنایی عمیق با پیادهسازی و نگهداری Sentry : برای مدیریت خطاهای اپلیکیشن در معماری Microservice
- آشنایی با معماری Microservice: درک عمیق Service Discovery، Circuit Breaking، Distributed Tracing و الگوهای ارتباطی
- تسلط به ابزارهای Configuration Management (Ansible): نوشتن Roleها و Playbookهای پیچیده و مدیریت Dynamic Inventory
- آشنایی با وبسرورهایiis,nginx,traefik,haproxy,apache : پیادهسازی Reverse Proxy پیشرفته با Middleware Chains و مدیریت Certificate
- آشنایی با پایگاههای دادهsql , nosql : درک Performance Tuning و High Availability
مهارتهای عمومی مورد انتظار:
- تفکر سیستمی و کلنگر: توانایی دیدن تصویر بزرگ، درک تأثیر متقابل اجزای سیستم و پیشبینی عواقب تغییرات
- رهبری فنی و منتورینگ: توانایی هدایت فنی اعضای کمتجربهتر تیم، انتقال دانش و ایجاد فرهنگ اشتراکگذاری اطلاعات
- ارتباطات مؤثر: توانایی ارائه فنی به مخاطبان غیرفنی، نوشتن مستندات شفاف و مذاکره با تیمهای مختلف
- تصمیمگیری مبتنی بر داده: استفاده از متریکها و شواهد برای انتخاب راهحلهای فنی و اجتناب از تصمیمگیریهای سلیقهای
- مدیریت ریسک و بحران: توانایی ارزیابی Trade-offها، مدیریت ریسک تغییرات زیرساختی و رهبری فرآیند عیبیابی در زمان Outage
- مالکیت (Ownership): پذیرش مسئولیت کامل خروجیها، پیگیری تا حل کامل مشکل و عدم واگذاری ناقص وظایف
- تفکر امنیتی (Security-First Mindset): در نظر گرفتن الزامات امنیتی در تمام مراحل طراحی و پیادهسازی
امتیازات ویژه و استراتژیک:
- Kubernetes و GitOps (امتیاز طلایی: تسلط به Kubernetes (CNI, CSI, Admission Controllers) و تجربه عملی با ArgoCD یا Flux برای پیادهسازی GitOps
- آشنایی با زیر ساخت های گیم مثل photon , nakama , AccelByte , Agones
- Ceph و ذخیرهسازی توزیعشده (امتیاز طلایی):** تجربه راهاندازی و مدیریت Ceph Cluster با Rook، کار با CephFS و RBD
- آشنایی با Helm برای مدیریت بستههای Kubernetes
- آشنایی با Apache Druid و Kafka برای پردازش Event Streaming
- آشنایی با زبانهای Java Spring Boot و Python Django برای درک بهتر نیازهای تیم توسعه
- آشنایی با سرویس های ابری خانواده aws
- آشنایی با محصولات خانواده Atlassian (Jira, Confluence)
روزهای کاری:
- شنبه تا چهارشنبه 9:00 تا 18:00
مهارتهای مورد نیاز
- DevOps
- Docker
- Git
حداقل سابقه کار
- سه تا شش سال
جنسیت
- مهم نیست
وضعیت نظام وظیفه
- مهم نیست