آگهی‌های استخدامی

استخدام (Site Reliability Engineer (SRE

ابرناک | AbrNOC
تهران، تهران

شرح موقعیت شغلی

استخدام مهندس قابلیت اطمینان سایت | Site Reliability Engineer — SRE

برای Cloudzy دنبال یک SRE قوی هستیم که مسئولیت Reliability، Stability و Uptime سرویس‌ها را به‌صورت واقعی بر عهده بگیرد.

هدف فقط حل Incident نیست؛ باید مشکل را ریشه‌یابی کنید، علت اصلی را پیدا کنید و کاری کنید دوباره تکرار نشود.

مسئولیت‌ها

  • Monitoring مستمر سلامت سرویس‌ها و Infrastructure
  • طراحی و بهبود Alerting
  • Incident Response و مدیریت Incidentهای Critical
  • Root Cause Analysis
  • افزایش Reliability و Availability
  • Performance و Capacity Planning
  • طراحی و ساخت Automation برای کاهش خطای انسانی
  • بهبود Recovery، Failover و Incident Process
  • شناسایی مشکلات قبل از تبدیل شدن به Incident
شرایط احراز

  • تسلط خوب به Linux و Networking
  • تجربه Monitoring، Metrics، Logging و Alerting
  • تجربه Incident Response و RCA
  • دانش High Availability و Fault Tolerance
  • آشنایی با Distributed Systems
  • Performance و Capacity Planning
  • Automation و Scripting
  • تجربه Docker / Kubernetes
  • استفاده از AI برای Log Analysis، Investigation و Debugging
  • توانایی تصمیم‌گیری سریع و دقیق در شرایط Critical
دنبال کسی هستیم که فقط آتش را خاموش نکند؛ سیستم را طوری بهتر کند که دوباره آتش نگیرد.

مزایا

  • Ownership واقعی Reliability سرویس‌های Cloudzy
  • کار روی Infrastructure واقعی در Scale بالا
  • آزادی برای طراحی و بهبود سیستم‌های Reliability
  • استفاده از AI و Automation
  • حقوق و پاداش متناسب با تخصص و Impact
  • برای افراد Exceptional، شرایط Exceptional
شرایط همکاری

  • نوع همکاری: تمام‌وقت
  • محل کار: تهران، ولیعصر
نحوه ارسال درخواست

رزومه به همراه نمونه پروژه، Automation، Monitoring System یا تجربه‌های مرتبط با Incident، Reliability و Production را ارسال کنید.

Cloudzy

مهارت‌های مورد نیاز

  • site
  • reliability

حداقل سابقه کار

  • مهم نیست

جنسیت

  • مهم نیست

وضعیت نظام وظیفه

  • مهم‌ نیست

نوع همکاری:

تمام وقت

دسته‌بندی شغلی:

IT / DevOps / Server

تاریخ انتشار آگهی:

۱۴۰۵/۰۶/۰۱
ارسال رزومه