استخدام (Site Reliability Engineer (SRE
شرح موقعیت شغلی
استخدام مهندس قابلیت اطمینان سایت | Site Reliability Engineer — SRE
برای Cloudzy دنبال یک SRE قوی هستیم که مسئولیت Reliability، Stability و Uptime سرویسها را بهصورت واقعی بر عهده بگیرد.
هدف فقط حل Incident نیست؛ باید مشکل را ریشهیابی کنید، علت اصلی را پیدا کنید و کاری کنید دوباره تکرار نشود.
مسئولیتها
- Monitoring مستمر سلامت سرویسها و Infrastructure
- طراحی و بهبود Alerting
- Incident Response و مدیریت Incidentهای Critical
- Root Cause Analysis
- افزایش Reliability و Availability
- Performance و Capacity Planning
- طراحی و ساخت Automation برای کاهش خطای انسانی
- بهبود Recovery، Failover و Incident Process
- شناسایی مشکلات قبل از تبدیل شدن به Incident
شرایط احراز
- تسلط خوب به Linux و Networking
- تجربه Monitoring، Metrics، Logging و Alerting
- تجربه Incident Response و RCA
- دانش High Availability و Fault Tolerance
- آشنایی با Distributed Systems
- Performance و Capacity Planning
- Automation و Scripting
- تجربه Docker / Kubernetes
- استفاده از AI برای Log Analysis، Investigation و Debugging
- توانایی تصمیمگیری سریع و دقیق در شرایط Critical
دنبال کسی هستیم که فقط آتش را خاموش نکند؛ سیستم را طوری بهتر کند که دوباره آتش نگیرد.
مزایا
- Ownership واقعی Reliability سرویسهای Cloudzy
- کار روی Infrastructure واقعی در Scale بالا
- آزادی برای طراحی و بهبود سیستمهای Reliability
- استفاده از AI و Automation
- حقوق و پاداش متناسب با تخصص و Impact
- برای افراد Exceptional، شرایط Exceptional
شرایط همکاری
- نوع همکاری: تماموقت
- محل کار: تهران، ولیعصر
نحوه ارسال درخواست
رزومه به همراه نمونه پروژه، Automation، Monitoring System یا تجربههای مرتبط با Incident، Reliability و Production را ارسال کنید.
Cloudzy
مهارتهای مورد نیاز
- site
- reliability
حداقل سابقه کار
- مهم نیست
جنسیت
- مهم نیست
وضعیت نظام وظیفه
- مهم نیست