آگهی‌های استخدامی

استخدام NLP-Clustering) Machine Learning Engineer-آقا-دورکاری)

پرتو | Parto
تهران، تهران

شرح موقعیت شغلی

پرتو یک پلتفرم تحلیل داده است که فهمیدن شبکه‌های اجتماعی و فضای آنلاین را برای سازمان‌ها، نهادها و کسب‌وکارهای بزرگ ساده‌تر می‌کند. ما داده‌ی شبکه‌های اجتماعی و رسانه‌ها را کرال می‌کنیم، پردازش می‌کنیم، و در قالب تحلیل قابل فهم ارائه می‌دهیم. تیم در حال رشد است و دنبال یک Machine Learning Engineer با تمرکز روی NLP و Clustering هستیم.

یکی از چالش‌های اصلی ما این است که از بین حجم بزرگی از محتوای شبکه‌های اجتماعی، موضوع‌ها، رویدادها و جریان‌های مشابه را به‌صورت خودکار پیدا کنیم. برای این کار با حجم بالایی از embeddingهای متنی، الگوریتم‌های خوشه‌بندی و مدل‌های زبانی سر و کار داریم و نیاز داریم این فرایند علاوه بر دقت، در مقیاس بالا هم قابل اجرا باشد.

استک و ابزارها

Python / NumPy / Scikit-learn

HDBSCAN / K-Means / Faiss

PCA / UMAP

Milvus / Elasticsearch

Embedding Models / LLMs

کاری که انجام می‌دهی

طراحی و توسعه‌ی سیستم خوشه‌بندی محتوای شبکه‌های اجتماعی. از انتخاب و ارزیابی الگوریتم مناسب تا اجرای آن روی چندصد هزار یا چند میلیون embedding متنی.

کار با الگوریتم‌هایی مثل HDBSCAN و K-Means و ابزارهایی مثل Faiss، تنظیم پارامترها و تحلیل کیفیت خوشه‌هایی که تولید می‌شوند.

طراحی راهکار برای داده‌های واقعی؛ جایی که بعضی داده‌ها نویز هستند، اندازه‌ی خوشه‌ها متفاوت است و چگالی داده‌ها همیشه یکسان نیست.

استفاده از روش‌هایی مثل PCA و UMAP برای کاهش ابعاد و بهینه‌تر کردن فرایند تحلیل و Clustering.

طراحی pipeline مقیاس‌پذیر برای پردازش داده‌های جدید؛ به شکلی که مدل فقط یک آزمایش روی Notebook نباشد و بتواند به‌صورت پایدار در Production اجرا شود.

استخراج نمونه‌ی نماینده، عنوان یا توضیح معنایی برای هر خوشه و در صورت نیاز استفاده از مدل‌های زبانی برای نام‌گذاری یا خلاصه‌سازی Clusterها.

خواندن embeddingها از Milvus، ذخیره و versioning نتایج در Elasticsearch و بهینه‌سازی مصرف RAM و CPU در پردازش حجم بالای داده.

تعریف و بررسی معیارهای ارزیابی مثل Silhouette Score، پایداری Clusterها و ارزیابی انسانی نمونه‌های خروجی.

چی برای ما مهم است

تسلط خوب به Python، NumPy و Scikit-learn.

تجربه‌ی عملی با الگوریتم‌های Clustering مثل HDBSCAN، K-Means یا روش‌های مشابه.

درک خوب از embeddingهای متنی، فضای برداری و معیارهایی مثل Cosine Similarity.

آشنایی با Faiss یا ابزارهای مشابه برای جست‌وجو و پردازش حجم بالای بردارها.

تجربه‌ی کار با PCA، UMAP یا روش‌های مشابه کاهش ابعاد.

توانایی تحلیل رفتار الگوریتم‌های Unsupervised و تنظیم پارامترها بر اساس ویژگی داده.

آشنایی با پردازش Batch و بهینه‌سازی مصرف حافظه و منابع پردازشی.

توانایی تبدیل یک مدل یا آزمایش تحقیقاتی به pipeline قابل اجرا و قابل نگهداری در Production.

خوب است اگر داشته باشی

تجربه‌ی کار با مدل‌های زبانی و embeddingهای فارسی.

آشنایی یا تجربه‌ی عملی با Milvus یا سایر Vector Databaseها.

تجربه‌ی کار با Elasticsearch.

تجربه‌ی Clustering روی چندصد هزار تا چند میلیون بردار.

آشنایی با Docker و Linux.

تجربه‌ی استفاده از LLMها برای نام‌گذاری، خلاصه‌سازی یا توصیف خودکار Clusterها.


مزایای همکاری با ما:

انعطاف کامل: دورکاری، هیبرید، یا حضوری در دفتر تهران. ساعت ورود و خروج نداریم.

ابزار AI برای همه‌ی اعضای تیم فراهم می‌شود.

چالش‌های فنی گسترده: چند میلیارد رکورد داده، سیستم‌هایی که در مقیاس بزرگ کار می‌کنند، استک متنوع.

بیمه‌ی تکمیلی، سفر سالانه‌ی گروهی، وام دوره‌ای، و امکان امریه‌ی دانش‌بنیان برای آقایان واجد شرایط.


مهارت‌های مورد نیاز

  • یادگیری ماشین
  • Python
  • numpy

حداقل سابقه کار

  • کمتر از سه سال

جنسیت

  • مرد

وضعیت نظام وظیفه

  • مهم‌ نیست

نوع همکاری:

تمام وقت دورکاری

تاریخ انتشار آگهی:

۱۴۰۵/۰۷/۱۶
ارسال رزومه