استخدام NLP-Clustering) Machine Learning Engineer-آقا-دورکاری)
دستهبندی شغلی
وب، برنامهنویسی و نرمافزار
موقعیت مکانی
تهران
، تهران
نوع همکاری
تمام وقت
دورکاری
حداقل سابقه کار
کمتر از سه سال
حقوق
توافقی
شرح موقعیت شغلی
پرتو یک پلتفرم تحلیل داده است که فهمیدن شبکههای اجتماعی و فضای آنلاین را برای سازمانها، نهادها و کسبوکارهای بزرگ سادهتر میکند. ما دادهی شبکههای اجتماعی و رسانهها را کرال میکنیم، پردازش میکنیم، و در قالب تحلیل قابل فهم ارائه میدهیم. تیم در حال رشد است و دنبال یک Machine Learning Engineer با تمرکز روی NLP و Clustering هستیم.
یکی از چالشهای اصلی ما این است که از بین حجم بزرگی از محتوای شبکههای اجتماعی، موضوعها، رویدادها و جریانهای مشابه را بهصورت خودکار پیدا کنیم. برای این کار با حجم بالایی از embeddingهای متنی، الگوریتمهای خوشهبندی و مدلهای زبانی سر و کار داریم و نیاز داریم این فرایند علاوه بر دقت، در مقیاس بالا هم قابل اجرا باشد.
استک و ابزارها
Python / NumPy / Scikit-learn
HDBSCAN / K-Means / Faiss
PCA / UMAP
Milvus / Elasticsearch
Embedding Models / LLMs
کاری که انجام میدهی
طراحی و توسعهی سیستم خوشهبندی محتوای شبکههای اجتماعی. از انتخاب و ارزیابی الگوریتم مناسب تا اجرای آن روی چندصد هزار یا چند میلیون embedding متنی.
کار با الگوریتمهایی مثل HDBSCAN و K-Means و ابزارهایی مثل Faiss، تنظیم پارامترها و تحلیل کیفیت خوشههایی که تولید میشوند.
طراحی راهکار برای دادههای واقعی؛ جایی که بعضی دادهها نویز هستند، اندازهی خوشهها متفاوت است و چگالی دادهها همیشه یکسان نیست.
استفاده از روشهایی مثل PCA و UMAP برای کاهش ابعاد و بهینهتر کردن فرایند تحلیل و Clustering.
طراحی pipeline مقیاسپذیر برای پردازش دادههای جدید؛ به شکلی که مدل فقط یک آزمایش روی Notebook نباشد و بتواند بهصورت پایدار در Production اجرا شود.
استخراج نمونهی نماینده، عنوان یا توضیح معنایی برای هر خوشه و در صورت نیاز استفاده از مدلهای زبانی برای نامگذاری یا خلاصهسازی Clusterها.
خواندن embeddingها از Milvus، ذخیره و versioning نتایج در Elasticsearch و بهینهسازی مصرف RAM و CPU در پردازش حجم بالای داده.
تعریف و بررسی معیارهای ارزیابی مثل Silhouette Score، پایداری Clusterها و ارزیابی انسانی نمونههای خروجی.
چی برای ما مهم است
تسلط خوب به Python، NumPy و Scikit-learn.
تجربهی عملی با الگوریتمهای Clustering مثل HDBSCAN، K-Means یا روشهای مشابه.
درک خوب از embeddingهای متنی، فضای برداری و معیارهایی مثل Cosine Similarity.
آشنایی با Faiss یا ابزارهای مشابه برای جستوجو و پردازش حجم بالای بردارها.
تجربهی کار با PCA، UMAP یا روشهای مشابه کاهش ابعاد.
توانایی تحلیل رفتار الگوریتمهای Unsupervised و تنظیم پارامترها بر اساس ویژگی داده.
آشنایی با پردازش Batch و بهینهسازی مصرف حافظه و منابع پردازشی.
توانایی تبدیل یک مدل یا آزمایش تحقیقاتی به pipeline قابل اجرا و قابل نگهداری در Production.
خوب است اگر داشته باشی
تجربهی کار با مدلهای زبانی و embeddingهای فارسی.
آشنایی یا تجربهی عملی با Milvus یا سایر Vector Databaseها.
تجربهی کار با Elasticsearch.
تجربهی Clustering روی چندصد هزار تا چند میلیون بردار.
آشنایی با Docker و Linux.
تجربهی استفاده از LLMها برای نامگذاری، خلاصهسازی یا توصیف خودکار Clusterها.
مزایای همکاری با ما:
انعطاف کامل: دورکاری، هیبرید، یا حضوری در دفتر تهران. ساعت ورود و خروج نداریم.
ابزار AI برای همهی اعضای تیم فراهم میشود.
چالشهای فنی گسترده: چند میلیارد رکورد داده، سیستمهایی که در مقیاس بزرگ کار میکنند، استک متنوع.
بیمهی تکمیلی، سفر سالانهی گروهی، وام دورهای، و امکان امریهی دانشبنیان برای آقایان واجد شرایط.
ابزارهای تحلیل داده معمولاً پیچیدهاند؛ صفحههایی پر از نمودار، فیلترهای تودرتو، و مفاهیمی که برای استفاده از آنها معمولاً به یک متخصص نیاز است. ما در پرتو، خلاف این جریان حرکت میکنیم.
پرتو یک پلتفرم تحلیل داده برای سازمانها، نهادها و کسبوکارهای بزرگ است — که فهمیدن شبکههای اجتماعی و فضای آنلاین را برایشان سادهتر میکند. این سادهسازی با کم کردن قابلیتها انجام نمیشود؛ بلکه با مدیریت پیچیدگی در پشت صحنه — به کمک هوش مصنوعی، طراحی محصول و تجربهی کاربری مدرن.
پشت این محصول، کارهای فنی متنوعی هست — از پایپلاینهایی که با چند میلیارد رکورد داده سر و کار دارند، تا مدلهای هوش مصنوعی روی متن و تصویر و صدا. ما هم دنبال آدمهایی هستیم که همین جنس مسئله برایشان جذاب باشد.