MLE (Online RL) / Post-Training LLM (AI)
Описание
Локация: Офис в МосквеЗарплата: 400 000 — 700 000 ₽/мес до налоговКомпанияКоманда разработки GigaChat, создающая передовые русскоязычные большие языковые модели.Что делатьРазрабатывать и улучшать методы online RL и подходы post-training.Проектировать и проводить ML-эксперименты: от формулировки гипотез до глубокого анализа причин изменения качества модели.Строить и развивать инфраструктуру обучения, включая пайплайны генерации rollout'ов и сбора reward-сигналов.Оптимизировать throughput и эффективность GPU с использованием distributed training (FSDP, DeepSpeed).Реализовывать reward-сигналы: rule-based верификаторы, reward-модели и LLM-as-a-judge.Анализировать ошибки модели и формировать целевые обучающие выборки для их устранения.ТребованияОтличное владение Python и PyTorch.Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.Опыт проведения полных циклов ML-экспериментов (гипотеза → реализация → анализ → выводы).Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.Умение писать чистый, надежный и production-ready код.Локация: работа в офисе в Москве.Хорошо, если естьОпыт работы с reward-моделями, process reward models или LLM-as-a-judge.Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang).Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL).Публикации или значимый вклад в open-source проекты.Культура и преимуществаРабота над сложными задачами на переднем крае развития LLM.Прямое влияние на качество продукта и результаты в бенчмарках.Возможность совмещать инженерную деятельность с исследовательской работой.Команда сильных инженеров и исследователей.Конкурентная компенсация, премии и расширенный соцпакет.