Стажёр в команду NLP / RL (GigaChat)
Описание
Привет! Это GigaChat Reasoning — команда, которая даёт модели суперсилу размышлять. Мы придумываем среды, тренируем через online RL, ускоряем обучение и доводим решения до продакшна. Направления Улучшение GigaChat Reasoning: полный цикл обучения от холодного старта до вывода модели продакшн. Добавление новых доменов, создание датасетов и функций оценки ответов. Развитие агентских навыков и tool calling с помощью Online RL: создание сред для обучения LLM, обучение и тестирование моделей. Улучшение продукта Deep Research На эти роли мы ищем талантливого NLP Engineer со знанием и опытом в Reinforcement Learning. Для всех этих экспериментов у нас есть кластер с большим числом A/H 100'ых. Обязанности Улучшать качество работы GigaChat Reasoning на русском и английском языках Ускорять пайплайн обучения: профилирование узких мест, эффективный сэмплинг. Тестировать новые Loss-функции и подходы к обучению Помогать выводить в прод всё, что мы обучим. Постоянно держаться up-to-date со свежими статьями. Требования Опыт в online RL и хорошие теоретические знания Уверенное владение Python, PyTorch. Знание базовых алгоритмов и математики. Знания в DL, опыт обучения простых и больших моделей. Опыт обучения моделей для продакшена. Понимание текущего состояния эволюции больших LLM'ов. Будет плюсом наличие публикаций. Условия Погружение в разработку самых современных NLP-систем. Возможность совмещать учёбу и работу над реальными проектами. По итогам стажировки — приглашение на Junior+ или Middle позиции. Полная удалёнка: работай из любой точки, где есть интернет.