Все вакансии России 0

Data scientist (NLP) middle

от 220 000 ₽
Платформа ОФД
Москва Постоянная занятость Полный день

Описание

Платформа ОФД - крупнейший в России оператор фискальных данных. Наша аудитория - около 1 млн пользователей. Мы создаем удобные IT продукты для предпринимателей, инструменты управления бизнесом, аналитические сервисы и новые услуги на основе Big Data. Мы анализируем рынок российского ритейла на данных из чеков в режиме реального времени. Ежедневно мы обрабатываем 60 млн кассовых чеков - каждый 3-й чек, пробиваемый в России. В нашей базе 4,7 млрд уникальных названий товаров. Наша команда DS: Строит NLP-ядро решения для автоматической категоризации товарных строк из чеков и извлечения атрибутов, конечной целью которого является восстановление товарной позиции до SKU (полное единое представление товара из чека со всеми присущими ему атрибутами). Ввиду уникальности экспертизы работы с языковыми моделями в обязанности команды также входит внедрение AI-агентов в процессы смежных подразделений компании Ваша роль в команде и основные задачи: Разработка ML-моделей/rule-based/иных решений под поставленные задачи, поиск/лидирование разметки данных для обучения, покрытие мониторинговыми метриками, близкими к продуктовым Обучение, заказ разметки, деплой и покрытие прод метриками модели под следующие типы задач:1. Классификация позиций в чеках по древовидному каталогу2. NER и нормализация атрибутов чековых данных3. AI-агенты на основе локальных LLM для внутреннего использования DS-команды и автоматизации задач смежных подразделений4. Прочие инструменты для разметки данных (очистка, препроцессинг и пр. rule-based решения) Ближайшие ключевые задачи: - Быстрые адаптивные решения под отраслевые проекты (классификация и атрибуция)- AI-агенты для разметки, ТП и чата- Ресерч альтернатив ядерного решения Требования к кандидату: - Трансформеры в NLP: коммерческий опыт обучения и эксплуатации- Векторные представления + Retrieval/Re-rank- Информационное извлечение в ритейле (NER, нормализация, линковка) - Продуктовое мышление и работа с метриками- Структуризация задач на компоненты и эксперименты (из "сырой" в шаги разработки)- Умение формировать вывод и защищать результат - Знание docker, vllm, k8s будет + - Опыт создания дашбордов для мониторинга моделей и загрузки ЛЛМ Желателен опыт работы с LLM (инференс/агенты): fine-tuning, дообучение, дистилляция, квантование Стек, который мы используем: Данные:1. Обширная ресерч-база, представленная миллиардами уникальных строк чековых наиманований, охватывающая весь возможный спектр отраслей2. Челендж в виде обработки миллионов уникальных наименований ежедневно3. Шумные нейминги, лонг-тейл категорий, постоянный поток новых формулировок/синонимов Инфраструктура:1. Разделение серверов на r&d и пром2. On-prem GPU для обучения и инференса нейросетевых моделей различной архитектуры, включая LLM3. Хранилище данных на Hadoop Как проходит найм: Техническое интервью с TL команды DS Возможно выполнение тестового задания Мы предлагаем условия: Трудоустройство по ТК РФ, аккредитованная ИТ-компания; Комфортный офис в шаге от м. Спортивная/ МЦК Лужники; График работы 5/2 с 9:00/10:00 до 18:00/19:00. Офисный формат работы на исп. срок, далее возможен гибрид; Обучение/семинары за счет компании; Расширенный соц. пакет: ДМС (поликлиника, госпитализация, стоматология), скидки от партнеров, льготы на ипотеку; Насыщенная корпоративная жизнь, ежемесячные пицца-пати; Открытая рабочая атмосфера, общение на "ты", отсутствие дресс-кода

Откликнуться
Источник: hh · 3 дня назад

Похожие вакансии в городе Москва

Все вакансии в городе Москва →