Все вакансии России 0

ML/NLP Разработчик (Voice & Dialog Systems) Python

з/п не указана
Интеграция Дистрибуция Проекты
Москва Постоянная занятость Удаленная работа

Описание

Мы ищем опытного ML/NLP разработчика для работы над сложной диалоговой системой и голосовым пайплайном. Вашей главной задачей станет эволюция нашего продукта: поэтапный переход от классических графовых сценариев к современному LLM-based диалогу, а также глубокая оптимизация речевого стека (ASR/TTS) под low-latency. Чем предстоит заниматься: Развитие диалогового движка: Поэтапный перевод системы с графа сценариев и скиллов на управляемый LLM-based диалог. Траблшутинг и дебаг: Работа с голосовым пайплайном — поиск и устранение причин high latency, галлюцинаций LLM, проблем с передачей аудио и графовых ошибок. Архитектура: Оперативное принятие архитектурных решений и их самостоятельная реализация в коде. Работа с NLP-стеком: Поддержка и быстрая отладка few-shot классификации сценариев (на базе Qwen) и классификаторов на BERT. Учёт краевых случаев, исправление ошибочных срабатываний интентов. Finetuning локальных LLM для специфических задач (извлечение сущностей, строгое следование инструкциям). Работа с речевым стеком: Интеграция и поддержка ASR (на базе GigaAMv2), отладка качества распознавания, работы VAD и стриминга текста. Дообучение и настройка инференса собственных и open-source TTS, а также систем клонирования голоса для достижения идеального звучания и высокой скорости работы. Наши ожидания (Hard Skills): NLP и LLM: Уверенный опыт работы с LLM/SLM (Few-shot learning, Prompt engineering) и BERT. Практический опыт finetuning LLM (PEFT, LoRA/QLoRA) под узкие прикладные задачи. Уверенный дебаг LLM: умение быстро понять причину некорректного ответа и исправить её промптом, гиперпараметрами или дообучением. Голосовой стек: Опыт дообучения и оптимизации TTS-моделей; опыт работы и интеграции современных ASR-систем. Диалоговые системы: Опыт работы как с графовыми/сценарийными движками, так и с LLM-агентами. Высокая скорость диагностики проблем в инференсе. Backend и Оптимизация (Python + Go): Уверенное владение Python (PyTorch, HuggingFace, фреймворки инференса). Опыт оптимизации инференса под low-latency (vLLM, TensorRT-LLM, Triton Inference Server, ONNX Runtime). Практика работы с потоковым аудио в реальном времени (streaming ASR/TTS, gRPC-контракты). GoLang: Понимание дизайна сервисов и принципов SOLID, DRY, KISS. Знание базовых типов (строки, числа, слайсы, мапы) и работы с указателями. Уверенная работа с примитивами синхронизации и конкурентностью (горутины, каналы). Понимание принципов Observability. Будет плюсом: Опыт работы с gRPC. Умение настраивать инфраструктуру, опыт работы с k8s/inventory. Глубокое понимание принципов работы TCP.

Откликнуться
Источник: hh · сегодня

Похожие вакансии в городе Москва

Все вакансии в городе Москва →