Senior Voice Engineer / Ведущий войс-инженер
Описание
Bitmanager.ai - AI-стартап в одной из самых быстрорастущих категорий conversational AI agents. Мы создаёт платформу для голосовых и текстовых AI-агентов в клиентских коммуникациях: продажах, поддержке, консультациях и debt collection. Наши агенты работают с данными, обращаются к внутренним системам компаний, вызывают инструменты и ведут диалог в рамках заданных бизнес-сценариев. Мы развиваем мультиязычные голосовые решения и самостоятельно дообучаем модели, чтобы расширять количество поддерживаемых языков и повышать качество работы продукта. Сейчас мы в поиске сильного инженера по речевым технологиям, который отвечает за результат в реальном звонке, а не за метрику на офлайн-датасете. Специалист возьмёт одно из голосовых направлений - распознавание или синтез речи, - будет развивать его для новых языков и отвечать за работу этих сервисов в проде. Главный результат работы: агент, который слышит собеседника, отвечает быстро и звучит естественно - на всех поддерживаемых языках. Чем предстоит заниматься Взять на себя одно из голосовых направлений - потоковое распознавание речи (ASR) или синтез (TTS) - и развивать его, в том числе для языков с малым количеством данных и готовых решений; Отвечать за задержки: измерять и сокращать время от конца реплики собеседника до первого звука ответа агента; Развивать естественность диалога: чтобы агент вовремя понимал, что собеседник закончил мысль, спокойно реагировал на перебивания и паузы и в живом разговоре вёл себя как человек, а не как робот; Работать с особенностями телефонии: узкополосный звук, потоковая передача, эхо, потери пакетов, разбор записей реальных звонков; Дообучать и адаптировать речевые модели под наши задачи и новые языки, вместе с командой подготовки данных и языковыми экспертами; Строить систему оценки качества: офлайн-метрики распознавания и синтеза, сквозные прогоны на реальных звонках, регрессионные проверки перед выкаткой; Выстраивать процессы выкатки и эксплуатации речевых сервисов на GPU - сборка, деплой, мониторинг, разбор инцидентов - и контролировать их качество. Делать всё самому руками не обязательно, но ответственность за то, чтобы эти процессы работали, лежит на нём; Доводить жалобы на качество звонков до конкретной причины: модель, данные, аудиотракт или инфраструктура; Участвовать в развёртывании речевой части в инфраструктуре заказчика вместе с инфраструктурной командой; Задавать технические решения по голосовому направлению, ревьюить код и помогать расти другим инженерам команды. Что для нас важно Уверенный Python и опыт разработки production-сервисов, а не только исследовательских скриптов; Практический опыт с речевыми технологиями (ASR и/или TTS), обязательно включая опыт интеграции моделей в production и их дальнейшей эксплуатации. Только исследовательского опыта или только обучения моделей недостаточно; Понимание потоковой обработки аудио: буферизация, работа чанками, источники задержек, ограничения реального времени; Опыт с PyTorch и запуском моделей на GPU, понимание того, из чего складывается время инференса; Умение измерять качество: подобрать метрику, собрать тестовый набор, отличить реальное улучшение от шума; Опыт эксплуатации: Docker, логи, мониторинг, отладка проблем, которые воспроизводятся только в проде; Способность самостоятельно вести направление, принимать решения при неполных данных и отвечать за результат; Умение работать с продуктовой командой, лингвистами и техническими специалистами заказчика и понятно объяснять свои решения; Хороший русский и английский язык: чтение документации и статей, общение с командой; Готовность регулярно работать из офиса компании в Москве. Полностью удалённый формат возможен в исключительных случаях и при небольшой разнице с московским часовым поясом. Опыт именно с голосовыми агентами не обязателен. Важнее инженерная зрелость, опыт работы со звуком и умение быстро разбираться в чужом пайплайне. Будет плюсом Опыт с телефонией: SIP, RTP, кодеки, эхоподавление, работа со звуком 8 кГц; Опыт построения голосовых агентов или диалоговых систем реального времени; Опыт с VAD, определением конца реплики и обработкой перебиваний; Опыт дообучения TTS (SFT, LoRA) и работы с клонированием голоса по референсу; Опыт с мультиязычными речевыми моделями и языками с малым количеством данных; Опыт оптимизации инференса: батчинг, квантизация, ONNX, TensorRT, vLLM; Опыт on-premise-развёртывания ML-сервисов в инфраструктуре крупных заказчиков; Опыт работы с LLM в составе голосового пайплайна. Если вам интересно не просто улучшать метрики на offline-датасете, а отвечать за то, как агент слышит, отвечает и звучит в реальном звонке, - ждем вашего отклика. Будем рады познакомиться и обсудить, какое voice-направление вы сможете взять под свою ответственность.