Senior ML Engineer (TTS)
Описание
Добрый день! Мы — Sasha AI, пионеры в разработке голосовых AI-агентов. Наша платформа позволяет запустить искусственный интеллект, который общается с клиентами по телефону и приносит выручку без операторов. Мы выросли в 5 раз за год, а наша цель на 2026-й — оборот 400 млн ₽. Наша маленькая цель: сделать передовую AI-технологию простой, окупаемой и доступной каждому крупному бизнесу. Наша большая цель — за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России. Каждый звонок проходит через речевой пайплайн: распознавание речи, определение автоответчика, синтез голоса. От качества и скорости этих моделей зависит, будет ли разговор звучать естественно. В эту команду мы ищем junior ML-инженера. Чем предстоит заниматься Владеть направлением TTS: определять техническую стратегию и роадмап, решать, что строим сами, а что берём из open-source, и защищать эти решения перед командой и бизнесом. Проектировать и обучать собственную модель синтеза под наши требования: диалоговая русская речь, стриминг, телефонный канал, масштаб в тысячи одновременных звонков. Добиваться человеческого звучания: просодия и управление интонацией с учётом контекста диалога; эмоции, паузы, филлеры, разговорный стиль. Отвечать за latency и стоимость: time-to-first-audio в десятки миллисекунд, высокая плотность потоков на GPU, архитектура инференса вместе с backend- и MLOps-командами. Строить data-стратегию: сбор и разметка данных, работа с дикторами, пайплайны фильтрации и выравнивания на больших объёмах, использование данных из реальных звонков. Развивать voice cloning и кастомные голоса для клиентов, включая юридические и этические рамки. Выстроить систему оценки качества, связанную с продуктовыми метриками: MOS/CMOS, автоматические метрики, A/B-тесты на живых звонках, влияние голоса на доходимость и конверсию. Нанимать и развивать команду: менторить middle и junior-инженеров, проводить код-ревью и задавать инженерные стандарты. Что мы ждём Опыт от 5 лет в ML, из них от 3 лет в TTS или генерации речи. TTS-системы, которые вы вывели в продакшен под реальной нагрузкой и за качество и latency которых отвечали. Глубокое понимание современных подходов: LLM-based TTS и нейрокодеки: EnCodec, DAC, Mimi, SNAC; flow matching и диффузионные модели; non-autoregressive архитектуры и вокодеры. Опыт обучения моделей с нуля, а не только fine-tuning: дизайн архитектуры, масштабирование данных и вычислений, отладка нестабильного обучения. Опыт оптимизации инференса: стриминг, батчинг, квантизация, TensorRT, Triton, vLLM или аналоги, профилирование на GPU. Сильная экспертиза в русском языке для синтеза: нормализация, ударения, омографы, G2P. Умение формулировать исследовательские гипотезы, быстро их проверять и принимать решения на основе метрик. Опыт технического лидерства или менторства. Будет плюсом Опыт speech-to-speech и full-duplex моделей, а также диалоговых систем реального времени. Опыт с zero-shot voice cloning и контролем стиля и эмоций. Публикации (Interspeech, ICASSP, NeurIPS и др.) или заметные open-source проекты в области TTS. Опыт с телефонией и кодеками. Опыт мультиязычного синтеза. Опыт построения ML-команды с нуля. Что мы предлагаем Роль технического лидера TTS с реальным влиянием на продукт и архитектуру. Возможность создать собственную модель синтеза, а не только интегрировать чужие. Прямую связь вашей работы с бизнес-метриками и выручкой. Вычислительные ресурсы и данные под амбициозные эксперименты. Возможность собрать и вырастить свою команду.