Все вакансии России 0

Middle ML Engineer TTS

100 000 – 200 000 ₽
Sasha AI
Москва Постоянная занятость Удаленная работа

Описание

Добрый день! Мы — Sasha AI, пионеры в разработке голосовых AI-агентов. Наша платформа позволяет запустить искусственный интеллект, который общается с клиентами по телефону и приносит выручку без операторов. Мы выросли в 5 раз за год, а наша цель на 2026-й — оборот 400 млн ₽. Наша маленькая цель: сделать передовую AI-технологию простой, окупаемой и доступной каждому крупному бизнесу. Наша большая цель — за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России. Голос — первое, что слышит клиент. Если синтез звучит роботом, неправильно ставит ударение или отвечает с задержкой, человек кладёт трубку. Мы ищем инженера, который возьмёт на себя синтез речи в нашем каскаде STT → LLM → TTS: от данных и дообучения до быстрого инференса и мониторинга в продакшене. Чем предстоит заниматься Дообучать современные TTS-модели под русскую диалоговую речь, в первую очередь LLM-based, LoRA/QLoRA, full fine-tuning, выравнивание по предпочтениям (DPO) для естественности звучания. Строить пайплайны данных для обучения: сбор аудио из реальных звонков и студийных записей; очистка, сегментация, выравнивание текста и аудио; фильтрация по качеству, автоматическая разметка. Развивать фронтенд синтеза: нормализация текста (числа, даты, адреса, телефоны), ударения и омографы, G2P. Оптимизировать инференс: квантизация, стриминговый синтез, минимальное время до первого звука, высокая плотность потоков на GPU (vLLM, ONNX, TensorRT). Встраивать TTS в каскад: стыковка с LLM (формат ответа, стриминг по токенам), обработка перебиваний, адаптация к телефонному каналу (8 кГц, G.711/Opus). Строить наблюдаемость синтеза в продакшене: трейсинг через OpenTelemetry, метрики latency и RTF в Prometheus, дашборды в Grafana, отлов деградаций. Выстраивать оценку качества: MOS/CMOS-тесты; автоматические метрики (UTMOS, CER через ASR, speaker similarity); регрессионные прогоны; связь с доходимостью разговоров. Создавать новые голоса и адаптировать синтез под клиентов (voice cloning). Что мы ждём Коммерческий опыт от 1 года в ML и дообученные модели, доведённые до продакшена. Опыт дообучения трансформерных или LLM-моделей: LoRA/QLoRA, SFT, желательно DPO. Уверенный Python, PyTorch, Hugging Face (Transformers, PEFT). Опыт квантизации и оптимизации моделей под ограниченные ресурсы и низкую задержку. Умение собирать и валидировать датасеты для обучения. Понимание, как устроен голосовой каскад STT–LLM–TTS и где в нём теряется время. Опыт с Docker, CI/CD, развёртыванием и мониторингом ML-сервисов. Желание глубоко погрузиться в синтез речи. Будет плюсом Опыт работы с TTS-моделями: обучение, дообучение или интеграция в продукт. Понимание нейрокодеков (EnCodec, DAC, SNAC, Mimi) и вокодеров (HiFi-GAN, Vocos). Базовые знания цифровой обработки сигналов: спектрограммы, mel, частота дискретизации. C++ для оптимизации критичных по производительности компонентов, опыт потоковой обработки данных. Опыт с Airflow, ClickHouse, Kafka для работы с большими объёмами аудио и метаданных. Сильная математическая или физическая база. Что мы предлагаем Синтез речи, который ежедневно звучит в тысячах живых разговоров, и видимый эффект в конверсии. Полный цикл: данные → обучение → оптимизация → продакшен → мониторинг. GPU и реальные данные для экспериментов. Небольшую команду без бюрократии и быстрый путь от идеи до релиза. Возможность вырасти до senior и взять направление TTS целиком.

Откликнуться
Источник: hh · 17.09.2026

Похожие вакансии в городе Москва

Все вакансии в городе Москва →