VoXtream2-RU — примеры синтеза

Все примеры сгенерированы финальной моделью (v10-DPO) через тот же инференс-стек, что в демо. Голоса — четыре диктора из открытого корпуса DUSHA (SberDevices), которые не попали в обучающую выборку (отсеяны фильтрами качества), то есть для модели это незнакомые голоса; промпт каждого склеен из 2–4 коротких реплик по VAD. Английский промпт — из демо-материалов VoXtream2 (KTH). Аудио 24 кГц, MP3.

Голоса

Один и тот же текст четырьмя голосами, настройки по умолчанию: look-ahead 30, темп 3.5 слог/с (SRC), best-of-2, temperature 0.8, top-k 50, CFG 1.5.

«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»

ПараметрПромпт (голос)Синтез
Мужской голос 1 (10.2 с)
Женский голос 1 (10.6 с)
Мужской голос 2 (10.2 с)
Женский голос 2 (12.0 с)

Look-ahead

Сколько фонем вперёд видит Phoneme Transformer. 5 — почти чистый стриминг, 30 — потоковый режим по умолчанию (плотная сетка обучения), full — вся фраза известна заранее (офлайн-режим: лучше интонация, особенно вопросительная). Текст с двумя вопросами.

Промпт: Женский голос 1

«Ты правда думаешь, что мы успеем до вечера? А если пойдёт дождь, что тогда?»

ПараметрСинтез
look-ahead 5 (7.6 с)
look-ahead 30 (по умолчанию) (7.3 с)
look-ahead full (офлайн) (7.1 с)

Темп (SRC — speaking rate control)

Перевзвешивание логитов duration-токенов под целевую гистограмму длительностей; «выкл» — естественный темп модели. Тот же голос и текст; в скобках — фактический темп (гласные буквы / длительность аудио).

Промпт: Мужской голос 1

«Скорость речи можно менять прямо во время синтеза, не останавливая генерацию.»

ПараметрСинтез
SRC выкл (естественный темп) (4.9 слог/с, 5.8 с)
SRC 2.5 слог/с (3.8 слог/с, 7.4 с)
SRC 3.5 слог/с (по умолчанию) (4.9 слог/с, 5.7 с)
SRC 4.5 слог/с (4.7 слог/с, 6.0 с)
SRC 6.0 слог/с (5.6 слог/с, 5.0 с)

Типы текста

Цифры (RUNorm на инференсе), омографы с ручным ударением «+», длинный многопредложенческий текст (синтез по предложениям с повторной привязкой к промпту), проклитики «в/к/с» и междометие «хм», а также кросс-язычный промпт: английская запись → русская речь.

ПараметрПромпт (голос)Синтез
Цифры (8.9 с)
Омографы: з+амок / зам+ок (5.8 с)
Длинный текст, 5 предложений (17.8 с)
Проклитики и междометие (4.4 с)
Английский промпт → русская речь (10.9 с)

Семплирование

Тот же голос и текст при разных temperature и CFG (classifier-free guidance). По умолчанию temperature 0.8 / CFG 1.5.

Промпт: Женский голос 1

«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»

ПараметрСинтез
temperature 0.8, CFG 1.5 (по умолчанию) (10.6 с)
CFG 1.0 (без guidance) (11.2 с)
CFG 3.0 (10.9 с)
temperature 0.6 (10.6 с)
temperature 1.0 (11.5 с)

Модель опубликована в научных целях под лицензией OpenRAIL-M; клонирование голоса реальных людей без их согласия запрещено. Промпты — фрагменты открытых датасетов, использованы только для демонстрации.