← О модели · Модель и код демо на HF · Голоса · Look-ahead · Темп (SRC — speaking rate control) · Типы текста · Семплирование
Все примеры сгенерированы финальной моделью (v10-DPO) через тот же инференс-стек, что в демо. Голоса — четыре диктора из открытого корпуса DUSHA (SberDevices), которые не попали в обучающую выборку (отсеяны фильтрами качества), то есть для модели это незнакомые голоса; промпт каждого склеен из 2–4 коротких реплик по VAD. Английский промпт — из демо-материалов VoXtream2 (KTH). Аудио 24 кГц, MP3.
Один и тот же текст четырьмя голосами, настройки по умолчанию: look-ahead 30, темп 3.5 слог/с (SRC), best-of-2, temperature 0.8, top-k 50, CFG 1.5.
«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»
| Параметр | Промпт (голос) | Синтез |
|---|---|---|
| Мужской голос 1 (10.2 с) | ||
| Женский голос 1 (10.6 с) | ||
| Мужской голос 2 (10.2 с) | ||
| Женский голос 2 (12.0 с) |
Сколько фонем вперёд видит Phoneme Transformer. 5 — почти чистый стриминг, 30 — потоковый режим по умолчанию (плотная сетка обучения), full — вся фраза известна заранее (офлайн-режим: лучше интонация, особенно вопросительная). Текст с двумя вопросами.
Промпт: Женский голос 1
«Ты правда думаешь, что мы успеем до вечера? А если пойдёт дождь, что тогда?»
| Параметр | Синтез |
|---|---|
| look-ahead 5 (7.6 с) | |
| look-ahead 30 (по умолчанию) (7.3 с) | |
| look-ahead full (офлайн) (7.1 с) |
Перевзвешивание логитов duration-токенов под целевую гистограмму длительностей; «выкл» — естественный темп модели. Тот же голос и текст; в скобках — фактический темп (гласные буквы / длительность аудио).
Промпт: Мужской голос 1
«Скорость речи можно менять прямо во время синтеза, не останавливая генерацию.»
| Параметр | Синтез |
|---|---|
| SRC выкл (естественный темп) (4.9 слог/с, 5.8 с) | |
| SRC 2.5 слог/с (3.8 слог/с, 7.4 с) | |
| SRC 3.5 слог/с (по умолчанию) (4.9 слог/с, 5.7 с) | |
| SRC 4.5 слог/с (4.7 слог/с, 6.0 с) | |
| SRC 6.0 слог/с (5.6 слог/с, 5.0 с) |
Цифры (RUNorm на инференсе), омографы с ручным ударением «+», длинный многопредложенческий текст (синтез по предложениям с повторной привязкой к промпту), проклитики «в/к/с» и междометие «хм», а также кросс-язычный промпт: английская запись → русская речь.
| Параметр | Промпт (голос) | Синтез |
|---|---|---|
| Цифры (8.9 с) | ||
| Омографы: з+амок / зам+ок (5.8 с) | ||
| Длинный текст, 5 предложений (17.8 с) | ||
| Проклитики и междометие (4.4 с) | ||
| Английский промпт → русская речь (10.9 с) |
Тот же голос и текст при разных temperature и CFG (classifier-free guidance). По умолчанию temperature 0.8 / CFG 1.5.
Промпт: Женский голос 1
«Добрый день. Сегодня расскажу, как устроен потоковый синтез речи: модель начинает говорить, не дожидаясь конца фразы.»
| Параметр | Синтез |
|---|---|
| temperature 0.8, CFG 1.5 (по умолчанию) (10.6 с) | |
| CFG 1.0 (без guidance) (11.2 с) | |
| CFG 3.0 (10.9 с) | |
| temperature 0.6 (10.6 с) | |
| temperature 1.0 (11.5 с) |
Модель опубликована в научных целях под лицензией OpenRAIL-M; клонирование голоса реальных людей без их согласия запрещено. Промпты — фрагменты открытых датасетов, использованы только для демонстрации.