YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

Голос Владимира Еремина — TTS (F5-TTS_RUSSIAN)

Zero-shot клон голоса диктора Владимира Еремина (рекламные ролики ЖК «Лайф Варшавская», «Ес-резиденс» от группы «Пионер»).

Работает на CPU и GPU, с полной нормализацией чисел, дат и процентов.

Состав набора

Файл Назначение
ref_eremin.wav Референс-аудио (10 сек чистого голоса, 24kHz)
eremin_tts.py Скрипт синтеза (нормализация + разбиение)

Установка

pip install f5-tts num2words soundfile torch torchaudio

Русская модель скачается автоматически с Hugging Face: Misha24-10/F5-TTS_RUSSIAN (~1.3GB, первый запуск).

Использование

# Простая озвучка
python eremin_tts.py "Добрый день! Это Владимир Еремин."

# С числами (нормализация автоматическая)
python eremin_tts.py "Квартира стоит 129 990 рублей, скидка 25%. Дата 15.03.2025."

# Настройки
python eremin_tts.py "Текст" --out result.wav --speed 1.2 --steps 64

Нормализация (встроенная)

Ввод Произносится
129 990 сто двадцать девять тысяч девятьсот девяносто
25% двадцать пять процентов
2024 две тысячи двадцать четыре
15.03.2025 пятнадцатое марта две тысячи двадцать пятого года
3.12 три точка двенадцать (версии)

Разбиение на предложения по . ; ! ? и переносам строк — каждое синтезируется отдельно и склеивается.

Ограничения

  • Англицизмы (Python, iPhone) произносятся русской транскрипцией («пайсон», «айфон») — для точных брендов пишите фонетически.

Лицензия

Голос — личные аудиоданные. Код — MIT.

Связанное

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support