YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
Голос Владимира Еремина — TTS (F5-TTS_RUSSIAN)
Zero-shot клон голоса диктора Владимира Еремина (рекламные ролики ЖК «Лайф Варшавская», «Ес-резиденс» от группы «Пионер»).
Работает на CPU и GPU, с полной нормализацией чисел, дат и процентов.
Состав набора
| Файл | Назначение |
|---|---|
ref_eremin.wav |
Референс-аудио (10 сек чистого голоса, 24kHz) |
eremin_tts.py |
Скрипт синтеза (нормализация + разбиение) |
Установка
pip install f5-tts num2words soundfile torch torchaudio
Русская модель скачается автоматически с Hugging Face:
Misha24-10/F5-TTS_RUSSIAN (~1.3GB, первый запуск).
Использование
# Простая озвучка
python eremin_tts.py "Добрый день! Это Владимир Еремин."
# С числами (нормализация автоматическая)
python eremin_tts.py "Квартира стоит 129 990 рублей, скидка 25%. Дата 15.03.2025."
# Настройки
python eremin_tts.py "Текст" --out result.wav --speed 1.2 --steps 64
Нормализация (встроенная)
| Ввод | Произносится |
|---|---|
129 990 |
сто двадцать девять тысяч девятьсот девяносто |
25% |
двадцать пять процентов |
2024 |
две тысячи двадцать четыре |
15.03.2025 |
пятнадцатое марта две тысячи двадцать пятого года |
3.12 |
три точка двенадцать (версии) |
Разбиение на предложения по . ; ! ? и переносам строк — каждое
синтезируется отдельно и склеивается.
Ограничения
- Англицизмы (Python, iPhone) произносятся русской транскрипцией («пайсон», «айфон») — для точных брендов пишите фонетически.
Лицензия
Голос — личные аудиоданные. Код — MIT.
Связанное
- База: Misha24-10/F5-TTS_RUSSIAN
- Автор клона: Dimitrius174
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support