Китайские разработчики открыли доступ к OmniVoice — нейросети для синтеза и клонирования речи (Text-to-Speech). Проект опубликован с открытым исходным кодом и предлагает функционал, сопоставимый с коммерческими сервисами, но без подписок и искусственных ограничений.
Главная особенность модели — поддержка более 600 языков и диалектов. Для создания точной копии голоса нейросети требуется референсная аудиозапись длиной всего от 5 до 10 секунд. При этом разработчики не стали встраивать в систему фильтры цензуры или другие ограничения на клонирование.
Пользователи могут гибко управлять параметрами аудио: менять пол и возраст диктора, а также добавлять стилистические эффекты вроде шепота.
Проект распространяется абсолютно бесплатно. Протестировать технологию прямо в браузере можно через онлайн-демо. Сама модель доступна для скачивания на HuggingFace, а исходный код опубликован на GitHub.






