Нейросети

Как говорить голосом нейросети

25.05.2024

Содержание

Deepfake голоса и создание новых композиций с помощью нейросети

Пожаловаться на комментарий

Отдельно дополню для тех кто попробует натянуть на экстремальный вокал — чистый голос
Возможны неприятные открытия типа экстрим вокалиста орущего мимо нот но при экстрим вокале это было нормально а на чистом звучит как испанский стыд))
Ещё обнажается хреновое качество записи или недостаточная тренировка модели (не только малое количество эпох но и неудачно собранный датасет для тренировки с однообразным или слишком небольшим по количеству материалом) — слова могут звучать неразборчиво.
Ну и на совсем высоком скриме или шрайке уменьшайте питч иначе чистым голосом будет совсем шептать)

1. Количество эпох это степень обучения модели, больше>лучше. 41.6k — это качество дискретизации, больше>лучше.
2. Модели есть, но их нужно ещё поискать. В основном все их обучают сами и мало кто делится в итоге. Погуглите модели или гайд по обучению. Я хотел продолжить гайд обучением, но обнаружил, что это мало кому интересно. В общем, решил не тратить силы.

Если вы хотите пойти дальше и работать с более длинными текстами, а еще и добавлять к ним эмоции, придется зарегистрироваться. Правда, после сервис попросит вас оплатить хотя бы минимальное количество символов, чтобы озвучить текст. Из интересного — можно сохранять голоса в избранное и менять их эмоцию. Доступно всего два варианта: Neutral и Robot.

Из настроек есть: высота, скорость, паузы. Также в личном кабинете можно сохранять голоса в избранное. Мне показалось, что сервис больше подходит для личного использования. Например, прочитать анекдот и отправить это друзьям или поиграться с настройками голоса и понять, что вам нравится.

RVC-GUI — это удобная оболочка с открытым исходным кодом созданная для упрощения управления параметрами нейронной сети RVC применяемой для синтеза любого голоса/музыкальной композиции. По сравнению с аналогами, не требует установки и настройки сложных библиотек или использования Linux. Для работы программы достаточно Windows 10/11 и относительно современного ПК.

Качество озвучки: 📣📣📣📣
Лимиты: до регистрации есть ограничение в 250 символов, после регистрации сервис дает 10 минут, которые тратятся каждый раз после озвучки текста
Платные функции: за 19 $⁣ ( 1816 ₽) в месяц сервис дает 24 часа озвучки, российской картой оплатить нельзя

ЧИТАТЬ ТАКЖЕ: Как добавить в игру искусственный интеллект

ElevenLabs

Здравствуйте, не пойму что нужно делать, к примеру я хочу заменить песенку про мамонтенка, голосом Розенбаума, мои действия какие должны быть. 1) взять песенку мамонтенка и сделать один вокал или наоборот один Розенбаум. 2)где мне брать модель под мамонтёнка в формате RVC/RVC2, 3) МОЖНО пожалуйста дополнить инструкцию.

Эх ладно я нашел живой гайд и живой коллаб по которому уже успешно обучаю) Дам ссылки тута
Инструкция по обучению увы токмо на ангельском но с картинками! https://youtu.be/x-jelyl6dyE
Коллаб для тренировки по этой инструкции https://colab.research.google.com/drive/1TU-kkQWVf-PLO_hSa2QCMZS1XF5xVHqs#scrollTo=MErtbNbp4wn0
Коллаб живой и рабочий остальное что находил нерабочий мусор.
Да суперкомпы гугла бесплатно попашут на вас 3 часа в сутки мощей стоимостью в пару миллионов)

Traceback (most recent call last):
File «site.py», line 169, in addpackage
File «», line 1, in
File «», line 562, in module_from_spec
AttributeError: ‘NoneType’ object has no attribute ‘loader’
Remainder of file ignored
Error processing line 1 of G:\Archive\Deep Fake\runtime\lib\site-packages\matplotlib-3.6.2-py3.9-nspkg.pth:
Traceback (most recent call last):
File «site.py», line 169, in addpackage
File «», line 1, in
File «», line 562, in module_from_spec
AttributeError: ‘NoneType’ object has no attribute ‘loader’
Remainder of file ignored
Error processing line 7 of G:\Archive\Deep Fake\runtime\lib\site-packages\pywin32.pth:
Traceback (most recent call last):
File «site.py», line 169, in addpackage
File «», line 1, in
ModuleNotFoundError: No module named ‘pywin32_bootstrap’
Remainder of file ignored
Traceback (most recent call last):
File «G:\Archive\Deep Fake\rvcgui.py», line 3, in
from tkinter import filedialog
ModuleNotFoundError: No module named ‘tkinter’
Press any key to continue.. .
((((

К слову если ваша любимая поп певица или певец никогда не будет петь ваш любимый всякий лютый метал это не проблема.
Нейросеть в недавних версиях наловчилась адекватно переваривать гроул и скрим и петь его внятно чистым голосом))
Например вот так Милен Фармер поёт лютый похоронный дум митол)
https://www.youtube.com/watch?v=TfkuXjirPYU
А вот так русскую алтьтернативу 2007го))
https://www.youtube.com/watch?v=nne3wxyzeZU

3. Чтобы программа могла воссоздать полноценную музыкальную композицию с интересующем нас голосом, необходимо заранее подготовить голосовую модель и отделить вокал солиста от инструментала в интересующей нас композиции. В общем, чтобы голос стал отдельно от музыки.

Всего доступно 29 русскоязычных голосов. Они достаточно разнообразны, текст озвучивается без ошибок и даже с правильной интонацией, но сильно ощущается неестественность. Есть даже отдельный Максим-бот, чей голос вам точно знаком по сотням роликов с YouTube и TikTok. Мои фавориты — Захар, Полина, Дария.

Deepfake голоса и создание новых композиций с помощью нейросети

Пожаловаться на комментарий

ElevenLabs

ОСТАВЬТЕ ОТВЕТ Отменить ответ

ЭТО ПОПУЛЯРНО

ЭТО ИНТЕРЕСНО

ВЫБОР РЕДАКТОРА