Нужна видяха, желательно Нвидия 3060-4060.
Далее идём в Дискорд и берем там какую-то нужную и при этом нормально сделанную, голосовую модель из тех что там есть.
Ну или сервер называется AI HUB, если не откроется по ссылке.
Далее нужно подать на выход, допустим виртуального микшера в системе, свой звуковой файл с голосом.
В целом работает не идеально, будет некоторые слова подъедать, особенно если плохо слышно оригинальный голос, поскольку оригинальные модели на которых потом делают всякий кринж типа Медисона или Хованского, были английские. Нужно смотреть качество самой модели, если тренили хорошо то в целом сгодится, для Дизы приветствия этой штукой писали и писалось нормально. Но можно самому наговорить нужный кусок, оно это переговорит как и всё остальное одинаково. Потом склеить.
Вот ролик, вроде это рассматривается.