|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/voice-cloning/
课程评论:没有评论
课程名称:使用Python中的深度学习克隆声音 课程概述:深度学习因在各种领域取得突破性成果而闻名,其中文字转语音(Text-To-Speech)生成也是其中之一。在本课程中,您将学习如何克隆任意声音,并编写一个应用程序,该程序利用语音的短音频录音和文本,生成一个以指定声音朗读文本的音频文件。该领域的核心主题包括:获取和格式化训练数据以训练神经网络;训练编码器以生成说话者声音的嵌入(embedding);训练合成器以生成音素和梅尔谱(Mel Spectrograms);以及训练声码器(Vocoders)以从梅尔谱生成波形数据。一旦完成这些步骤,我将向您展示如何在用户界面中加载模型或通过Python API直接调用它们。 本课程将以Corentin Jemine的实时语音克隆工作为基础,这样我们就不必从头开始。如果您已经熟悉该框架,本课程将帮助您应用于德语(或任何其他语言)。我们使用的所有工具都是开放可用和开源的,因此您可以深入了解每个功能的细节。 最后需要注意的是:本课程旨在克隆您已获得所有者同意的声音。
Deep Learning ist dafür bekannt, bahnbrechende Ergebnisse in verschiedensten Disziplinen zu liefern - so auch in der Erzeugung von Sprache aus Text, dem sogenannten Text-To-Speech. In diesem Kurs werdet ihr lernen, wie man beliebige Stimmen klont und eine Anwendung schreibt, die mit einer kurzen Audioaufnahme einer Stimme und einem Text eine Audiodatei erzeugt, die genau diesen Text mit der angegebenen Stimme spricht.Kernthemen dieser Disziplin sind:Beschaffung und Formatierung der Trainingsdaten, um die neuronalen Netze zu trainieren.Durchführung des Trainings eines Encoders zur Erzeugung eines Embeddings für die Stimmen der SprecherDurchführen des Trainings eines Synthesizers zur Erzeugung von Phonemen und Mel SpektrogrammenDurchführung des Trainings eines Vocoders zur Generierung von Wave-Daten aus Mel SpektrogrammenIst das geschafft, zeige ich euch, wie ihr die Modelle in einer UI ladet oder sie einfach per Python API aufruft.Wir werden in diesem Kurs auf der Arbeit von Corentin Jemine (Real Time Voice Cloning) aufsetzen, um nicht ganz von vorne beginnen zu müssen. Wenn ihr das Framework bereits kennt, wird euch dieser Kurs bei der Anwendung auf die deutsche (oder jede beliebige andere) Sprache helfen. Alle Werkzeuge, die wir verwenden, sind frei zugänglich und open-source, sodass ihr bei Bedarf jede Funktion bis in ihre tiefsten Tiefen nachvollziehen könnt.Ein kleiner Hinweis am Schluss: Dieser Kurs ist dafür gedacht Stimmen zu klonen, von deren Besitzern ihr die Zustimmung habt.