|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/classificacao-de-audio-com-python-guia-completo/
课程评论:没有评论
**课程名称:** 使用 Python 进行音频分类:完整指南 **课程概述:** 本课程专注于自然语言处理(NLP)领域中一个重要的分支——音频分类。我们将探讨如何利用 Python 库(如 Librosa 和 TensorFlow)识别和分类各种声音,如环境声音、音乐风格、语音情感和语音命令。 **课程内容:** * **理论基础:** 了解音频信号的基本概念,包括模拟与数字信号、振幅、频率、分贝、采样率以及如何将音频数据表示为机器学习算法的输入。 * **音频特征提取:** 实践中学习如何加载和处理音频文件,执行谐波-percussive 分离、傅里叶变换、梅尔频率倒谱系数(MFCC)提取,并生成波形和频谱图。 * **环境声音分类:** 使用 UrbanSound8K 数据集,训练卷积神经网络(CNN)对 10 种不同的环境声音进行分类,如空调、汽车喇叭、儿童嬉戏、狗叫、钻孔、怠速发动机、枪声、 Jackhammer、警报器和街头音乐。 * **预训练模型与迁移学习:** 利用 YAMNet 预训练模型对 521 种不同的音频事件进行分类,并应用迁移学习来识别 5 种不同鸟类的叫声。 * **语音情感识别:** 使用 RAVDESS 数据集,对音频中的情绪进行分类,包括悲伤、惊讶、厌恶、中性、恐惧、快乐和冷静。 * **语音助手基础:** 了解语音助手的基本原理,并通过 mini-speech-commands 数据集训练神经网络来分类 8 种不同的语音命令。 * **音频转录:** 利用 SpeechRecognition 库实现音频到文本的转写功能。 **教学方式:** 课程将通过 Google Colab 进行详细的步骤分解教学,无需用户自行安装配置软件。课程包含 90 多个视频,总计超过 12 小时。 **目标学员:** 希望在自然语言处理和音频分类领域发展或开启新职业生涯的学习者。
A área de Processamento de Linguagem Natural - PLN (Natural Language Processing - NLP) é uma subárea da Inteligência Artificial que tem como objetivo tornar os computadores capazes de entender a linguagem humana, tanto escrita quanto falada. Alguns exemplo de aplicações práticas são: tradutores entre idiomas, tradução de texto para fala ou fala para texto, chatbots, sistemas automáticos de perguntas e respostas, sumarização de textos, geração automática de descrições para imagens, adição de legendas em vídeos, classificação de sentimentos em frases e áudios, dentre várias outras! Dentro desta área existe a classificação de áudio, que consiste em identificar sons específicos em áudios. Alguns exemplos são: identificação de sons do ambiente (carros, buzina, latidos, sirenes, etc), classificação de estilos musicais, transcrição de texto, reconhecimento de emoções pela fala e reconhecimento de comandos de voz, muito utilizado pelos assistentes virtuais.Atualmente, o setor comercial está cada vez mais necessitando de soluções de Processamento de Linguagem Natural voltadas ao áudio, ou seja, aprender essa área pode ser a chave para trazer soluções reais para necessidades presentes e futuras. Baseado nisso, este curso foi projetado para quem deseja crescer ou iniciar uma nova carreira na área de Processamento de Linguagem Natural, trabalhando especificamente com a classificação de arquivos de áudio! O curso está dividido em sete partes:Na parte 1 você aprenderá os conceitos teóricos sobre a área de áudio, como por exemplo: o que são sinais de áudio, sinal analógico e digital, amplitude, ondas, frequência, decibel, taxa de amostragem e principalmente, como representar o áudio para ser enviado para algoritmos de aprendizagem de máquinaNa parte 2 serão implementados na prática vários dos conceitos abordados na primeira parte! Alguns exemplos são: carregamento e execução de arquivos de áudio, separação harmônica-percursiva, sintetização de cliques, Transformada de Fourier, Coeficiente Cepstral de Frequência Mel e geração de gráfico de ondas e espectrogramas. Ao final deste módulo, você saberá como extrair dados dos áudios para envio para algoritmos de aprendizagem de máquina. Será utilizada a biblioteca LibrosaNa parte 3, vamos utilizar a base UrbanSound8K para classificar os seguintes sons ambientais: ar condicionado, buzina de carro, crianças brincando, latidos de cachorro, perfuração, motor em marcha lenta, tiros de arma, britadeira, sirene e música de rua. Faremos o treinamento de uma rede neural convolucional utilizando o TensorFlow, e ao final, vamos enviar um áudio e a rede neural será capaz de classificar qualquer uma dessas categoriasNa parte 4, vamos utilizar a arquitetura pré-treinada YAMNet para classificar 521 diferentes eventos de áudio! Logo após, utilizaremos transferência de aprendizagem para classificar o canto de 5 espécies diferentes de pássarosNa parte 5 utilizarmos a base de dados RAVDESS para classificar as seguintes emoções de áudios: tristeza, surpresa, nojo, neutro, medo, felicidade e calmoNa parte 6 você entenderá o básico sobre como funciona um assistente de voz! Por meio da base mini-speech-commands, vamos treinar uma rede neural para classificar 8 tipos diferentes de comandosPor fim, na parte 7 utilizaremos a biblioteca SpeechRecognition para realizar a transcrição de áudio, ou seja, você fala e o algoritmo faz a transcrição em formato textual!Todos os códigos serão implementados passo a passo, com detalhes e utilizando o Google Colab. Com isso, você não precisa se preocupar com instalações e configurações de softwares na sua própria máquina! São mais de 90 aulas e mais de 12 horas de vídeos passo a passo!