语音与音乐信号处理轻松入门:基于Python与PyTorch
姚利民
内容简介
近年来人工智能技术突飞猛进,以语音识别为代表的音频处理技术取得了大量突破,但该领域内理论结合实战的入门书籍却较为缺乏。本书旨在为有志学习音频信号处理的读者提供一本实用的入门书。
本书共13章,第1章和第2章是基础部分,包括声学基础知识及Python基础等内容;第3章和第4章介绍了音频信号的获取及分析方法;第5~8章介绍了语音识别基础、传统语音识别技术及语音识别、语音合成的实战技术;第9章和第10章介绍了常用的音乐分析方法及Python编曲等内容;第11~13章介绍了深度学习的基础知识及如何用PyTorch对语音和音乐信号进行分析处理。
本书以通俗易懂的语言、图文并茂的方式进行讲解,力图使读者在短时间内掌握音频信号处理的基本技术。本书可供包括高校学生在内的各类初学者快速入门,也可供该领域的专业技术人员及爱好者参考。 作者简介
姚利民毕业于东南大学,长期在外资企业从事管理工作并致力于AI及计算机视觉方面的研究工作。2012年赴某知名跨国企业全球总部工作,回国后自主创业。现专注于AI各领域的研究,著有《Java+OpenCV高效入门》《Java+OpenCV案例佳作选》等。 前言
近年来,以语音识别为代表的音频处理技术取得了重大突破。2008年底,谷歌公司发布了第1个语音搜索应用;2010年,苹果公司收购Siri并将其改造成语音助手。此后的十余年,语音技术的发展日新月异。与此同时,相关领域也有一些新技术如雨后春笋般涌现,例如根据声音样本生成语音的声音克隆技术、用AI技术模仿人类唱歌的虚拟歌手、将歌声与伴奏分离的人声分离技术等。毋庸讳言,音频处理与计算机视觉一样都处于人工智能大潮的风口之上。
音频信号处理涉及众多的理论知识,单单语音识别领域就涉及梅尔倒谱系数(MFCC)、Fbank特征、共振峰、端点检测、动态时间规整(DTW)、高斯混合模型(GMM)、隐马尔可夫…