语音与音乐信号处理轻松入门:基于Python与PyTorch

语音与音乐信号处理轻松入门:基于Python与PyTorch

大量插图配合文字说明有助于抽象概念的理解

暂无评价综合评分的显示会考虑用户真实性等多项因素,每部作品出现综合评分的时间不定。

作品简介

近年来人工智能技术突飞猛进,以语音识别为代表的音频处理技术取得了大量突破,但该领域内理论结合实战的入门书籍却较为缺乏,本书旨在为有志学习音频信号处理的读者提供一本实用的入门书籍。本书共13章,第1章和第2章是基础部分,包括声学基础知识及Python基础等内容;第3到4章介绍了音频信号的获取及分析方法;第5~8章介绍了语音识别基础、传统语音识别技术及语音识别、语音合成的实战技术;第9章和第10章介绍了常用的音乐分析方法及Python编曲等内容;第11~13章介绍了深度学习的基础知识及如何用PyTorch对语音和音乐信号进行分析处理。本书以通俗易懂的语言、图文并茂的讲解力图使读者在短时间内掌握音频信号处理的基本技术。本书既可供包括高校学生在内的各类初学者快速入门、也可供该领域的专业技术人员及爱好者参考。

姚利民,毕业于东南大学,长期在外资企业从事管理工作,同时致力于AI及图像处理的研究。2012年赴某知名跨国企业全球总部工作,回国后自主创业。目前专注于人工智能各领域的研究。著有《Java OpenCV高效入门》和《Java OpenCV案例佳作选》。

作品目录

  1. 内容简介
  2. 作者简介
  3. 前言
  4. 本书主要内容
  5. 阅读建议
  6. 致谢
  7. 第1章 基础知识
  8. 1.1 声学基础
  9. 1.2 音频文件格式
  10. 1.3 Praat简介
  11. 第2章 Python基础
  12. 2.1 Python简介
  13. 2.2 Anaconda的安装
  14. 2.3 主要Python库
  15. 2.4 Python绘图基础
  16. 2.5 FFmpeg的安装与配置
  17. 第3章 音频信号的获取
  18. 3.1 采样与量化
  19. 3.2 读取音频文件
  20. 3.3 从视频文件提取
  21. 3.4 声音的合成
  22. 第4章 音频信号分析初步
  23. 4.1 分帧
  24. 4.2 加窗
  25. 4.3 信号的时域分析
  26. 4.4 信号的频域分析
  27. 4.5 信号的时频域分析
  28. 4.6 小波变换
  29. 第5章 语音识别基础
  30. 5.1 语音的产生和感知
  31. 5.2 汉语的语音特征
  32. 5.3 元音与共振峰
  33. 5.4 语音端点检测
  34. 5.5 基音估计
  35. 5.6 梅尔倒谱系数
  36. 第6章 传统语音识别技术
  37. 6.1 语音识别概述
  38. 6.2 动态时间规整
  39. 6.3 高斯混合模型
  40. 6.4 隐马尔可夫模型
  41. 第7章 语音识别实战
  42. 7.1 Whisper的安装
  43. 7.2 Whisper的使用
  44. 第8章 语音合成
  45. 8.1 文本转语音
  46. 8.2 语音合成
  47. 第9章 音乐分析
  48. 9.1 常用音乐术语
  49. 9.2 音乐分析常用指标
  50. 9.3 声音的包络
  51. 9.4 节拍检测
  52. 9.5 音高识别
  53. 9.6 调性分析
  54. 第10章 MIDI文件编程
  55. 10.1 MIDI文件格式剖析
  56. 10.2 用Mido操作MIDI
  57. 10.3 用Music21编曲
  58. 第11章 深度学习基础
  59. 11.1 神经网络基础
  60. 11.2 PyTorch基础
  61. 11.3 案例:声音的分类
  62. 第12章 常用神经网络
  63. 12.1 卷积神经网络
  64. 12.2 循环神经网络
  65. 12.3 案例:音乐风格分类
  66. 第13章 深度学习与语音识别
  67. 13.1 Word2Vec
  68. 13.2 ELMo
  69. 13.3 Transformer
  70. 图书推荐