目录
第一部分基础第1章声音场景和事件分析介绍3
1.1研究动机3
1.2声音场景、声音事件及其计算分析的定义4
1.3相关领域5
1.4声音场景和事件计算分析中的科学挑战6
1.5关于本书6
参考文献8第2章用于分析声音场景和事件的机器学习方法10
2.1引言10
2.2分析系统概述11
2.3数据采集12
2.3.1源音频12
2.3.2参考标签13
2.4音频处理14
2.4.1预处理14
2.4.2特征提取15
2.5监督学习和识别16
2.5.1学习17
2.5.2泛化18
2.5.3识别18
2.6一种基于神经网络的实例化方法20
2.6.1声音分类22
2.6.2声音事件检测23
2.7音频分析系统的开发过程24
2.7.1技术研究25
2.7.2产品演示26
2.7.3开发过程27
2.8总结28
参考文献28第3章声音场景和事件的声学和心理声学31
3.1引言31
3.2听觉场景和事件的声学和心理声学特征32
3.2.1声景和事件的声学特征32
3.2.2听觉场景和事件的心理声学34
3.3听觉场景的感知38
3.3.1多维表示法38
3.3.2时间一致性38
3.3.3分离的其他影响39
3.4听觉场景的感知40
3.4.1感知声音事件的特性: 心理声学40
3.4.2声音识别的最小特征和稀疏特征41
3.4.3讨论: 听觉表征的维度43
3.5总结44
参考文献44
第二部分核 心 方 法第4章环境声音分析的声学特征55
4.1引言55
4.2信号表示56
4.2.1信号采集与预处理56
4.2.2一般时频表示法57
4.2.3对数频率和感知动机表征57
4.2.4多尺度方法59
4.2.5讨论59
4.3特征工程60
4.3.1时域特征60
4.3.2频谱形状特征61
4.3.3倒谱特征62
4.3.4基于感知的特征63
4.3.5基于频谱图图像的特征63
4.3.6讨论64
4.4特征学习64
4.4.1深度学习提取特征64
4.4.2矩阵因式分解技术65
4.4.3讨论66
4.5降维与特征选择66
4.5.1降维67
4.5.2特征选择范例67
4.5.3过滤方法68
4.5.4嵌入式特征选择68
4.6时间整合和池化69
4.6.1通过简单统计进行时间整合69
4.6.2基于模型的集成70
4.6.3讨论70
4.7与语音和音乐处理工作的关系71
4.8总结71
参考文献72第5章用于声音场景和事件分类的统计学方法78
5.1引言78
5.1.1准备工作79
5.1.2验证和测试80
5.2判别方法81
5.2.1二元线性模型81
5.2.2多分类线性模型83
5.2.3非线性判别模型83
5.3生成模型84
5.3.1最大似然估计84
5.3.2贝叶斯估计: 最大后验估计85
5.3.3完全贝叶斯推断86
5.3.4高斯混合模型86
5.3.5隐马尔可夫模型89
5.4深度模型91
5.4.1符号标记91
5.4.2多层感知机91
5.4.3卷积神经网络95
5.4.4循环神经网络98
5.4.5混合架构101
5.5提升模型稳定性102
5.5.1数据增强102
5.5.2域自适应102
5.5.3集成方法102
5.6总结103
参考文献103第6章数据集和评估111
6.1引言111
6.2音频和标签的特性112
6.2.1音频内容112
6.2.2音频标签114
6.3获取参考标注116
6.3.1设计手动标注任务116
6.3.2跨标注者一致性和数据可靠性118
6.4用于环境声音分类和检测的数据集119
6.4.1创建新数据集120
6.4.2可用数据集121
6.4.3数据增强123
6.5验证124
6.5.1验证设置124
6.5.2验证方法125
6.6制定评估协议的建议131
参考文献133
第三部分先 进 方 法第7章日常声音分类139
7.1引言139
7.2分类理论140
7.2.1经典分类理论140
7.2.2整体感知140
7.2.3分类原型理论141
7.2.4分类示例理论142
7.2.5自底向上和自顶向下过程142
7.3声音分类的研究方法143
7.3.1数据收集143
7.3.2数据分析144
7.4人们在日常生活中如何对声音进行分类146
7.4.1孤立的环境声音146
7.4.2听觉范畴的语言标记148
7.4.3影响日常声音分类的因素149
7.4.4复杂的听觉场景150
7.5日常声音总结151
7.5.1声音事件的分类152
7.5.2复杂听觉场景的分类标准153
7.5.3向声音场景实体发展154
7.5.4声音事件154
7.5.5比较157
7.6总结157
参考文献158第8章复杂声音场景分析方法162
8.1引言162
8.2声音场景识别163
8.2.1方法163
8.2.2实际考虑165
8.3声音事件检测与分类165
8.3.1范式和技术166
8.3.2单音事件检测/分类167
8.3.3复调音事件检测/分类171
8.3.4后处理174
8.3.5分类优先还是检测优先175
8.4语境和声学语言模型175
8.4.1基于上下文的声音事件检测175
8.4.2声学语言模型176
8.5事件检测用于场景分析177
8.6总结179
参考文献180第9章事件检测和场景分析中的多视图方法185
9.1引言185
9.2背景与概述186
9.2.1多视图结构186
9.2.2视觉特征187
9.3多视图数据分析的通用技术187
9.3.1表示和特征集成与融合187
9.3.2决策级融合191
9.4视听事件检测192
9.4.1动机192
9.4.2视听事件检测方法193
9.5基于麦克风阵列的声音场景分析194
9.5.1空间线索建模195
9.5.2基于空间线索的声音场景分析197
9.6总结201
参考文献202
第四部分应用第10章声音共享与检索205
10.1引言205
10.2数据库创建207
10.2.1许可证、文件格式和大小207
10.2.2元数据208
10.2.3音频特征209
10.3基于元数据的声音检索210
10.3.1音频内容元数据210
10.3.2索引内容的搜索与发现211
10.4基于音频的声音检索212
10.4.1音频特征212
10.4.2特征空间213
10.4.3基于描述符的查询213
10.4.4示例查询214
10.4.5音频指纹和缩略图214
10.5声音检索的高阶方法215
10.6总结216
参考文献217第11章计算生物声学场景分析222
11.1引言222
11.2生物声学任务223
11.2.1种群监测、定位和范围223
11.2.2物种和亚种识别224
11.2.3“词汇”分析以及动物交流系统的不变性和变化研究225
11.2.4数据挖掘、档案管理和公民科学225
11.3研究方法和方法问题226
11.3.1检测、分割和分类226
11.3.2源分离229
11.3.3测量动物声音之间的相似性229
11.3.4发声序列231
11.3.5整体声景分析: 生态声学232
11.3.6可视化和数据挖掘234
11.4大规模分析技术235
11.4.1分类器和检测器235
11.4.2通过低复杂度的前端减少计算236
11.4.3特征236
11.5观点和开放性问题238
参考文献239第12章智能家居中的音频事件识别246
12.1引言246
12.2AER在智能家居中的应用引发了新的研究方向250
12.2.1音频事件作为结构化中断序列250
12.2.2连续7×24小时声音识别作为开集问题251
12.2.3“真实世界”: 应对有限的音频质量和计算能力252
12.3用户体验256
12.3.1用户界面方面256
12.3.2主观性在AER评价中的意义257
12.3.3AER评价的主观性与客观性辨析259
12.3.4总结: 客观性、主观性和用户体验261
12.4道德问题: 隐私和数据保护262
12.4.1各国的隐私和数据保护问题262
12.4.2环境音频数据实际上是私有的吗263
12.4.3允许及拥有权264
12.4.4数据保护及安全265
12.5总结266
参考文献267第13章智慧城市中的声音分析272
13.1引言272
13.1.1智慧城市272
13.1.2城市声音感知与分析272
13.1.3本章概述273
13.2智慧城市应用273
13.3声学传感器网络275
13.3.1移动声音传感275
13.3.2静态声音传感275
13.3.3设计一种低成本的声学传感装置276
13.3.4网络设计和基础设施277
13.4了解城市声景278
13.4.1城市声音数据集279
13.4.2工程特征与学习特征281
13.4.3通过卷积实现平移不变性283
13.4.4深度学习和数据增强283
13.5总结284
参考文献285
第五部分展望第14章未来展望293
14.1引言293
14.2获取训练数据293
14.2.1声音编目293
14.2.2随机数据收集296
14.2.3使用无监督数据297
14.2.4评估任务299
14.3展望未来299
14.3.1应用程序299
14.3.2方法300
14.4总结301
参考文献301
