


作者:【芬】图奥马斯·维尔塔宁(Tuomas Virtanen)、【英】马克·普伦布利(Mark Plumbley)、【美】丹·伊利斯(Dan Ellis) 著;许可乐、汪昌健、程玉胜、徐齐胜、高梓健、刘振 译
定价:89元
印次:1-1
ISBN:9787302718246
出版日期:2026.07.01
印刷日期:2026.07.01
图书责编:苏东方
图书分类:学术专著
"本书系统介绍了该领域的理论基础、核心方法与实际应用,内容涵盖声学、心理声学、信号处理与机器学习等多学科知识。全书结构清晰,分为“基础—核心方法—先进方法—应用—展望”五个部分,共14章,完整呈现了从声音特征提取、统计建模与深度学习,到复杂场景分析与多模态融合的完整技术链条。本书既为初学者构建了系统的知识框架,也为资深研究人员提供了前沿技术视角,兼具学术深度与实践指导价值。 本书适合计算机科学、电子工程等相关专业的研究生、科研人员与工程师阅读,也可作为音频检索、智能家居、智慧城市及生物声学等领域技术开发者的参考用书。 "
前言 很高兴能将这本声音计算分析领域的经典著作——Compulational Analysis of Sound Scenes and Events——以中文形式呈现给读者。本书由Tuomas Virtanen教授等国际权威学者合力撰写,自2018年由施普林格出版以来,迅速成为该领域研究人员和工程师不可或缺的参考书。在国防科技大学从事相关教学与科研工作的过程中,我深感国内学术界与工业界对声音场景理解的需求日益迫切,而一本系统性的高端译著的缺失,促使我们团队下决心承担起这份翻译工作。 声音是理解物理与数字环境的关键媒介。本书的价值在于它首次以清晰、连贯的体系,全面梳理了从声学基础、心理声学原理,到特征提取、统计建模与深度学习方法,再到复杂场景分析、多模态融合及实际应用的完整技术链条。我们在翻译过程中,力求在准确传达原书精辟学术论述的同时,也兼顾中文表达的流畅与专业性,希望能让读者在阅读时,既能把握国际前沿的核心方法,又能无障碍地理解其背后的设计思想与工程考量。 本书的翻译与审校工作历时近一年,期间团队成员反复推敲,多次与领域同行探讨关键术语的译法,并补充了必要的译者注,以期更贴合国内读者的知识背景与阅读习惯。我们深信,这本译著不仅能为计算机科学、电子工程、信息处理等相关专业的研究生和科研人员提供一份理想的学习材料,也能为从事智能听觉、音频检索、智慧城市及生物声学应用的工程师带来切实的技术启发。 期待本书能助力更多同仁踏入这一充满机遇的研究领域,共同推动声音计算分析技术在中国的发展与创新。 许可乐于国防科技大学2026年5月
第一部分基础第1章声音场景和事件分析介绍3
1.1研究动机3
1.2声音场景、声音事件及其计算分析的定义4
1.3相关领域5
1.4声音场景和事件计算分析中的科学挑战6
1.5关于本书6
参考文献8第2章用于分析声音场景和事件的机器学习方法10
2.1引言10
2.2分析系统概述11
2.3数据采集12
2.3.1源音频12
2.3.2参考标签13
2.4音频处理14
2.4.1预处理14
2.4.2特征提取15
2.5监督学习和识别16
2.5.1学习17
2.5.2泛化18
2.5.3识别18
2.6一种基于神经网络的实例化方法20
2.6.1声音分类22
2.6.2声音事件检测23
2.7音频分析系统的开发过程24
2.7.1技术研究25
2.7.2产品演示26
2.7.3开发过程27
2.8总结28
参考文献28第3章声音场景和事件的声学和心理声学31
3.1引言31
3.2听觉场景和事件的声学和心理声学特征32
3.2.1声景和事件的声学特征32
3.2.2听觉场景和事件的心理声学34
3.3听觉场景的感知38
3.3.1多维表示法38
3.3.2时间一致性38
3.3.3分离的其他影响39
3.4听觉场景的感知40
3.4.1感知声音事件的特性: 心理声学40
3.4.2声音识别的最小特征和稀疏特征41
3.4.3讨论: 听觉表征的维度43
3.5总结44
参考文献44
第二部分核 心 方 法第4章环境声音分析的声学特征55
4.1引言55
4.2信号表示56... 查看详情
《声音场景与事件的计算分析》是国际计算机听觉领域的奠基性**专著,由该领域**学者主编,系统梳理了声音场景识别与音频事件检测的核心技术与前沿进展。全书从基础理论、信号处理、深度学习模型到跨模态应用,构建了完整的技术体系,涵盖特征提取、模型架构、鲁棒性处理及实际部署等关键内容。书中理论与实践并重,包含算法伪代码、案例分析与数据集介绍,是该领域**全面覆盖双核心任务的著作。中文版的出版,将为国内音频信号处理、机器学习、智能感知等领域的研究者与工程师提供重要参考,助力相关技术在智能家居、智慧城市、安防监控等领域的创新应用。

