
闵安娜 投稿新手配资指南
量子位 | 公众号 QbitAI
想象一下,让机器人自己学会“听”出声音来自何方。
不需要昂贵的360度麦克风阵列,也不需要人工标注的数据集,只需让它观看无标注的YouTube视频:人们在喷泉边行走、在公园里演奏音乐、或在空旷的大厅中鼓掌,机器人就能直接感知声音的位置。
如何让人工智能仅借助相机自身的自然运动,从原始、嘈杂的真实世界互联网视频中,学会三维空间音频感知?来自清华和密西根大学的研究团队,在CVPR 2025上给出了一条新路径。
以往的空间音频模型,要么受限于实验室的苛刻采集条件,要么被高昂的人工标注成本卡住脖子。而团队的核心洞察是:相机的自运动本身就是一种免费的监督信号。当相机转动时,声源在声场中的相对位置随之改变——这种变化无需人工标注,模型即可从中学习空间对应关系。这项工作入选CVPR 2025 Highlight,投稿论文前2%。

背景
人类的感知系统由多种感官构成,除了最常见的视觉之外,还包括听觉、触觉、嗅觉等,它们共同构成了人类理解和感知外部世界的多维通道。
在认知科学研究中,婴儿从出生起便通过多模态的感知系统探索环境,不仅依赖视觉,同时也整合听觉、触觉甚至对数量的感知(如数觉)来建立对物体的认知模型。这一基础认知过程在多个应用领域具有重要意义,例如虚拟现实、自动驾驶系统、以及具备自主感知与决策能力的智能体。
在多模态感知的研究中,自顶向下的方法通常包括两个层级。
元股证券:ygzq.hk
一类研究致力于构建符合物理规律的模拟环境,通过高质量的实验室数据收集多模态信息;
另一类则聚焦于从真实世界的互联网数据中提取感知规律。
这两个方向分别代表了以创新的学习方法从数据中反推物理机制,以及以已知物理规律指导不同模态信息的合成与建模。
自底向上的研究则更加侧重从真实感知数据中挖掘模态间的关联。早期的代表性工作如SoundNet与FAIR Play,后续逐步发展到更具代表性的Ego4D项目。这些研究通常通过音频和视频之间的联合建模(如单声道音频与视频信号)来学习两者之间的语义关联,核心目标是缩小模态间的分布差异,实现例如声音定位、活动发声者检测以及多说话人语音分离等任务。进一步地,研究开始关注空间音频与视频之间的对齐,尤其是在可视范围内的人体行为与声音的关系建模。


随着技术的演进,一些工作引入了360度空间音频与视频的联合建模,通过学习两者间的空间关系,构建了具备空间感知能力的多模态数据系统。然而,这类方法普遍面临两个挑战:对大量人工标注的依赖,以及由于360度视频的采集需特殊设备与设置,导致方法本身在大规模应用中不具可扩展性。
因此,在从in-the-wild数据中进行自底向上学习的背景下,一个关键研究问题被提出:是否存在一种可扩展的方法,可以仅基于有限视角和有限录制设备,从真实世界的音视频数据中学习360度空间音频的感知能力,并适用于多种复杂场景?
更具体而言,这一问题可以表述为:如何从密集视觉视角的线索中,学习具有限定传感器配置的360度空间多模态感知能力?
技术方案
在现实环境中采集的音视频数据通常具有高度噪声性,存在大量冗余音源以及多声源重叠等问题,这对多模态建模提出了严峻挑战。如图所示,在真实场景中,多个声源常常位于同一视觉区域,使得仅依赖视觉线索难以准确区分主导声源。因此,若缺乏人工标注,仅凭视觉信号进行空间音频建模具有显著困难。
早期研究在缺乏监督信号的情况下,主要依赖双耳音频信号中的时差估计来实现空间声源定位。而本研究提出了一种新的建模范式,利用视觉引导的自运动作为监督信号,引导声源空间位置学习。具体而言,团队采集了大量野外音视频数据,并构建了两个基准数据集:iPhone Fountain和iPhone Music Dataset,涵盖了不同设备(如iPhone、RWAVS等)下的音视频同步数据。

在训练阶段,模型的输入为两个相邻时间戳的音频片段与对应的视频帧。团队首先通过视觉帧对估算相机的自运动,包括旋转方向与平移方向,从而得到相机运动的稀疏标签信号。这些标签信号被进一步编码为one-hot形式(如左/右、前/后),用于监督音频间的相对空间位移学习。
如图所示,整体框架包括两个主要模块:Spatial Sound Localization模块对两个时间点的音频进行编码,并预测声源的相对空间运动;Ego Motion Estimation模块则基于视觉帧估计出相机的旋转和平移方向。二者的对齐过程通过以下损失函数进行联合优化:

其中,与分别对应旋转与平移方向的监督损失,为二分类的辅助监督损失,与为调节各损失项的重要性权重。
模型在训练过程中仅利用视觉运动标签即可实现对空间音频的监督学习。在推理阶段,模型输入一段空间音频片段,输出其空间方向的角度分类结果。由于团队假设声源相对于麦克风设备的运动角速度远小于设备自身的旋转速度,因此在优化过程中对旋转相关损失赋予更高权重,从而提高模型对相机旋转信息的敏感性。此外,模型还引入传统的二元交叉熵损失以增强鲁棒性与区分能力。
实验结果
实验结果表明,所提出的模型在多种组合场景下均表现出优越性能,无论是在团队新采集的个体化数据集上,还是在用于结果验证的Fountain dataset上,模型均取得了稳定且领先的表现。为进一步分析三类损失函数在整体性能中的具体贡献,以及其在不同环境条件(如相机旋转与平移幅度、声源分布模式等)下的作用差异,团队设计并实施了一系列消融实验。



实验发现,远距离声源在多个场景中表现出一致性偏差,这一现象可以被视为当前数据集的一个“行业偏差”。具体而言,模型性能在很大程度上受到声源与摄像机之间空间距离的影响。随着声源距离的增加,声音在空间定位任务中的辨别性逐渐降低,从而影响最终预测准确性。
项目价值
项目回答了一个更根本的问题:空间音频感知,能不能走出实验室?以往,想让机器“听声辨位”,要么给它戴上昂贵的360度麦克风阵列,要么雇人手工标注海量数据。两条路都通向同一个结局——技术被锁在可控环境里,无法规模化。这也是为什么空间音频在机器人、AR/VR、自动驾驶等领域长期“叫好不叫座”。
而团队的方案证明了另一条路可行:用互联网视频做老师,用相机的自运动做监督信号,无需标注、无需特制设备,模型就能从真实世界的混沌中学会三维空间听觉。
实验结果表明,这套框架不仅在自采数据集上表现优异,在公开基准上也取得了具有竞争力的结果——更重要的是,团队证明了“野外数据”不是障碍,而是可规模化的训练资源。更长远地看,这项工作指向了三个方向:
对具身智能:机器人不再需要“听力培训”,只要带着摄像头走一遭,就能自主理解周围的声音空间;
对AR/VR:空间音频渲染可以摆脱昂贵的全景采集设备,让沉浸式体验的制造成本大幅下降;
对多模态学习:团队提供了一条新思路——视觉运动是音频空间感知的“免费老师”,这种跨模态监督信号的挖掘,或许比模型架构本身更具想象力。
作者团队
闵安娜:清华大学本科,曾在MIT CSAIL及密歇根大学访问学生。曾获清华大学学业优秀奖学金、科技优秀奖学金、综合奖学金及星火计划奖学金等。
陈梓阳:密歇根大学博士,现任Luma AI研究科学家。
赵行:清华大学交叉信息研究院助理教授,上海期智研究院PI,星海图联合创始人及CTO。

Andrew Owens:康奈尔大学副教授。
论文链接:https://scholar.google.com/citations?view_op=view_citation&hl=zh-CN&user=QEMEaxwAAAAJ&citation_for_view=QEMEaxwAAAAJ:d1gkVwhDpl0C
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🎓 我们会 (尽量) 及时回复你 :)
🌟 点亮星标 🌟
科技前沿进展每日见新手配资指南
元股证券实盘-一站式服务提示:本文来自互联网,不代表本网站观点。