VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories

VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories

VidAudio-Bench:对四种音频类别的 V2A 与 VT2A 生成进行基准测试

https://ift.tt/yq6Bg1L

视频转音频(V2A)生成对于沉浸式多媒体体验至关重要,但其评估仍缺乏充分研究。现有基准通常在统一协议下评估多种音频类型,忽视不同音频类别的细粒度需求。为解决这一空白,我们提出 VidAudio-Bench,这是一个用于 V2A 评估的多任务基准,具有以下四个关键特征:(1)广泛覆盖:覆盖四种代表性音频类别——特效、音乐、语音和歌声——在 V2A 和视频文本转音频(VT2A)设置下的评估。 (2)广泛评估:包含 1,634 对视频文本对,基准测试 11 种最先进的生成模型。 (3)全面度量:引入 13 种任务特定、无参考度量,系统性评估音频质量、视频-音频一致性和文本-音频一致性。 (4)人工对齐:通过主观研究验证所有度量,与人类偏好高度一致。实验结果表明,当前的 V2A 模型在语音和歌声方面的表现相对特效较差。我们的 VT2A 结果进一步凸显指令遵循与视觉定位生成之间的基本张力:更强的视觉条件有助于视频-音频对齐,但往往以生成所期望音频类别的代价为代价。这些发现确立了 VidAudio-Bench 作为诊断 V2A 系统的综合且可扩展的框架,并为多模态音频生成提供新的见解。

HI-FI News

via Artificial Intelligence https://ift.tt/OsDap2u

2026 年 4 月 14 日 05:27 AM

April 14, 2026 at 05:27AM