Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni : étendre la compréhension multimodale à une génération et édition audio polyvalentes

https://ift.tt/dwrc06p

Les progrès récents dans les modèles multimodaux ont favorisé des avancées rapides dans la compréhension, la génération et l’édition audio. Cependant, ces capacités sont généralement abordées par des modèles spécialisés, laissant peu explorée l’élaboration d’un cadre véritablement unifié capable d’intégrer sans effort les trois tâches. Alors que certains travaux pionniers ont exploré l’unification de la compréhension et de la génération audio, ils restent souvent confinés à des domaines spécifiques. Pour répondre à cela, nous présentons Audio-Omni, le premier cadre end-to-end qui unifie la génération et l’édition dans les domaines généraux du son, de la musique et de la parole, avec des capacités de compréhension multimodale intégrées. Notre architecture associe un modèle de langage multimodal figé pour le raisonnement de haut niveau à un Diffusion Transformer entraînable pour une synthèse fidèle. Pour surmonter la pénurie critique de données dans l’édition audio, nous construisons AudioEdit, un nouveau jeu de données de grande ampleur comprenant plus d’un million de paires d’édition méticuleusement sélectionnées. Des expériences approfondies démontrent que Audio-Omni atteint des performances de pointe sur une série de repères, surpassant les approches unifiées antérieures tout en égalant ou dépassant les modèles experts spécialisés. Au-delà de ses capacités centrales, Audio-Omni présente des capacités héritées remarquables, notamment un raisonnement génératif enrichi par les connaissances, une génération en contexte et un contrôle zéro-shot interlingual pour la génération audio, soulignant une direction prometteuse vers une intelligence générative audio universelle. Le code, le modèle et le jeu de données seront publiquement publiés sur https://zeyuet.github.io/Audio-Omni.

HI-FI News

via Artificial Intelligence https://ift.tt/OsDap2u

14 avril 2026 à 05:27
AM

April 14, 2026 at 05:27AM