Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: Erweiterung des multimodalen Verständnisses zu vielseitiger Audioerzeugung und -bearbeitung

https://ift.tt/dwrc06p

Jüngste Fortschritte in multimodalen Modellen haben rasante Entwicklungen im Bereich der Audioverarbeitung, -generierung und -bearbeitung ausgelöst. Diese Fähigkeiten werden jedoch typischerweise durch spezialisierte Modelle adressiert, wodurch die Entwicklung eines wirklich einheitlichen Rahmens, der alle drei Aufgaben nahtlos integriert, bisher unzureichend erforscht ist. Während einige bahnbrechende Arbeiten die Vereinheitlichung von Audioverständnis und -erzeugung untersucht haben, blieben sie oft auf bestimmte Domänen beschränkt. Um dem entgegenzutreten, führen wir Audio-Omni ein, das erste End-to-End-Framework, das Generierung und Bearbeitung über allgemeine Klang-, Musik- und Sprachdomänen hinweg vereint und gleichzeitig integrierte multimodale Verständniskompetenzen bietet. Unsere Architektur synergetisiert ein eingefrorenes Multimodales Large Language Model für hochrangiges Denken mit einem trainierbaren Diffusions-Transformer für eine hochtreue Synthese. Um den kritischen Datenmangel in der Audiobearbeitung zu überwinden, konstruieren wir AudioEdit, einen neuen Large-Scale-Datensatz, der über eine Million sorgfältig kuratierter Bearbeitungspaare umfasst. Umfassende Experimente zeigen, dass Audio-Omni führende Leistungswerte in einer Reihe von Benchmarks erreicht, herkömmliche einheitliche Ansätze übertrifft und gleichzeitig Leistungen auf dem Niveau oder darüber hinaus zu spezialisierten Expertenmodellen erzielt. Über seine Kernfähigkeiten hinaus weist Audio-Omni bemerkenswerte vererbte Fähigkeiten auf, darunter wissensaugmentierte Generierung, kontextbasierte Generierung und Zero-Shot-crosslinguale Kontrolle für Audioerzeugung, was einen vielversprechenden Weg hin zu universeller generativer Audiointelligenz hervorhebt. Der Code, das Modell und der Datensatz werden öffentlich zugänglich gemacht unter https://zeyuet.github.io/Audio-Omni.

HI-FI News

via Artificial Intelligence https://ift.tt/OsDap2u

14. April 2026, 05:27 Uhr

April 14, 2026 at 05:27AM