NVIDIA and the University of Maryland Researchers Released Audio Flamingo Next (AF-Next): A Super Powerful and Open Large Audio-Language Model

NVIDIA und die Forscher der University of Maryland haben Audio Flamingo Next (AF-Next) veröffentlicht: ein superselbstbewusstes und offenes Large Audio-Language Model
https://ift.tt/ycb69ra
Verständnis von Audio war schon immer die multimodale Grenze, die dem Bereich Vision hinterherhinkt. Während Bild-Sprach-Modelle rasch in die reale Anwendung skaliert haben, war es bisher sehr schwierig, offene Modelle zu bauen, die über Sprache, Umweltgeräusche und Musik – insbesondere über längere Abschnitte – robust logisch schließen können. NVIDIA und die Forscher der University of Maryland gehen nun direkt diesen Gap an.
Das Forschungsteam hat Audio Flamingo Next (AF-Next) veröffentlicht, das leistungsfähigste Modell der Audio Flamingo-Serie und ein vollständig offenes Large Audio-Language Model (LALM), das auf Audiodaten in Internet-Skalierung trainiert wurde.
Audio Flamingo Next (AF-Next) kommt in drei spezialisierten Varianten für unterschiedliche Anwendungsfälle. Die Veröffentlichung umfasst AF-Next-Instruct für allgemeine Fragebeantwortung, AF-Next-Think für fortgeschrittenes mehrstufiges Denken und AF-Next-Captioner für detaillierte Audio-Beschreibung.
Was ist ein Large Audio-Language Model (LALM)?
Ein Large Audio-Language Model (LALM) kombiniert einen Audio-Encoder mit einem nur-Decoder-Sprachmodell, um Fragebeantwortung, Bildbeschreibung, Transkription und Schlussfolgerungen direkt über Audioeingaben zu ermöglichen. Man kann es sich als das Audio-Äquivalent zu einem Bild-Sprach-Modell wie LLaVA oder GPT-4V vorstellen, aber so konzipiert, dass es Sprache, Umweltgeräusche und Musik gleichzeitig – in einem einzigen einheitlichen Modell – verarbeitet.
Die Architektur: Vier Komponenten, die in einer Pipeline zusammenarbeiten
AF-Next basiert auf vier Hauptkomponenten: Erstens der AF-Whisper-Audio-Encoder, ein auf Whisper basierender, artenreich vorgetrainierter Encoder, der multilingualen Sprach- und Multi-Talker-ASR-Daten umfasst. Gegebenenfalls wird der Audioeingang auf 16 kHz Mono resampelt und die Wellenform in ein 128-Kanal-Log-Mel-Spektrogramm mit einem 25 ms Fenster und einer 10 ms Hop-Größe umgewandelt. Das Spektrogramm wird in nicht überlappende 30-Sekunden-Chunks durch AF-Whisper verarbeitet, das Features mit 50 Hz ausgibt, woraufhin eine Stride-2-Pooling-Schicht folgt. Die verborgene Dimension beträgt 1280.
Zweitens der Audio-Adapator, ein zweilagiges MLP, das AF-Whispers Audio-Repräsentationen in den Embedding-Raum des Sprachmodells überführt. Drittens das LLM-Backbone: Qwen-2.5-7B, ein dekoderloses kausales Modell mit 7 Milliarden Parametern, 36 Transformer-Schichten und 16 Attention Heads, dessen Kontextlänge durch zusätzliches Long-Context-Training von 32k auf 128k Tokens erweitert wurde.
Ein feiner, aber wichtiger architektonischer Detailpunkt sind Rotary Time Embeddings (RoTE). Standardmäßige Positionskodierungen in Transformern indizieren ein Token durch seine diskrete Sequenzposition i. RoTE ersetzt dies: Statt der Standard-RoPE-Rotationswinkel θ ← −i · 2π verwendet RoTE θ ← −τi · 2π, wobei τi der absolute Zeitstempel jedes Tokens ist. Für Audio-Tokens, die mit einer festen 40 ms-Schrittweite erzeugt werden, werden diskrete Zeitpositionen interpoliert, bevor sie in das RoTE-Modul eingespeist werden. Dadurch entstehen positionsbezogene Repräsentationen, die auf tatsächlicher Zeit basieren statt auf der Reihenfolge – eine zentrale Designentscheidung, die das zeitliche Denken des Modells ermöglicht, insbesondere bei langem Audio. Schließlich ermöglicht ein Streaming-TTS-Modul eine Stimme-zu-Stimme-Interaktion.
Zeitliche Audio-Verkettung des Denkens: Die zentrale Anforderungen-Erklärungs-Rezeptur
Chain-of-Thought (CoT)-Prompting hat das Schlussfolgern in Text- und Bild-Modellen verbessert, aber frühere Audio-CoT-Arbeiten zeigten nur geringe Verbesserungen, weil Trainingsdatensätze auf kurze Clips mit einfachen Fragen beschränkt waren. AF-Next geht dieses Problem mit Temporal Audio Chain-of-Thought an, bei dem das Modell jeden Zwischenschritt explizit an einen Zeitstempel im Audio ankern, bevor eine Antwort erzeugt wird. Dadurch wird die Beweisführung treuer und die Halluzinationen bei langen Aufnahmen reduziert.
Um diese Fähigkeit zu trainieren, hat das Forscherteam AF-Think-Time erstellt, einen Datensatz aus Frage-Antwort-Denk-Ketten, der aus anspruchsvollen Audioquellen wie Trailern, Filmzusammenfassungen, Mysteriengeschichten und langen Mehrparteien-Gesprächen kuratiert wurde. AF-Think-Time umfasst ca. 43K Trainingsbeispiele, mit durchschnittlich 446,3 Wörtern pro Denk-Kette.
Training in großem Maßstab: 1 Million Stunden, vier Phasen
Der endgültige Trainingsdatensatz umfasst ca. 108 Millionen Beispiele und ca. 1 Million Stunden Audio, gezogen aus bereits öffentlich veröffentlichten Datensätzen und Roh-Audio, das aus dem offenen Internet gesammelt und anschließend synthetisch gelabelt wurde. Neue Datenkategorien umfassen über 200K lange Videos von 5 bis 30 Minuten für Langform-Beschreibung und QA, Multi-Talker-Sprachverstehen-Daten, die Sprecheridentifikation, Unterbrechungs-Erkennung und Zielsprecher-ASR abdecken, ca. 1 Million Beispiele für Multi-Audio-Reasoning über mehrere gleichzeitig vorhandene Audiosignale und ca. 386K Sicherheits- und Folgeanweisungs-Beispiele.
Das Training folgt einem vierstufigen Curriculum, jeweils mit unterschiedlichen Datenmischungen und Kontextlängen. Pr training besteht aus zwei Unterphasen: Phase 1 trainiert nur den Audio-Adapator, während AF-Whisper und das LLM eingefroren bleiben (max. Audio 30 Sekunden, Kontext 8K Tokens); Phase 2 optimiert zusätzlich den Audio-Encoder, wobei das LLM weiterhin eingefroren bleibt (max. Audio 1 Minute, Kontext 8K Tokens). Mittleres Training hat ebenfalls zwei Unterphasen: Phase 1 führt das vollständige Fine-Tuning des gesamten Modells durch, mit AudioSkills-XL und neu kuratierten Daten (max. Audio 10 Minuten, Kontext 24K Tokens); Phase 2 führt Lang-Audio-Beschreibungen und QA ein, reduziert die Mischung der Phase-1-Daten auf die Hälfte ihrer ursprünglichen Mischgewichte, erweitert den Kontext auf 128K Tokens und Audio auf 30 Minuten. Das Modell, das aus dem Mittleren Training hervorgeht, wird speziell als AF-Next-Captioner veröffentlicht. Nachtraining wendet GRPO-basierte Verstärkendes Lernen auf Mehr-Turn-Chat, Sicherheit, Befolgung von Anweisungen und ausgewählten surring-spezifischen Datensätzen an, wodurch AF-Next-Instruct entsteht. Schließlich beginnt das CoT-Training mit AF-Next-Instruct, wendet SFT auf AF-Think-Time an und nutzt dann GRPO unter Verwendung der Nachtraining-Datenmischung, wodurch AF-Next-Think entsteht.
Eine bemerkenswerte Leistung des Forscherteams ist Hybrid-Sequenz-Parallele Verarbeitung, die 128K-Kontext-Training bei Lang-Audio möglich macht. Ohne sie würde die Erweiterung von Audio-Tokens die Standard-Kontextfenster sprengen und die quadratische Speicherbudgetierung der Selbstaufmerksamkeits-Operationen unerschwinglich werden. Die Lösung kombiniert Ulysses-Aufmerksamkeit – die All-to-All-Kollektive verwendet, um Sequenz- und Kopf-Dimensionen innerhalb von Nodes zu verteilen, in denen Hochgeschwindigkeits-Interconnects vorhanden sind – mit Ring-Aufmerksamkeit, die Schlüssel-Wert-Blöcke über Nodes hinweg per Punkt-zu-Punkt-Transfers zirkuliert. Ulysses bewältigt die Intra-Node-Kommunikation effizient; Ring skaliert über Nodes hinweg.
Benchmark-Ergebnisse: Stark in allen Bereichen
Auf MMAU-v05.15.25, dem am häufigsten verwendeten Audio-Reasoning-Benchmark, erreicht AF-Next-Instruct eine durchschnittliche Genauigkeit von 74,20 gegenüber Audio Flamingo 3 mit 72,42; AF-Next-Think erreicht 75,01 und AF-Next-Captioner 75,76 – mit Zuwächsen in allen drei Unterkategorien: Sound (79,87), Music (75,3) und Speech (72,13). Beim anspruchsvolleren MMAU-Pro-Benchmark übertrifft AF-Next-Think (58,7) Gemini-2.5-Pro (57,4), das Closed-Source-Produkt.
Musikverständnis weist besonders starke Gewinne auf. Beim Instrumentenerkennungstest Medley-Solos-DB erreicht AF-Next 92,13 gegenüber Audio Flamingo 2s 85,80. Beim SongCaps-Musik-Beschreiben springen GPT5-Abdeckung und Korrektheitswerte von 6,7 bzw. 6,2 (AF3) auf 8,8 bzw. 8,9.
Lang-Audio-Verständnis ist der Bereich, in dem AF-Next sich am deutlichsten abhebt. Auf LongAudioBench erreicht AF-Next-Instruct 73,9 und übertrifft Audio Flamingo 3 (68,6) sowie Gemini 2.5 Pro (60,4). In der sprachintensiven Variante (+Speech) erreicht AF-Next 81,2 gegenüber Gemini 2.5 Pros 66,2. In ASR setzt AF-Next-Instruct neue Tiefstwerte unter LALMs mit einer Wortfehlerquote (WER) von 1,54 im LibriSpeech Test-clean und 2,76 im Test-other. In VoiceBench erreicht AF-Next-Instruct die höchsten Werte bei AlpacaEval (4,43), CommonEval (3,96) und OpenBookQA (80,9), und übertrifft Audio Flamingo 3 um mehr als 14 Punkte bei OpenBookQA. Beim CoVoST2-Sprachübersetzung zeigt AF-Next eine besonders bemerkenswerte 12-Punkte-Steigerung gegenüber Phi-4-mm in der arabischen EN→X-Übersetzung (21,9 gegenüber 9,9).
Schlüsseleinsichten
Hier sind 5 zentrale Takeaways:
– Vollständig offenes Audio-Language-Modell in Internet-Skala: AF-Next gilt als erstes LALM, das Audio-Verständnis auf Internet-Skala skaliert – ca. 108 Millionen Samples und 1 Million Stunden Audio.
– Temporal Audio Chain-of-Thought löst Lang-Audio-Reasoning: Anstatt wie frühere CoT-Ansätze zu logieren, ankert AF-Next jeden Zwischenschritt explizit an einem Zeitstempel im Audio, bevor eine Antwort erzeugt wird. Dies macht das Modell deutlich treuer und interpretierbarer bei langen Aufnahmen bis zu 30 Minuten – ein Problem, das frühere Modelle weitgehend umgangen haben.
– Drei spezialisierte Varianten für unterschiedliche Anwendungsfälle: Die Veröffentlichung umfasst AF-Next-Instruct für allgemeine Fragebeantwortung, AF-Next-Think für fortgeschrittene mehrstufige Reasoning und AF-Next-Captioner für detaillierte Audio-Beschreibungen – wodurch Praktiker das passende Modell je nach Aufgabe auswählen können statt einen One-Size-Fits-All-Checkpoint zu verwenden.
– Übertrifft Closed-Modelle bei Lang-Audio, obwohl kleiner: Auf LongAudioBench erzielt AF-Next-Instruct 73,9 – besser als Gemini 2.5 Pro (60,4) und Audio Flamingo 3 (68,6). In der sprachintensiven Variante steigt der Abstand weiter auf AF-Next 81,2 gegenüber Gemini 2.5 Pro mit 66,2.
Check out Paper, Project Page und Model Weights.
Hinweis: Zusätzlich folgen Sie uns auf Twitter und schließen Sie sich unserem 130k+ ML Subreddit an und abonnieren Sie unseren Newsletter. Übrigens, sind Sie auch auf Telegram aktiv? Jetzt können Sie uns auch dort folgen.
Möchten Sie mit uns kooperieren, um Ihr GitHub-Repo oder Ihre Hugging Face-Seite oder Produktveröffentlichung oder Webinar zu promoten? Connect with us.
Der Beitrag NVIDIA und die University of Maryland Forscher veröffentlichten Audio Flamingo Next (AF-Next): Ein Super Kraftvolles und Offenes Large Audio-Language Model erschien zuerst bei MarkTechPost.
HI-FI News
via MarkTechPost https://ift.tt/79ol438
14. April 2026, 10:27 Uhr (MESZ)
April 14, 2026 at 10:27AM
-
Product on sale
Audiophile Vinyl Records Cleaning BundleOriginal price was: €69.90.€59.90Current price is: €59.90. excl. VAT -
Product on sale
Easy Start Vinyl Records Cleaning KitOriginal price was: €69.90.€59.90Current price is: €59.90. excl. VAT -
Vinyl Records Cleaner Easy Groove Concentrate€34.95 excl. VAT -
Easy Groove Super Set€199.00 excl. VAT -
Easy Groove Enzycaster – vinyl records prewash cleaner€34.95 excl. VAT -
Easy Groove Extreme MK. II- vinyl records prewash cleaner€45.00 excl. VAT -
Vinyl Records Cleaner – Easy Groove Virgin Concentrate€35.00 excl. VAT -
Easy Groove Spray&Wipe vinyl records cleaner€34.95 excl. VAT








