NVIDIA and the University of Maryland Researchers Released Audio Flamingo Next (AF-Next): A Super Powerful and Open Large Audio-Language Model

NVIDIA et les chercheurs de l’Université du Maryland ont publié Audio Flamingo Next (AF-Next) : un modèle audio-langage large très puissant et entièrement ouvert
https://ift.tt/ycb69ra
Comprendre l’audio a toujours été l’avant-garde multimodale qui reste à la traîne par rapport à la vision. Alors que les modèles image-langage ont rapidement évolué vers le déploiement en conditions réelles, créer des modèles ouverts qui raisonnent de manière robuste sur la parole, les sons ambiants et la musique — surtout sur de longues durées — est resté très difficile. NVIDIA et les chercheurs de l’Université du Maryland s’attaquent désormais directement à cette lacune.
L’équipe de recherche a publié Audio Flamingo Next (AF-Next), le modèle le plus capable de la série Audio Flamingo et un Large Audio-Language Model (LALM) entièrement ouvert, entraîné sur des données audio à l’échelle d’Internet.
Audio Flamingo Next (AF-Next) se décline en trois variantes spécialisées pour différentes utilisations. La version comprend AF-Next-Instruct pour répondre à des questions générales, AF-Next-Think pour un raisonnement avancé en plusieurs étapes, et AF-Next-Captioner pour la description audio détaillée.
Qu’est-ce qu’un Large Audio-Language Model (LALM) ?
Un Large Audio-Language Model (LALM) associe un encodeur audio à un modèle de langage à décodeur unique pour permettre la réponse à des questions, la captioning, la transcription et le raisonnement directement sur les entrées audio. Considérez-le comme l’équivalent audio d’un modèle vision-langage comme LLaVA ou GPT-4V, mais conçu pour gérer simultanément la parole, les sons ambiants et la musique — au sein d’un seul modèle unifié.
L’Architecture : Quatre composants fonctionnant en pipeline
AF-Next est construit autour de quatre composants principaux : d’abord l’encodeur audio AF-Whisper, un encodeur basé sur Whisper personnalisé pré-entraîné sur un corpus plus large et plus diversifié, incluant la parole multilingue et les données ASR multi-locuteurs. Étant donné une entrée audio, le modèle la rééchantillonne à 16 kHz mono et convertit la forme d’onde en un spectrogramme log-mel à 128 canaux en utilisant une fenêtre de 25 ms et un pas de 10 ms. Le spectrogramme est traité en blocs non chevauchants de 30 secondes via AF-Whisper, qui produit des caractéristiques à 50 Hz, après quoi une couche de pooling avec pas de 2 est appliquée. La dimension cachée est 1280.
Deuxième élément : l’adaptateur audio, un MLP à deux couches qui mappe les représentations audio d’AF-Whisper dans l’espace d’intégration du modèle de langage. Troisième élément : la colonne vertébrale du LLM : Qwen-2.5-7B, un modèle causal décodeur à 7 milliards de paramètres, 36 couches Transformer et 16 têtes d’attention, dont la longueur de contexte est étendue de 32k à 128k jetons grâce à un entraînement supplémentaire en long contexte.
Un détail architectural subtil mais important est l’utilisation de Rotary Time Embeddings (RoTE). Les encodages positionnels standard dans les transformers indexent un jeton par sa position discrète dans la séquence i. RoTE remplace cela : au lieu de l’angle de rotation RoPE standard θ ← −i · 2π, RoTE utilise θ ← −τi · 2π, où τi est l’horodatage absolu de chaque jeton. Pour les jetons audio produits à un pas fixe de 40 ms, les positions temporelles discrètes sont interpolées avant d’être introduites dans le module RoTE. Cela produit des représentations positionnelles ancrées dans le temps réel plutôt que dans l’ordre de la séquence — un choix architectural clé permettant le raisonnement temporel du modèle, en particulier pour les longs enregistrements audio. Enfin, un module TTS en streaming permet une interaction voix-à-voix.
Chaîne de pensée temporelle audio : La recette clé du raisonnement
Le déclenchement par chaîne de pensée (CoT) a amélioré le raisonnement sur les modèles de texte et de vision, mais les travaux antérieurs sur le CoT audio ont montré des gains modestes car les jeux de données d’entraînement se limitaient à de courts clips avec des questions simples. AF-Next répond à cela avec la Temporal Audio Chain-of-Thought, où le modèle ancre explicitement chaque étape de raisonnement intermédiaire à un horodatage dans l’audio avant de produire une réponse, favorisant une agrégation fidèle des preuves et réduisant l’hallucination sur les longs enregistrements.
Pour entraîner cette capacité, l’équipe de recherche a créé AF-Think-Time, un ensemble de données composé de triplets question–réponse–chaîne de réflexion triés à partir de sources audio difficiles incluant des bandes-annonces, des résumés de films, des récits mystérieux et des conversations multi-parties de longue durée. AF-Think-Time comprend environ 43k échantillons d’entraînement, avec une moyenne de 446,3 mots par chaîne de réflexion.
Formation à grande échelle : 1 million d’heures, quatre étapes
L’ensemble de données final d’entraînement comprend environ 108 millions d’échantillons et environ 1 million d’heures d’audio, tirés à la fois de jeux de données publics existants et d’audio brut collecté sur Internet et ensuite étiqueté synthétiquement. De nouvelles catégories de données introduites incluent plus de 200k longues vidéos allant de 5 à 30 minutes pour la captioning et les QA longues, des données de compréhension de parole multi-locuteurs couvrant l’identification des locuteurs, l’identification d’interruptions et le ASR de locuteur cible, environ 1 million d’échantillons pour le raisonnement multi-audio sur plusieurs entrées audio simultanées, et environ 386k échantillons de sécurité et d’instructions suivies.
La formation suit un curriculum à quatre étapes, avec des mélanges de données et des longueurs de contexte distincts. Le pré-entraînement comporte deux sous-étapes : Étape 1 entraîne uniquement l’adaptateur audio tout en maintenant AF-Whisper et le LLM gelés (audio max 30 secondes, contexte 8k jetons) ; Étape 2 affine en plus l’encodeur audio tout en gelant toujours le LLM (audio max 1 minute, contexte 8k jetons). Le milieu de l’entraînement comporte également deux sous-étapes : Étape 1 effectue un affinement complet de l’ensemble du modèle, en ajoutant AudioSkills-XL et des données nouvellement triées (audio max 10 minutes, contexte 24k jetons) ; Étape 2 introduit la captioning et le QA longue, en sous-échantillonnant le mélange de l’étape 1 à la moitié de ses poids originaux tout en élargissant le contexte à 128k jetons et l’audio à 30 minutes. Le modèle issu du milieu de l’entraînement est spécifiquement publié comme AF-Next-Captioner. Le post-entraînement applique un apprentissage par renforcement basé sur GRPO axé sur le chat multi-tours, la sécurité, le respect des instructions et certains jeux de données spécifiques aux compétences, produisant AF-Next-Instruct. Enfin, le CoT-training démarre à partir d’AF-Next-Instruct, applique SFT sur AF-Think-Time, puis GRPO en utilisant le mélange de données post-entraînement, produisant AF-Next-Think.
Une contribution notable de l’équipe de recherche est le parallélisme hybride de séquences, qui rend l’entraînement à contexte 128k possible sur de longs audios. Sans cela, l’expansion des jetons audio dépasse les fenêtres de contexte standard et le coût mémoire quadratique de l’attention devient invivable. La solution combine l’attention Ulysses — qui utilise des collectifs tout-à-tout pour distribuer les dimensions de séquence et de tête au sein des nœuds où des interconnexions à haut débit sont disponibles — avec l’attention Ring, qui fait circuler les blocs clé-valeur entre les nœuds via des transferts point à point. Ulysses gère efficacement la communication intra-nœud ; Ring s’étend à travers les nœuds.
Résultats des benchmarks : solides dans tous les domaines
Sur MMAU-v05.15.25, le benchmark le plus utilisé pour le raisonnement audio, AF-Next-Instruct obtient une précision moyenne de 74,20 contre Audio Flamingo 3 qui est de 72,42, AF-Next-Think atteint 75,01 et AF-Next-Captioner pousse à 75,76 — avec des gains dans les trois sous-catégories : son (79,87), musique (75,3) et parole (72,13). Sur le benchmark MMAU-Pro plus exigeant, AF-Next-Think (58,7) dépasse Gemini-2.5-Pro (57,4), pourtant à source fermée.
La compréhension musicale voit des gains particulièrement importants. Sur Medley-Solos-DB pour la reconnaissance des instruments, AF-Next atteint 92,13 contre Audio Flamingo 2 qui avait 85,80. Sur SongCaps pour la captioning musicale, les scores de couverture et de précision de GPT5 passent de 6,7 et 6,2 (AF3) à 8,8 et 8,9 respectivement.
La compréhension du long audio est là où AF-Next se démarque le plus clairement. Sur LongAudioBench, AF-Next-Instruct obtient 73,9, dépassant Audio Flamingo 3 (68,6) et Gemini 2.5 Pro (60,4) qui est à source fermée. Sur la variante incluant la parole (+Speech), AF-Next atteint 81,2 contre 66,2 pour Gemini 2.5 Pro. Sur ASR, AF-Next-Instruct établit de nouveaux scorements parmi les LALMs avec un taux d’erreur sur les mots (WER) de 1,54 sur LibriSpeech test-clean et 2,76 sur test-other. Sur VoiceBench, AF-Next-Instruct obtient les scores les plus élevés sur AlpacaEval (4,43), CommonEval (3,96) et OpenBookQA (80,9), dépassant Audio Flamingo 3 de plus de 14 points sur OpenBookQA. Sur CoVoST2 pour la traduction vocale, AF-Next affiche une amélioration notable de 12 points par rapport à Phi-4-mm sur la traduction arabe EN→X (21,9 contre 9,9).
Points clés
Voici 5 enseignements clés:
– Un modèle audio-langage totalement ouvert à l’échelle Internet : AF-Next est considéré comme le premier LALM à faire évoluer la compréhension audio à l’échelle Internet — environ 108 millions d’échantillons et 1 million d’heures d’audio.
– Temporal Audio Chain-of-Thought résout le raisonnement sur le long audio : Plutôt que de raisonner comme les approches CoT précédentes, AF-Next ancre explicitement chaque étape intermédiaire de raisonnement à un horodatage dans l’audio avant de produire une réponse. Cela rend le modèle significativement plus fidèle et interprétable sur les longs enregistrements jusqu’à 30 minutes — un problème que les modèles antérieurs évitaient largement.
– Trois variantes spécialisées pour différents cas d’utilisation : La version comprend AF-Next-Instruct pour les questions générales, AF-Next-Think pour un raisonnement avancé en plusieurs étapes, et AF-Next-Captioner pour la captioning audio détaillée — permettant aux praticiens de choisir le bon modèle en fonction de leur tâche plutôt que d’utiliser un seul point de contrôle unique.
– Devance les modèles fermés sur les longs audios malgré sa plus petite taille : Sur LongAudioBench, AF-Next-Instruct obtient 73,9 — dépassant Gemini 2.5 Pro (60,4) et Audio Flamingo 3 (68,6). Sur la variante incluant la parole, l’écart se creuse davantage, AF-Next atteignant 81,2 contre 66,2 pour Gemini 2.5 Pro.
Consultez le papier, la page du projet et les poids du modèle.
Aussi, n’hésitez pas à nous suivre sur Twitter et ne manquez pas de rejoindre notre communauté ML SubReddit et de vous abonner à notre Newsletter. Et vous, vous êtes sur Telegram ? Vous pouvez désormais nous rejoindre sur Telegram.
Besoin de vous associer avec nous pour promouvoir votre repository GitHub OU votre page Hugging Face OU votre lancement de produit OU un webinaire, etc. ? Connectez-vous avec nous.
L’article NVIDIA and the University of Maryland Researchers Released Audio Flamingo Next (AF-Next): A Super Powerful and Open Large Audio-Language Model est apparu en premier sur MarkTechPost.
HI-FI News
via MarkTechPost https://ift.tt/79ol438
14 avril 2026 à 10:27, heure française.
April 14, 2026 at 10:27AM
-
Product on sale
Audiophile Vinyl Records Cleaning BundleOriginal price was: €69.90.€59.90Current price is: €59.90. excl. VAT -
Product on sale
Easy Start Vinyl Records Cleaning KitOriginal price was: €69.90.€59.90Current price is: €59.90. excl. VAT -
Vinyl Records Cleaner Easy Groove Concentrate€34.95 excl. VAT -
Easy Groove Super Set€199.00 excl. VAT -
Easy Groove Enzycaster – vinyl records prewash cleaner€34.95 excl. VAT -
Easy Groove Extreme MK. II- vinyl records prewash cleaner€45.00 excl. VAT -
Vinyl Records Cleaner – Easy Groove Virgin Concentrate€35.00 excl. VAT -
Easy Groove Spray&Wipe vinyl records cleaner€34.95 excl. VAT








