GPTProto

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

HuggingFace Daily Papers(社区热门论文)·Apr 13, 2026, 8:00 AM·Research Papers

Audio Flamingo 系列发布下一代模型 AF-Next,支持长达 30 分钟的复杂音频输入,并引入 Temporal Audio Chain-of-Thought 技术,将中间推理步骤显式对应到时间戳。该模型基于超过 100 万小时的新增数据进行课程式训练,在 20 个音频理解与推理基准测试中显著超越同规模开源模型,部分指标超过更大规模的闭源模型。团队同步开源了 AF-Next-Instruct、AF-Next-Think 和 AF-Next-Captioner 三个变体。