---
格式版本: 2
标题: "FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation"
原文链接: "https://arxiv.org/abs/2608.24168"
发布日期: "2026-08-25"
发布时间校准状态: "found"
发布时间需复核: "否"
发布时间来源: "rule:local:strict_original_body"
发布时间证据: "**\\[v1\\]** Tue, 25 Aug 2026 07:37:15 UTC (417 KB)"
发布时间校准原因: "规则确认唯一严格发布时间，来源 local:strict_original_body"
发布时间校准置信度: "high"
发布时间候选数量: 18
发布时间严格候选数量: 6
发布时间原页读取状态: "source template page reused from URL open"
发布时间未找到原因: ""
发布时间校准时间: "2026-08-26T21:54:03+08:00"
发布时间仲裁状态: "skipped"
发布时间仲裁尝试次数: 0
发布时间仲裁耗时毫秒: 0
发现时间: "2026-08-26T21:50:39+08:00"
入库时间: "2026-08-26T13:54:03.904Z"
来源平台: "arXiv 学术论文搜索"
搜索渠道: "source_template"
搜索词: "https://arxiv.org/search/?query=Scale-up&searchtype=all"
匹配关键词:
  - "Scale-up"
  - "performance"
相关厂家:
  []
相关专家:
  []
内容类型: "网页"
抓取工具: "Free Fetch + Defuddle"
清洗工具: "Defuddle Markdown + Defuddle/Readability 正文提取"
原始附件:
  []
AI优质: "否"
AI打分: 24
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "正文主线是9B参数通用音频语言模型及语音理解、合成和编辑，不涉及超节点、AI Rack、机柜级互连、供电、散热或RAS。当前页面为可追溯的arXiv预印本摘要，披露解耦连续表示、Audio Encoder、RedAE和flow-matching DiT等模型机制，但缺少完整论文工程数据。固定知识库未发现同一成果，然而未命中不能证明首次出现，且其新增事实属于模型能力而非机架级基础设施。无客户、量产或部署信号，命中“应用与模型效率/单一模型”硬否决项，不具备业务准入通道。"
AI质检模型: "gpt-5.6-sol"
AI质检时间: "2026-08-26T21:54:15+08:00"
AI主题相关性: 0
AI来源权威性: 11
AI新颖性: 4
AI技术细节: 2
AI商业部署信号: 0
AI完整性: 7
AI评分提示词版本: "v17-精简生产版"
AI评分提示词SHA256: "48fb9777f386026761b4873eaff30807694fb11e9b352d7c69bf2dfde750cc7d"
AI评分知识库版本: "knowledge_base_v1-20260819+runtime.3"
AI评分知识库SHA256: "dbc02c7552b478ae5aae514533e58a5de9ce72d2911e4aaac0f744c08178e4a6"
AI评分知识库检索词: "[\"Scale-up\",\"NPU\",\"PDF\",\"arxiv.org/pdf/2608.24168\",\"HTML\",\"arxiv.org/html/2608.24168v1\",\"LLM\",\"ASR\",\"TTS\",\"URL\",\"arxiv.org/abs/2608.24168\",\"arxiv.org/abs/2608.24168v1\"]"
AI评分知识库命中: "[{\"id\":\"july-correct-0111\",\"title\":\"StrataCL: Fabric-Native Communication Library for Production Supernodes\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"NPU\",\"PDF\",\"HTML\",\"LLM\",\"URL\"],\"rank\":-14.59980320572075},{\"id\":\"july-correct-0088\",\"title\":\"StrataCL: Fabric-Native Communication Library for Production Supernodes - 智源社区论文\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"NPU\",\"HTML\",\"LLM\",\"URL\"],\"rank\":-11.133568299840173},{\"id\":\"july-correct-0131\",\"title\":\"DeepSeek-V4如何在昇腾超节点高效完成全参数后训练？SLAI T-Rex技术报告解读\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"NPU\",\"PDF\",\"HTML\",\"LLM\"],\"rank\":-10.395392830501786},{\"id\":\"july-correct-0029\",\"title\":\"昇腾950超节点真机亮相2026世界人工智能大会\",\"sourceType\":\"labeled_article\",\"time\":\"2026-07\",\"matchedTerms\":[\"NPU\",\"HTML\",\"URL\"],\"rank\":-7.509385313756824},{\"id\":\"historical-jun-010\",\"title\":\"爱建证券-电子行业专题报告：Vera Rubin量产提速，RTX Spark打开终端AI新空间-260608.pdf\",\"sourceType\":\"curated_item\",\"time\":\"2026-06\",\"matchedTerms\":[\"PDF\"],\"rank\":-6.792800214723912}]"
AI摘要: "研究团队提出通用音频语言模型 FireRedAudio，以共享 9B 参数大语言模型为基础，采用分离的连续输入表征统一音频理解与生成，支持长达一小时的音频理解、多语种 ASR、零样本 TTS 和语音编辑，评测表现领先或持平，并已开源代码。"
AI摘要模型: "ali-deepseek-v4-flash"
AI摘要时间: "2026-08-27T08:12:46.660Z"
采集批次: "2026年8月26日20点37分07秒"
采集批次ID: "20260826-203707-934"
去重键: "https://arxiv.org/abs/2608.24168"
---

## Computer Science > Computation and Language

## Title:FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

Authors:[Junjie Li](https://arxiv.org/search/cs?searchtype=author&query=Li,+J), [Xuelong Geng](https://arxiv.org/search/cs?searchtype=author&query=Geng,+X), [Kun Xie](https://arxiv.org/search/cs?searchtype=author&query=Xie,+K), [Feiyu Shen](https://arxiv.org/search/cs?searchtype=author&query=Shen,+F), [Yichen Wu](https://arxiv.org/search/cs?searchtype=author&query=Wu,+Y), [Ziqi Dai](https://arxiv.org/search/cs?searchtype=author&query=Dai,+Z), [Yichen Han](https://arxiv.org/search/cs?searchtype=author&query=Han,+Y), [Yan Jia](https://arxiv.org/search/cs?searchtype=author&query=Jia,+Y), [Kai Huang](https://arxiv.org/search/cs?searchtype=author&query=Huang,+K), [Junjie Chen](https://arxiv.org/search/cs?searchtype=author&query=Chen,+J), [Yixuan Li](https://arxiv.org/search/cs?searchtype=author&query=Li,+Y), [Manzhen Wei](https://arxiv.org/search/cs?searchtype=author&query=Wei,+M), [Fenglong Xie](https://arxiv.org/search/cs?searchtype=author&query=Xie,+F), [Lei Xie](https://arxiv.org/search/cs?searchtype=author&query=Xie,+L), [Xu Tang](https://arxiv.org/search/cs?searchtype=author&query=Tang,+X), [Yao Hu](https://arxiv.org/search/cs?searchtype=author&query=Hu,+Y)

[View PDF](https://arxiv.org/pdf/2608.24168) [HTML (experimental)](https://arxiv.org/html/2608.24168v1)

> Abstract:A unified audio model must recognize and understand linguistic, paralinguistic, and environmental information while supporting speech synthesis and editing. A key challenge is representation: understanding favors compact features suited to long-context modeling, whereas speech generation requires reconstructible features that preserve fine-grained acoustic detail. We introduce FireRedAudio, a general-purpose audio language model with a shared 9B-parameter LLM. To the best of our knowledge, it is the first publicly disclosed unified audio-language model to provide separate continuous input representations for understanding and generation within a single trainable autoregressive LLM. Audio to be recognized or analyzed is processed by a dedicated Audio Encoder, while speech inputs for generation use a RedAE-based pathway. The LLM directly generates text or conditions a flow-matching DiT to produce continuous acoustic latents. Through progressive multitask training, FireRedAudio supports ASR and audio understanding, with the latter extending to recordings of up to one hour, as well as zero-shot TTS, Instruct TTS, and semantic and acoustic speech editing. Its structured organization of long-form audio achieves second-level timestamp accuracy. Across comprehensive evaluations, FireRedAudio achieves competitive or leading performance in audio understanding and multilingual ASR, strong content accuracy and speaker preservation in zero-shot TTS, leading instruction following in Instruct TTS, and substantial improvements over Ming-UniAudio-Edit in both semantic and acoustic speech editing. These results demonstrate the viability of decoupled continuous input representations for unifying audio understanding and continuous-latent speech generation in a model of moderate scale. Our code is available at [this https URL](https://github.com/FireRedTeam/FireRedAudio).

| Comments: |  |
| --- | --- |
| Subjects: | Computation and Language (cs.CL); Sound (cs.SD) |
| Cite as: | [arXiv:2608.24168](https://arxiv.org/abs/2608.24168) \[cs.CL\] |
|  | (or [arXiv:2608.24168v1](https://arxiv.org/abs/2608.24168v1) \[cs.CL\] for this version) |
|  | [https://doi.org/10.48550/arXiv.2608.24168](https://doi.org/10.48550/arXiv.2608.24168) |

## Submission history

From: Junjie Li \[[view email](https://arxiv.org/show-email/ff8708c7/2608.24168)\]  
**\[v1\]** Tue, 25 Aug 2026 07:37:15 UTC (417 KB)

[Which authors of this paper are endorsers?](https://arxiv.org/auth/show-endorsers/2608.24168) | Disable MathJax ([What is MathJax?](https://info.arxiv.org/help/mathjax.html))
