本文译自 Qwen 团队的 Qwen3.5-Omni Technical Report1,2026 年 4 月 17 日提交于 arXiv、4 月 21 日更新到 v2,28 页 3 图 15 表。译文依据 v2——v1 与 v2 在正文上有实质差异,文本与视觉评测的对照基线从 Qwen3.5-Plus-NoThinking 换成了 Qwen3.5-Plus-Instruct。覆盖 §1 引言、§2 架构、§3 预训练、§4 后训练、§5 评测、§6 结论与 §8 附录;§7 作者名单和参考文献不在译文范围内。

附录 §8.1 的三张多语种大表,原文各覆盖近 60 个语种,这里只保留正文点名讨论的语种和 Average 行,完整数据请回原文查。

这项工作里我们提出 Qwen3.5-Omni,Qwen-Omni 模型家族的最新进展。相比前代有显著演进,Qwen3.5-Omni 把参数规模扩到数千亿,支持 256k 上下文长度。借助一个由异构文本-视觉对和超过 1 亿小时视听内容组成的海量数据集,模型展现出稳健的全模态能力。Qwen3.5-Omni-Plus 在 215 项音频与视听理解、推理、交互子任务与 benchmark 上取得 SOTA,在关键音频任务上超过 Gemini-3.1 Pro,在综合视听理解上与之持平。架构上,Qwen3.5-Omni 在 Thinker 和 Talker 两端都采用 Hybrid Attention Mixture-of-Experts(MoE)框架,使长序列推理更高效。模型支持复杂的交互形态,可处理超过 10 小时的音频理解和 400 秒的 720P 视频(1 FPS)。为解决流式语音合成中固有的不稳定与不自然——它们往往源自文本 tokenizer 与语音 tokenizer 之间的编码效率差异——我们提出 ARIA(Adaptive Rate Interleave Alignment,自适应速率交织对齐)。ARIA 动态对齐文本单元与语音单元,在时延影响极小的前提下显著提升对话语音的稳定性与韵律。此外,Qwen3.5-Omni 拓展了语言边界,支持 10 种语言的多语种理解与语音生成,带有接近人类的情感层次。除预设音色外,模型还支持用用户提供的样本做 zero-shot 音色定制。最后,Qwen3.5-Omni 表现出出色的视听 grounding 能力,能生成剧本级的结构化字幕,带精确的时间同步和自动场景切分。值得注意的是,我们观察到全模态模型上涌现出一种新能力:直接依据视听指令写代码,我们称之为 Audio-Visual Vibe Coding。Qwen3.5-Omni 已通过 API 公开可用2

译注:摘要说语音生成覆盖「10 种语言」,与全文其他地方对不上——§1 说合成侧覆盖 36 种,Table 3 记 Speech Output 为 36 个变体(29 种语言加 7 种汉语方言),§5.2.2 也写的是 29 种语言。摘要这个数字疑为笔误。

Qwen3.5-Omni 的两个产品形态:左侧 Qwen3.5-Omni-Plus 主打 SOTA 性能、细粒度视听描述、原生多模态与广泛多语种;右侧 Qwen3.5-Omni-Plus-Realtime 主打语音控制、WebSearch 工具、音色克隆与语义打断
Qwen3.5-Omni 的两个产品形态:左侧 Qwen3.5-Omni-Plus 主打 SOTA 性能、细粒度视听描述、原生多模态与广泛多语种;右侧 Qwen3.5-Omni-Plus-Realtime 主打语音控制、WebSearch 工具、音色克隆与语义打断

图 1:Qwen3.5-Omni 是一个统一的端到端模型,能处理文本、音频、图像、视频等多种模态,并生成实时的文本或语音响应。基于这些特性,Qwen3.5-Omni 支持广泛的任务,包括但不限于语音对话、视频对话和视听工具调用。

1 引言

人与世界的交互天然是全模态且 agentic 的:它要整合视觉、听觉与语言信息,并通过文本、语音以及目标导向的、以工具为中介的动作产出响应,从而与其他生命体交换信息、展现智能。随着大模型在文本、视觉和音频上的理解与推理能力快速进步,原生全模态系统——能跨所有模态联合处理与生成的系统——已经吸引了大量关注。然而现有模型大多仍停留在被动的感知-响应范式里,在可扩展的 agentic 行为、实时交互、自主工具使用和跨模态推理上能力有限,而这些恰恰是实际部署的必要前提。

本报告介绍 Qwen3.5-Omni,Qwen 最新一代的全模态 LLM,支持文本、图像、音频和视听内容的理解。它以全模态的方式在海量文本、视觉数据和超过 1 亿小时的视听数据上做原生预训练,被设计成一个原生的 omni agent 模型:它不只跨所有模态感知与推理,还会行动——自主调用 WebSearch、执行复杂的 FunctionCall、生成语音输出,并参与实时流式交互。模型系列包含 Plus 和 Flash 两个变体,全部是 instruct 模型,支持 256k token 的长上下文输入。

Qwen3.5-Omni 建立在 Qwen2.5-Omni3 提出的 Thinker–Talker 架构之上,相比 Qwen3-Omni4 引入了五项关键技术升级:(1)Thinker 和 Talker 都采用 Hybrid-Attention Mixture-of-Experts(MoE)设计,使推理高度高效;(2)支持最长 256k token 的长上下文建模,可处理超过 10 小时的音频、以及 1 FPS 下超过 400 秒的 720P 视听内容;(3)语音生成侧采用多码本 codec 表示,实现单帧即时合成;(4)Talker 引入 ARIA,在流式解码过程中动态对齐文本单元与语音单元,显著改善自然度与鲁棒性;(5)多语种训练大幅扩展,语音识别覆盖 113 种语言和方言,语音合成覆盖 36 种。

得益于这些技术进展,Qwen3.5-Omni 相比 Qwen3-Omni 带来三项主要的新能力:(1)可控的视听描述(audio-visual captioning),能生成可控、细致、结构化的字幕,以及剧本级的细粒度描述,包括自动切分、时间戳标注,以及对角色及其与音频之关系的细致刻画;(2)全面的实时交互,涵盖基于原生轮次意图识别的语义打断、对音量/语速/情绪的端到端语音控制,以及从用户提供的样本做音色克隆;(3)原生的全模态 agentic 行为,包括自主 WebSearch、复杂的 FunctionCall 调用,以及 Audio-Visual Vibe Coding——一种涌现能力,模型直接从视听指令生成可执行代码,从而无需外部编排就能响应实时查询。

关键在于,Qwen3.5-Omni 在文本和视觉模态上保持了 SOTA 水平,相对同尺寸的单模型 Qwen 对应版本没有退化。在覆盖视听 benchmark、音频 benchmark、ASR benchmark、分语种的语音到文本翻译任务和分语种的 ASR 任务在内的 215 项音频与视听理解、推理、交互子任务和 benchmark 上,Qwen3.5-Omni-Plus 取得 SOTA 结果,在通用音频理解、推理、识别、翻译和对话上超过 Gemini-3.1 Pro,整体视听理解则达到 Gemini-3.1 Pro 的水平。

2 架构

Qwen3.5-Omni 总览:底部视频帧与音频波形沿时间轴分别经 Vision Encoder 和 AuT 编码,与「0.0 seconds」一类时间戳的文本 token 交织后送入 Hybrid MoE Thinker;从 Thinker 中间层抽取的隐状态送入 Hybrid MoE Talker,MTP 模块补出当前帧的残差码本,再由流式 codec decoder 逐帧合成波形
Qwen3.5-Omni 总览:底部视频帧与音频波形沿时间轴分别经 Vision Encoder 和 AuT 编码,与「0.0 seconds」一类时间戳的文本 token 交织后送入 Hybrid MoE Thinker;从 Thinker 中间层抽取的隐状态送入 Hybrid MoE Talker,MTP 模块补出当前帧的残差码本,再由流式 codec decoder 逐帧合成波形

图 2:Qwen3.5-Omni 总览。Qwen3.5-Omni 采用 Thinker-Talker 架构。Thinker 负责文本生成,Talker 则直接接收来自 Thinker 的高层表示,专注于生成流式语音 token。为实现超低时延的流式输出,Talker 自回归地预测一个多码本序列:在每个解码步,MTP 模块输出当前帧的残差码本,随后 Code2Wav 渲染器增量地合成对应波形,从而实现逐帧的流式生成。

2.1 总览

如图 2 所示,Qwen3.5-Omni 继续采用 Thinker-Talker 架构3。相比 Qwen3-Omni4,Qwen3.5-Omni 在可扩展性、对齐和实时交互上引入了几项关键改进:

  • 整体主干采用 Hybrid Mixture-of-Experts(MoE)设计,在提升可扩展性的同时,更好地平衡了多模态理解与生成之间的容量和效率。
  • Thinker 分别通过 Vision Encoder 和 AuT 接收视觉与音频信号。音频和视频输入被交织起来做统一的多模态建模,并插入显式时间戳以改善时间感知,长视频或音视频上下文下尤其如此。这一设计让 Thinker 能处理超长输入,支持最多 256k token、10 小时音频,或 1 FPS 下 400 秒的 720P 视频。
  • Talker 负责带上下文的语音生成,条件既包括多模态输入,也包括 Thinker 的文本输出。Qwen3.5-Omni 沿用 Qwen3-Omni4 提出的基于 RVQ 的语音表示,大幅提升了推理效率。
  • 为支持实时交互,Qwen3.5-Omni 在 Thinker 侧采用分块的流式输入处理,在 Talker 侧采用流式设计,实现低时延的端到端多模态对话。
  • 与 Qwen3-Omni4 的双轨 Talker 输入设计不同,Qwen3.5-Omni 的 Talker 采用 ARIA,在交织之前先动态对齐文本单元与语音单元。这一设计缓解了文本与语音之间 tokenization 速率不匹配所导致的不稳定,从而减少漏词、发音错误、数字念读含混一类问题。

接下来的几节里,我们先介绍 AuT encoder 及其训练方法,然后描述 Thinker 如何处理各类输入,接着详述 Talker 的多码本流式语音生成,最后重点说明理解与生成两个模块上为实现超低时延、端到端流式音频推理所做的一系列改进。

2.2 Audio Transformer(AuT)

AuT 结构:波形先转成 10ms 帧移的 FBank 特征,经 AuT Encoder(4× 下采样 Conv2d 加 32× 自注意力层)得到 6.25Hz 的 AuT Hidden,再由 8× 的 AuT Decoder(自注意力加交叉注意力)解码出文本
AuT 结构:波形先转成 10ms 帧移的 FBank 特征,经 AuT Encoder(4× 下采样 Conv2d 加 32× 自注意力层)得到 6.25Hz 的 AuT Hidden,再由 8× 的 AuT Decoder(自注意力加交叉注意力)解码出文本

图 3:AuT 总览。AuT encoder 消耗了 4000 万小时的有监督数据、尤其是更多的多语种数据,在 6.25Hz 上获得了更强的通用音频表示。

我们使用一个从零训练的、基于 transformer 的音频 encoder,置于 attention-encoder-decoder 模型 AuT 中,如图 3 所示。Qwen3.5-Omni encoder 的训练消耗了 4000 万小时由 Qwen3-ASR 生成的音频-文本配对数据。音频的 filter bank 特征先用 4 个 Conv2D 块做 16 倍下采样,再送入自注意力层,得到 6.25Hz token 率的音频 token。相比 Qwen3-Omni encoder 的训练过程,Qwen3.5-Omni 的 encoder 适配了超过 20 种语言的更多多语种数据,中文、英文与多语种数据的比例达到 3.5 : 3.5 : 3。训练中采用了动态注意力窗口大小机制,以保证模型在实时 prefill 缓存下的推理与离线音频理解任务之间取得均衡的表现。

2.3 感知

文本、音频、图像与视频(不含音频)。Thinker 把文本、音频、图像和无声视频输入转换成统一的表示序列。文本方面我们使用 Qwen3.5 tokenizer5,它采用 byte-level byte-pair encoding,词表大小 250k(此前是 150k),在多数语言上把编解码效率提升了 10–60%。音频输入(包括从视频里抽出的音频)方面,我们把波形重采样到 16 kHz,用 25 ms 窗长、10 ms 帧移转换成 128 通道的梅尔频谱。我们用 AuT 作为音频 encoder,它在 4000 万小时音频数据上从零训练,每个输出帧大致对应原始信号的 160 ms。视觉输入方面,我们采用 Qwen3.55 的 vision encoder 来处理图像和视频。该 encoder 在图像与视频的混合数据上训练,在图像理解和视频理解两方面都有很强的能力。为了在尽可能保留视频信息的同时维持与音频流的对齐,我们以动态帧率采样视频帧。

视听时间戳。沿用 Qwen3-Omni4,我们应用 TM-RoPE 来赋予模型音视频同步所需的时间感知。但我们发现,通过时间位置 ID 直接编码绝对时间,会让长视频加音频输入中的视觉 patch 拿到过于稀疏的索引,从而削弱长程时间建模。此外,这样的设计往往要求训练样本在不同帧率上大规模且均匀分布,抬高了数据构造成本。为解决这些问题,我们在每个视频或音视频时间 patch 前面加上一个显式时间戳,以「秒」为单位表示成格式化的文本字符串,让模型更自然地学到时间码表示。对于音频序列,我们进一步以随机间隔插入时间戳,以改善跨模态的时间对齐。这个策略虽然略微增加了上下文长度,但它带来了更精确、更鲁棒的时间感知,在长上下文多模态输入上做外推时尤其明显。

在多模态视听流的场景下,音频部分每 160 ms 编码一个时间 ID。视频被当作一串帧来处理,其时间 ID 单调递增,并依据各帧的实际时间戳动态调整,以确保每个 ID 对应 160 ms 这一一致的时间分辨率。视频帧的高度 ID 和宽度 ID 与静态图像采用同样的分配方式。为了避免处理多种模态时产生位置冲突,位置编号被做成连续的:后一个模态从前一个模态的最大位置 ID 加一开始。这套精细化的位置编码方式,使模型能有效整合并联合建模来自不同模态的信息。Qwen3.5-Omni 用这些时间 ID 来对齐各模态的表示,而时间 ID 又显式锚定在绝对时间上。这一设计选择让模型能够灵活支持任意时长的流式输入。

2.4 语音生成

Talker 直接在 Qwen3.5-Omni-Audio-Tokenizer 产出的 RVQ token 上工作。为了建模残差码本,它使用一个 multi-token prediction(MTP) 模块,从而能对声学细节做细粒度的建模与控制。再配上一个用于波形重建的因果 ConvNet,Talker 能以低推理时延和不高的计算开销给出高保真的语音合成。

在多轮口语对话中,Talker 的条件是 Thinker 提供的丰富上下文信息,包括历史文本 token、多模态表示,以及当前轮流式产出的文本。这样的条件化让 Talker 能依据不断演进的对话上下文,动态调节韵律、响度、情绪等声学属性。

架构上,我们的做法与 Qwen3-Omni4 有两处关键区别。第一,我们为 Talker 引入了一个专门的 system prompt 来指定目标音色特征,从而同时支持 zero-shot 音色克隆和可控语音生成。相比传统的 speaker embedding,这个 prompt 能编码更丰富的多模态线索,包括文本描述和 codec 序列,对声学实现提供了细得多的控制。第二,我们提出 ARIA(Adaptive Rate Interleave Alignment),它把传统的双通道生成范式统一成单通道形式。ARIA 不依赖 MFA 导出的对齐、也不依赖固定的交织速率,而是施加一条自适应速率约束:对生成序列的任意前缀,累计的语音-文本 token 比例都不得超过该条目层面的全局比例。设计虽简单,却让文本-语音对齐能灵活适配各种语言,包括那些编码效率相对较低的语言,并且天然支持「任意文本 token 前缀加连贯的语音 token 续写」这种形式。

2.5 面向流式与并发的设计

在流式视听交互场景里,首包时延是影响用户体验的关键因素,而模型的并发能力则是降低服务成本、提升响应速度的关键。本节讨论 Qwen3.5-Omni 如何通过算法与架构上的优化来提升并发、降低首包时延。表 1 概览了 Qwen3.5-Omni 的相关架构及其对应的时延。

表 1:Qwen3.5-Omni 的架构,以及音频/视频设定下的端到端首包时延(ms)。

模块 架构 是否流式
Audio Encoder AuT
Vision Encoder SigLIP2
Thinker Hybrid MoE Transformer
Talker Hybrid MoE Transformer
MTP Dense Transformer
Code2wav ConvNet
首包时延(音频输入) Plus: 435ms Flash: 235ms
首包时延(视频输入) Plus: 651ms Flash: 426ms

分块 prefill 与 Hybrid MoE 架构。在 Qwen3.5-Omni 中,我们保留了 Qwen3-Omni 和 Qwen2.5-Omni 里实现的 chunked-prefilling 机制,其音频和视觉 encoder 都能沿时间维度按块输出。这一做法显著降低了 Thinker 和 Talker 的 Time-To-First-Token(TTFT)。架构上,Qwen3.5-Omni 的 Thinker 和 Talker 都构建在 Qwen3.5 引入的 Hybrid MoE 架构之上。除了 Hybrid MoE 本身的通用效率优势之外,这套架构还包含 Gated Delta Net(GDN) 模块,它对加速长音视频序列的建模格外有效。因此它显著降低了长上下文推理中的 KV cache I/O 开销,提升了生成吞吐,也让服务端能承载更高的并发。

用 ARIA 做流式生成。在流式语音生成和高并发服务上,Qwen3.5-Omni 大体沿用了 Qwen3-Omni 的高效设计:Talker 用一个轻量的 MTP 模块预测 RVQ codec token,生成的多码本 token 再由一个因果且流式的 ConvNet codec decoder 转换成波形。这些组件计算开销小、对 batch 友好,很适合低时延部署。在这一共同基础之上,前面介绍过的 ARIA 进一步把 Qwen3-Omni 的双通道生成模式重构成文本与语音 token 之上统一的、交织的单流形式。通过把文本生成与语音生成组织在一条单调交织约束之下,ARIA 减少了两条独立生成轨道之间的同步开销,让解码期间的 token 调度更高效,也更契合流式交互天然增量的工作方式。

表 2 里我们报告了 Qwen3.5-Omni 在不同并发级别、音频与视频输入下的理论首包时延,评测在内部 vLLM 上进行,MTP 模块和 codec decoder 启用了 torch.compile 和 CUDA Graph 加速。这里,Thinker TTFT(Time-To-First-Token)指从接收输入流到 Thinker 生成第一个文本 token 的时间;Talker TTFC(Time-To-First-Chunk)度量的是直到 Talker 产出第一个音频块的时间。TPOP(Time-Per-Output-Token)表示稳态解码期间每个输出 token 的时延,其中 Talker TPOP 包含了 Talker 主干与 MTP 模块的合计时延。TPS(Tokens Per Second)表示生成吞吐。由于 ARIA 把文本生成和语音生成组织在一条统一的交织流里,Overall Latency 并不能靠把几行的值简单相加得到,它反映的是到第一个可播放音频包为止的端到端关键路径。我们也要说明,由于 Qwen3.5-Omni-Flash 和 Qwen3.5-Omni-Plus 之间规模差距很大,两个变体在部署时采用了不同的资源分配与并行策略,因此它们的时延和吞吐数字并不适合严格横向比较。如表所示,随着并发上升,Qwen3.5-Omni 的时延和解码效率保持稳定,而较低的 Generation RTF 为流畅的流式音频生成留出了充足余量。

表 2:Qwen3.5-Omni 在不同并发级别下的理论首包时延。A/V 表示音频/视频输入。

Qwen3.5-Omni-Flash Qwen3.5-Omni-Plus
1 并发 4 并发 8 并发 1 并发 4 并发 8 并发
Thinker TTFT 80/255ms 86/446ms 103/765ms 162/377ms 183/907ms 260/1243ms
Talker TTFC 56/61ms 68/108ms 81/116ms 54/56ms 72/88ms 95/116ms
Thinker TPOP 5.6/5.9ms 8.2/9.2ms 9.6/15.8ms 17.4/18.5ms 25.6/26.9ms 33.3/40.2ms
Talker TPOP 14.2/14.2ms 16.9/17.0ms 20.5/20.6ms 14.9/14.9ms 21.0/21.3ms 25.8/27.1ms
Codec Decode 3~5ms
Overall Latency 235/426ms 298/891ms 352/1625ms 435/651ms 619/1515ms 955/1980ms
Thinker TPS 177/171 556/457 942/598 57/54 156/149 266/240
Talker TPS 70/70 237/235 389/388 67/67 191/189 320/296
Generation RTF 0.178 0.211 0.257 0.187 0.267 0.334

3 预训练

表 3:Qwen3.5-Omni-Plus 支持的语言与方言。

模态 变体数 支持的语言与方言
Text 201 完整的支持语言列表见 Qwen3.5。
Speech Input 113 74 种语言:Afrikaans、Arabic、Asturian、Azerbaijani、Basque、Belarusian、Bengali、Bosnian、Bulgarian、Cantonese、Catalan、Cebuano、Chinese、Croatian、Czech、Danish、Dutch、English、Esperanto、Estonian、Filipino、Finnish、French、Galician、Georgian、German、Greek、Hebrew、Hindi、Hungarian、Icelandic、Indonesian、Interlingua、Italian、Japanese、Javanese、Kannada、Kazakh、Korean、Kyrgyz、Lingala、Latvian、Lithuanian、Macedonian、Malay、Malayalam、Maltese、Maori、Marathi、Mongolian、Norwegian Bokmål、Norwegian Nynorsk、Oriya、Persian、Polish、Portuguese、Punjabi、Romanian、Russian、Serbian、Slovak、Slovenian、Spanish、Swahili、Swedish、Tajiki、Tamil、Telugu、Thai、Turkish、Ukrainian、Urdu、Uyghur、Vietnamese。 39 种汉语方言:东北官话、贵州话、广东粤语、河南话、香港粤语、上海话、陕西话、天津话、台湾国语、云南话、安徽话、福建话、甘肃话、广东官话、湖北话、湖南话、江西话、山东话、山西话、四川话、广西话、海南话、重庆话、长沙话、杭州话、合肥话、银川话、郑州话、沈阳话、温州话、武汉话、昆明话、太原话、南昌话、济南话、兰州话、南京话、客家话、闽南话。
Speech Output 36 29 种语言:Chinese、English、German、Italian、Portuguese、Spanish、Japanese、Korean、French、Russian、Thai、Indonesian、Arabic、Vietnamese、Turkish、Finnish、Polish、Hindi、Dutch、Czech、Urdu、Tagalog、Swedish、Danish、Hebrew、Icelandic、Malay、Norwegian、Persian。 7 种汉语方言:四川话、北京话、天津话、南京话、陕西话、粤语、闽南话。

Qwen3.5-Omni 在一个多样化的数据集上做预训练,覆盖表 3 所示的多种语言和方言,以及多种模态,包括图像-文本、视频-文本、音频-文本、视频-音频、视频-音频-文本和纯文本语料。沿用 Qwen3-Omni4 的做法,我们使用范围更广的自然语言 prompt,以增强泛化能力和指令跟随能力。为了在所有模态上都取得稳健的表现,我们的训练策略从预训练早期就同时纳入单模态和跨模态数据。

在 Qwen3-Omni4 中我们使用 TMRoPE 来赋予模型时间感知。但我们发现这套做法有两个关键局限:(1)把时间位置 ID 直接绑定到绝对时间,会让长音视频或长视频输入产生过大且稀疏的时间位置 ID,损害模型捕捉长程时间上下文的能力。(2)在这套方案下要学得有效,通常需要在不同帧率(fps)上做大规模且均匀分布的采样,显著抬高训练数据的构造成本。为解决这些问题,我们在每个视频或音视频时间 patch 前面加上一个以「秒」为单位、表示成格式化文本字符串的时间戳,让模型更好地学习和解读时间码表示。此外,对于音频序列,我们以随机间隔插入时间戳,以更好地对齐不同模态之间的训练。这个做法虽然让上下文长度略有增加,但它让模型能更有效、更精确地感知时间信息。

Qwen3.5-Omni 的预训练分成三个明确的阶段。第一阶段我们锁住 LLM 参数,专注训练视觉和音频 encoder,用海量的音频-文本对和图像-文本对语料来增强 LLM 内部的语义理解。第二阶段我们解冻全部参数,用范围更广的多模态数据在 32,768 的序列长度下做更全面的学习。最后一个阶段我们使用序列长度 262,144 的数据,来增强模型理解复杂长序列数据的能力:

  1. Encoder 对齐阶段(S1):在最初的预训练阶段,Qwen3.5-Omni 的 LLM 部分用 Qwen3.5 的参数初始化,vision encoder 取自 Qwen3.5,audio encoder 用 AuT 初始化。两个 encoder 在固定的 LLM 上分别训练,都是先训各自的 adapter,再训 encoder 本身。
  2. 通用阶段(S2):预训练的第二个阶段使用一个约 4 万亿 token 的大规模数据集,各模态的分布为:文本 0.92 万亿、音频 1.99 万亿、图像 0.95 万亿、视频 0.14 万亿、视频-音频 0.29 万亿。这一阶段引入更多样的多模态数据和任务,增强了模型在听觉、视觉、文本与视听信息上的理解与交互能力。
  3. 长上下文阶段(S3):在预训练的最后一个阶段,我们把最大 token 长度从 32,768 提高到 262,144,同时提高训练数据中长音频和长视频的比例。实验结果表明,这些调整让模型理解长序列数据的能力有显著提升。

4 后训练

4.1 Thinker

后训练阶段对 Thinker 采用三阶段策略,目标是保持模型在所有模态上的能力不退化、确保音频查询下的响应质量、并优化整体交互体验。训练语料按 ChatML6 格式组织,涵盖纯文本、视觉、音频以及混合模态的对话数据。具体而言,整个过程包含以下几个阶段:

  • Stage 1:专家蒸馏(Specialist Distillation)。为了给全模态能力打下坚实基础,我们先通过独立的 监督微调(SFT)和强化学习(RL),训练出一组按领域特化的 teacher 模型。所有 teacher 模型都从预训练的 Qwen-3.5 base checkpoint 微调而来。除了文本相关任务(包括 agentic、coding 和基础推理任务)之外,我们也为视觉和音频训练了专门的 teacher 模型。这些 teacher 模型被用来生成领域专属数据,从而把各领域学到的特化能力蒸馏进一个统一的模型里。
  • Stage 2:on-policy 蒸馏(On-Policy Distillation)。经过上述专家蒸馏,模型在多模态理解与推理,以及基于文本的对话、推理、coding 和 agentic 任务等领域已经有很强的表现。尽管如此,以音频查询为条件的响应质量与以文本查询为条件的响应质量之间仍存在相当大的差距,语音对话中尤其明显。为缩小这一差距,我们引入基于 on-policy distillation(OPD) 的第二阶段训练流程,目标是把模型在文本输入下更强的响应能力蒸馏到音频输入的设定里。具体来说,对每一对音频-文本配对的查询,我们先拿到在文本条件下生成的响应——它在流畅度、推理和任务完成度上通常质量更高——然后把这个响应作为对应音频条件查询的蒸馏目标。通过在这样的 on-policy 目标上训练,模型逐步把音频条件下的输出对齐到文本条件下的行为,从而提升音频输入下的响应质量,并促成跨模态一致的生成。
  • Stage 3:交互对齐强化学习(Interaction-Aligned Reinforcement Learning)。虽然前两个阶段大幅提升了模型的领域能力和跨模态响应质量,但它们不足以让模型在真实交互使用中被完全优化好。在多轮对话中,我们观察到若干交互特有的问题,包括非预期的语言 code-switching、人设不一致,以及长上下文下指令跟随能力退化。为缓解这些问题,我们引入 Interaction-Aligned RL,一个以优化交互质量为目标的第三阶段强化学习流程。我们构造多轮交互轨迹,并围绕这些用户体验目标设计奖励信号,让模型学到在长时间交互中更稳定、更一致、更对齐的行为。通过显式地为交互质量做优化,这一阶段提升了模型在实际对话场景中的整体可用性。

4.2 Talker

我们对 Talker 采用四阶段的训练流水线,使 Qwen3.5-Omni 能与文本一起生成自然且贴合上下文的口语响应。所有训练数据都按 ChatML 格式组织,以与 Thinker 保持一致,并便于音色克隆。

  1. 通用阶段(General Stage):在最初的预训练阶段,我们在超过 2000 万小时、带多模态上下文配对的多语种语音数据上训练 Qwen3.5-Omni。特别地,引入更多样的任务(比如指令跟随的语音生成)大幅增强了上下文推理和副语言(paralinguistic)对齐,超出了「从多模态表示到语音」的简单单调映射。
  2. 长上下文阶段(Long-Context Stage):我们通过一条专门的清洗流水线做数据质量分层,并在高质量子集上做继续预训练(CPT)。在 Qwen3-Omni-Captioner 的增强下,这一阶段缓解了初始预训练阶段由噪声数据引入的幻觉,并大幅提升生成语音的自然度与质量。同时我们把最大上下文长度扩展到 64k token,让模型能更好地处理长而复杂的用户输入,产出更贴合上下文的语音响应。
  3. 强化学习阶段(Reinforcement Learning Stage):我们进一步通过 Direct Preference Optimization(DPO)7 把模型行为与人类偏好对齐。具体来说,我们基于人工标注构造多语种的偏好对,用 DPO 优化模型。此外我们还纳入基于规则的奖励,并采用 GSPO8 来进一步提升多样任务上的整体能力与训练稳定性。
  4. 说话人微调阶段(Speaker Fine-tuning Stage):最后,我们在 base 模型之上做轻量的说话人微调,使 Qwen3.5-Omni 能忠实捕捉目标说话人的特征,同时进一步提升语音输出的自然度、表现力和可控性。

5 评测

我们对两个模型变体做了全面评测,包括 Qwen3.5-Omni-Flash 和 Qwen3.5-Omni-Plus。评测结果分成两大类:理解(X→Text)与语音生成(X→Speech)。

5.1 X→Text 评测

本节我们评估 Qwen3.5-Omni 理解各类多模态输入(文本、音频、视觉、视听视频)并生成文本响应的能力。

Text→Text。我们在 text→text 上的评测主要聚焦通用知识任务、指令跟随、长上下文任务、STEM 任务、推理任务和通用 agent 能力。具体来说,通用知识任务用 MMLU-Pro、MMLU-Redux、SuperGPQA 和 C-Eval;指令跟随用 IFEval 和 IFBench;长上下文任务用 AA-LCR 和 LongBench v2;STEM 任务用 GPQA;推理任务用 LiveCodeBench v6、HMMT Nov 25 和 IMOAnswerBench;通用 agent 能力用 BFCL-V4 和 TAU2Bench。

Audio→Text。为评测音频到文本的能力,我们采用横跨四个领域的 benchmark:音频理解、端到端语音对话、语音到文本翻译(S2TT)和自动语音识别(ASR)。音频理解方面,我们用 MMAU、MMAR、MMSU、RUL-MuchoMusic 和 SongFormBench 来考察对音效、语音和音乐的理解。对话表现通过 VoiceBench、URO-Bench-pro、SpeechRole 和 WildSpeech-Bench 评测。S2TT 方面,我们聚焦 Fleurs 中排名前 59 的语种翻译到英文和中文。最后,ASR 表现用 Fleurs、Common Voice、LibriSpeech、WenetSpeech、KeSpeech、Opencpop-test 和 MIR-1K(vocal)来度量,覆盖多语种语音、汉语方言和歌声转写。

Vision→Text。对模型视觉到文本能力的评测涵盖一整套面向多样且有挑战性任务的 benchmark。为考察数学与 STEM 推理这一专门领域的表现,我们采用 MMMU、MMMU-Pro、MathVista、MathVision、DynaMath 和 ZEROBench。通用视觉问答方面,模型在 RealWorldQA、MMStar、HallusionBench 和 SimpleVQA 上评测。模型在文档理解上的能力用 CharXiv、CC-OCR、AI2D、MMLongBench-Doc 和 OCRBench 度量。此外,模型的空间智能专门在 ERQA、CountBench、RefCOCO、ODInW13 和 EmbSpatialBench 上测试。为评估在动态视觉数据上的表现,我们在六个视频理解 benchmark 上报告结果:Video-MME、MLVU、MVBench、LVBench、MMVU 和 MME-VideoOCR。我们还特别在三个成熟的 benchmark 上评估模型的医学 VQA 表现:SLAKE、PMC-VQA 和 MedXpertQA-MM。这项评估旨在展示模型全面的临床推理能力,以及它作为可靠医疗 AI 助手的潜在用途。

Audio-Visual Video→Text。我们从多个角度评估模型的视听理解能力。文本查询的评测用 DailyOmni、WorldSense、AVUT、AV-SpeakerBench 和 VideoMME。为考察模型在真实世界视听交互场景中的能力,我们用 Qualcomm IVD 作为音频查询评测的 benchmark。理解之外,我们还在 OmniCloze 上评测模型的 captioning 能力,在 OmniGAIA 上评测它的工具使用能力。

5.1.1 Text→Text 的表现

我们把 Qwen3.5-Omni-Plus 和 Qwen3.5-Omni-Flash 与 Qwen3.5-Plus-Instruct 做对比。如表 4 所示,Qwen3.5-Omni-Plus 在知识、指令跟随、长上下文理解、STEM、推理和通用 agent 任务等多个维度上,都展现出与其纯文本对应模型相当的文本能力,凸显了它很强的语言能力。特别地,Qwen3.5-Omni 的指令跟随表现略好于基线。我们认为 OPD 和 interaction-aligned RL 对提升全模态 LLM 的指令跟随能力有正面作用。

表 4:Qwen3.5-Omni 与 Qwen3.5-Plus-Instruct 的 Text→Text 表现。最高分加粗。

数据集 Qwen3.5-Plus-Instruct Qwen3.5-Omni-Flash Qwen3.5-Omni-Plus
Knowledge
MMLU-Pro 86.8 79.9 85.9
MMLU-Redux 94.3 90.0 94.2
SuperGPQA 67.4 54.9 66.4
C-Eval 92.3 86.0 92.0
Instruction Following
IFEval 89.7 85.2 89.7
IFBench 51.1 38.4 52.6
Long Context
AA-LCR 62.0 46.0 57.0
LongBench v2 60.2 46.4 59.6
STEM
GPQA 85.9 76.4 83.9
Reasoning
LiveCodeBench v6 67.1 56.6 65.6
HMMT Nov 25 86.2 59.0 84.4
IMOAnswerBench 68.3 51.5 65.5
General Agent
BFCL-V4 66.1 55.3 63.3
TAU2Bench 82.7 78.0 81.0

5.1.2 Audio→Text 的表现

表 5:Gemini-3.1 Pro、Qwen3.5-Omni-Flash 与 Qwen3.5-Omni-Plus 的音频 benchmark 对比。多数 benchmark 上越高越好;ASR benchmark 上 WER 越低越好。最好的结果加粗。

数据集 Gemini-3.1 Pro Qwen3.5-Omni-Flash Qwen3.5-Omni-Plus
Audio Understanding(↑)
MMAU 81.1 80.4 82.2
MMAR 83.7 74.0 80.0
MMSU 81.3 72.2 82.8
RUL-MuchoMusic 59.6 60.5 72.4
SongFormBench-HarmonixSet (acc / hr.5f / hr3f)ᵃ 75.6 / 46.8 / 77.9 80.6 / 67.8 / 83.4 81.1 / 72.9 / 85.3
SongFormBench-CN (acc / hr.5f / hr3f)ᵃ 78.1 / 43.2 / 71.9 86.7 / 66.4 / 84.6 87.1 / 65.7 / 84.2
Dialogue(↑)
VoiceBench 88.9 87.8 93.1
URO-Bench-pro (U / R / O)ᵇ 69.1 / 84.0 / 99.2 64.1 / 83.8 / 98.7 66.3 / 86.3 / 99.8
SpeechRole 124.2 119.8 123.5
WildSpeech-Bench 76.3 72.2 75.4
S2TT(↑)
Fleurs (xx↔zh, top59)ᶜ 29.5 26.9 30.2
Fleurs (xx↔en, top59)ᶜ 34.6 32.0 35.4
Fleurs (xx↔zh/en, top59)ᶜ 32.1 29.4 32.8
ASR(WER↓)
Fleurs (top60) 7.32 10.75 6.55
CV15 (zh / yue / zh-tw) 8.59 / 13.40 / 6.78 4.25 / 3.45 / 2.68 3.46 / 1.95 / 2.27
CV15 (en) 8.73 5.90 4.83
Librispeech (clean / other) 3.36 / 4.41 1.30 / 2.43 1.11 / 2.23
WenetSpeech (net / meeting) 11.53 / 14.21 4.41 / 5.51 4.30 / 5.84
Kespeech 23.67 4.47 3.46
MIR-1K (vocal-only)ᵈ 8.76 4.94 4.56
Opencpop 6.83 1.11 1.49

表注:

  • ᵃ SongFormBench:我们用一条统一的 prompt 定义类 SRT 的输出时间戳格式和一个封闭词表来做评测。词表沿用官方代码库里指定的 SongForm-HX-8Class
  • ᵇ URO-Bench-Pro:我们使用 URO-Bench 的 pro 赛道,三个评测维度分别记为 U(Understanding)、R(Reasoning)、O(Oral Conversation)。oral 维度我们用 GenStyle-en、GenStyle-zh 和 Multilingual 任务。
  • ᶜ Fleurs:top59 语种为 English、Chinese、Cantonese、Korean、Japanese、Vietnamese、Thai、Malay、German、Russian、Italian、French、Spanish、Portuguese、Dutch、Indonesian、Turkish、Arabic、Polish、Hindi、Urdu、Filipino、Persian、Czech、Greek、Swedish、Hebrew、Danish、Finnish、Norwegian、Icelandic、Bengali、Punjabi、Javanese、Marathi、Swahili、Ukrainian、Gujarati、Kannada、Azerbaijani、Malayalam、Cebuano、Romanian、Hungarian、Bulgarian、Belarusian、Catalan、Tamil、Croatian、Bosnian、Slovak、Galician、Kyrgyz、Macedonian、Slovenian、Latvian、Estonian、Asturian;相比 top60 列表,Afrikaans 被排除在外,因为 Fleurs S2TT 测试集不覆盖这个语种。
  • ᵈ MIR-1K:转写被转换成简体中文。

表 5 里我们在音频到文本的表现上把 Qwen3.5-Omni 与 Gemini-3.1 Pro 做对比。相比 Gemini-3.1 Pro,Qwen3.5-Omni 在 MMAU、MMSU、RUL-MuchoMusic 和 SongFormBench 上表现更好,在 MMAR 上取得相当的结果,说明它在多个音频领域都有很强的理解能力。端到端语音对话方面,Qwen3.5-Omni 在 VoiceBench 上显著超过 Gemini-3.1 Pro,在其他 benchmark 上与之持平,进一步验证了 Qwen3.5-Omni 在端到端语音交互上的稳健能力。S2TT 和 ASR 方面,Qwen3.5-Omni 一致地优于 Gemini-3.1 Pro,凸显了它在多样语种、方言和领域上更好的翻译与语音识别表现。

5.1.3 Vision→Text 的表现

为全面评测视觉到文本的能力,我们把 Qwen3.5-Omni-Flash 和 Qwen3.5-Omni-Plus 与 Qwen3.5-Plus-Instruct 做对比。如表 6 所示,Qwen3.5-Omni-Plus 取得了与 Qwen3.5-Plus-Instruct 相当的表现,同时在涉及短视频和长视频的视频理解任务上结果更强。这些发现凸显了我们的模型在真实场景下很强的动态视觉感知能力,也提示了视频-音频联合训练范式的有效性。此外我们认为,视听流构成了对真实世界现象最自然的表示,其中视觉与听觉模态本质上是耦合的,而非各自独立处理的。

表 6:Qwen3.5-Omni 与 Qwen3.5-Plus-Instruct 的 Vision→Text 表现。最高分加粗。

数据集 Qwen3.5-Plus-Instruct Qwen3.5-Omni-Flash Qwen3.5-Omni-Plus
STEM and Puzzle
MMMU 81.0 76.9 80.1
MMMU-Pro 73.8 68.2 73.9
MathVision 73.6 65.4 73.0
Mathvista (mini) 86.9 82.9 86.1
DynaMath 84.2 79.3 83.8
ZEROBench 6 1 5
ZEROBench_sub 31.1 26.0 34.4
General VQA
RealWorldQA 79.1 77.5 84.1
MMStar 80.3 75.7 79.4
MMBench (EN-DEV-v1.1) 93.8 88.8 92.8
SimpleVQA 66.1 54.4 65.3
Text Recognition and Document Understanding
CharXiv (RQ) 74.2 64.4 72.5
CC-OCR 83.0 80.8 83.4
AI2D_TEST 92.1 89.0 91.2
MMLongBench-Doc 59.7 53.6 57.5
OCRBench 91.4 89.1 91.3
Spatial Intelligence
ERQA 53.8 50.0 54.8
CountBench 95.1 88.2 95.1
RefCOCO (avg) 95.2 92.6 95.0
ODInW13 50.3 46.8 49.5
EmbSpatialBench 83.4 82.7 85.4
Video Understanding
VideoMME (w/o sub.) 81.0 77.0 81.9
MLVU (M-Avg) 85.1 81.9 86.8
MVBench 76.7 70.8 79.0
LVBench 68.6 65.7 71.2
MMVU 67.1 62.7 67.5
MME-VideoOCR 74.2 70.5 77.0
Medical VQA
SLAKE 82.8 73.1 84.7
PMC-VQA 62.4 58.7 62.7
MedXpertQA-MM 55.3 44.8 54.7

译注:表 6 的图注写着「最高分加粗」,但原文投稿的这张表里一个加粗都没有,上表照此保留。要看每行谁最高,得自己比。

5.1.4 Audio-Visual Video→Text 的表现

我们在一系列多样的视听任务上把 Qwen3.5-Omni 与 Gemini-3.1 Pro 做对比,如表 7 所示。通用理解方面,Qwen3.5-Omni 在 DailyOmni 上取得 SOTA,在 AVUT 上取得相当的结果。我们的模型在 Qualcomm IVD 上也大幅超过 Gemini-3.1-Pro,说明它在真实世界视听交互场景中的有效性。

此外,我们的模型在 captioning 任务上表现很强,能给出细致的音频、视觉和视听描述。这一版里我们也增强了模型的工具使用能力,在 OmniGAIA 上达到 57.2%。

表 7:Qwen3.5-Omni 与 Gemini-3.1-Pro 的 Audio-Visual→Text 表现。最高分加粗。

数据集 Gemini-3.1 Pro Qwen3.5-Omni-Flash Qwen3.5-Omni-Plus
Text Query QA
DailyOmni 82.7 81.8 84.6
WorldSense 65.5 57.9 62.8
AVUT 85.6 81.4 85.0
AV-SpeakerBench 75.1 65.2 71.3
VideoMME (w/ audio)ᵃ 89.0 79.3 83.7
Audio Query QA
Qualcomm IVD 66.2 66.3 68.5
Caption
Omni-Cloze 57.2 63.0 64.8
Agent (Tool Use)
OmniGAIAᵇ 68.9 33.9 57.2

表注:

  • ᵃ VideoMME 在 use_audio_in_video=True 的设定下评测。
  • ᵇ OmniGAIA 在不加 thinking prompt、也不加 <answer> 格式的条件下评测。所有结果用 DeepSeek-V3.2-Thinking 作为 judge。

5.2 X→Speech 评测

本节我们评估 Qwen3.5-Omni 的语音生成能力。评测主要聚焦以文本和 prompt 语音为条件的语音生成,遵循 zero-shot 文本转语音(TTS)的设定。我们从四个角度研究模型:

  • Zero-Shot 语音生成:我们在 SEED 上评测由 WER 度量的内容一致性。
  • 多语种语音生成:我们在 TTS 多语种测试集和一个基于 FLEURS 构建的内部多语种测试集上,评测 zero-shot 多语种语音生成的内容一致性与说话人相似度。
  • 跨语种语音生成:我们在 CV3-Eval 上评测 zero-shot 跨语种语音生成的内容一致性。
  • 定制音色语音生成:我们在 TTS 多语种测试集和内部多语种测试集上评测说话人微调后模型的稳定性。

5.2.1 Zero-Shot 语音生成评测

我们把 Qwen3.5-Omni 与最先进的 zero-shot TTS 系统做对比。如表 8 所示,Qwen3.5-Omni 在 SEED-TTS benchmark 上表现极具竞争力,展示了 zero-shot 语音生成中很强的内容保真度。这些结果反映出我们的预训练与继续预训练流水线在构建稳健的语音生成与上下文建模能力上是有效的。此外,经过 RLHF 优化后,Qwen3.5-Omni 进一步提升了生成的稳定性与自然度,在 test-en 划分上以 1.26 的 WER 取得最好成绩。

表 8:SEED-TTS 测试集上的 zero-shot 语音生成。表现用词错误率(WER,↓)度量,越低越好。最好的结果加粗。

数据集 模型 表现(test-zh / test-en)
Content Consistency
SEED test-zh / test-en Seed-TTS (ICL) 1.11 / 2.24
SEED test-zh / test-en Seed-TTS (RL) 1.00 / 1.94
SEED test-zh / test-en MaskGCT 2.27 / 2.62
SEED test-zh / test-en E2 TTS 1.97 / 2.19
SEED test-zh / test-en F5-TTS 1.56 / 1.83
SEED test-zh / test-en Spark TTS 1.20 / 1.98
SEED test-zh / test-en CosyVoice 2 1.45 / 2.57
SEED test-zh / test-en CosyVoice 3 0.71 / 1.45
SEED test-zh / test-en MiniMax-Speech 0.83 / 1.65
SEED test-zh / test-en MiMo-Audio-7B-Instruct 1.96 / 5.37
SEED test-zh / test-en Qwen2.5-Omni-7B 1.42 / 2.33
SEED test-zh / test-en Qwen3-Omni-30B-A3B 1.07 / 1.39
SEED test-zh / test-en Qwen3.5-Omni-Plus 0.99 / 1.26

5.2.2 多语种语音生成评测

Qwen3.5-Omni 支持 29 种语言的语音生成。我们把它的多语种语音生成表现与两个强商用系统 MiniMax-Speech 和 ElevenLabs 做对比。对内部多语种测试集,我们用 GPT-4o-transcribe-2025-03-20 做自动语音识别。

如表 9 和表 10 所示,在多语种测试集上评测的 29 个语种里,Qwen3.5-Omni 在 22 个语种上取得最低 WER,多数情况下明显优于对比系统。在其余语种上,Qwen3.5-Omni 也保持了与最先进系统相当的竞争力。除内容一致性之外,Qwen3.5-Omni 还表现出很强的音色克隆保真度:它在多数被评测语种上取得最高的说话人相似度分数,整体上一致地优于 MiniMax-Speech 和 ElevenLabs。这些结果说明,Qwen3.5-Omni 在维持稳健的多语种语音生成质量的同时,有效保留了音色、韵律风格等说话人特征。

此外,在表 10 里我们报告了内部多语种测试集上的结果,它额外覆盖 9 个语种。Qwen3.5-Omni 在所有被评测语种上持续取得很强的表现,说明它的多语种语音生成能力能很好地泛化到公开 benchmark 语种之外。

表 9:TTS 多语种测试集上的多语种语音生成。内容一致性用词错误率(WER,↓)度量,说话人相似度用余弦相似度(SIM,↑)度量。最好的结果加粗。

语种 Content Consistency Speaker Similarity
Qwen3.5-Omni-Plus MiniMax ElevenLabs Qwen3.5-Omni-Plus MiniMax ElevenLabs
Chinese 0.695 2.252 16.026 0.800 0.780 0.677
English 0.631 2.164 0.756 0.833 0.756 0.613
German 0.447 1.906 0.572 0.757 0.733 0.614
Italian 0.503 1.543 1.743 0.785 0.699 0.679
Portuguese 1.221 1.877 1.331 0.792 0.805 0.711
Spanish 0.862 1.029 1.084 0.797 0.762 0.615
Japanese 3.479 3.519 10.046 0.788 0.776 0.738
Korean 1.458 1.747 1.865 0.747 0.776 0.700
French 2.430 4.099 5.216 0.730 0.628 0.535
Russian 3.182 4.281 3.878 0.790 0.761 0.676
Thai 2.170 2.701 73.936 0.788 0.800 0.588
Indonesian 0.823 1.237 1.059 0.780 0.729 0.660
Arabic 2.602 1.665 1.666 0.745 0.736 0.706
Vietnamese 1.143 0.880 73.415 0.767 0.743 0.369
Turkish 0.938 1.520 0.699 0.747 0.779 0.596
Finnish 2.784 4.666 2.964 0.859 0.835 0.759
Polish 1.427 1.415 0.766 0.839 0.802 0.729
Hindi 6.444 6.962 5.827 0.797 0.818 0.730
Dutch 1.238 1.143 0.803 0.762 0.738 0.680
Czech 2.929 3.875 2.108 0.802 0.796 0.685

表 10:内部多语种测试集上的多语种语音生成。内容一致性用词错误率(WER,↓)度量,说话人相似度用余弦相似度(SIM,↑)度量。最好的结果加粗。

语种 Content Consistency Speaker Similarity
Qwen3.5-Omni-Plus Ground Truth Qwen3.5-Omni-Plus Ground Truth
Urdu 14.819 17.822 0.775 -
Tagalog 5.193 6.885 0.870 -
Swedish 3.760 4.813 0.822 -
Danish 3.636 6.403 0.775 -
Hebrew 7.860 16.178 0.760 -
Icelandic 10.244 11.451 0.764 -
Malay 3.142 4.628 0.794 -
Norwegian 3.613 4.442 0.825 -
Persian 11.113 14.469 0.800 -

5.2.3 跨语种语音生成评测

除多语种音色克隆之外,Qwen3.5-Omni 还支持跨语种音色克隆:模型需要在生成另一种目标语言的语音时保持说话人身份。我们在 Cross-Lingual benchmark 上评测这项能力,并与 CosyVoice 系列以及 Qwen3-Omni-30B-A3B 做对比。

在表 11 里我们报告了不同源-目标语言对上的混合错误率(英文用 WER,其他语种用 CER)。总体上,Qwen3.5-Omni 在 12 个被评测方向里的 10 个上取得最好表现,并在多数以英语、日语、韩语为目标的语言对上刷新了 SOTA。特别地,zh-to-ko 方向上 Qwen3.5-Omni 把错误率从 CosyVoice3 的 14.4 降到 4.03,相对降幅约 72%。Qwen3.5-Omni 在 zh-to-enen-to-zh 这类常用语言对上也表现很强,说明跨语种生成下更好的内容一致性。这些结果表明,Qwen3.5-Omni 能有效跨越语言边界泛化,同时保持目标语言的准确性。

表 11:Cross-Lingual benchmark 上的跨语种语音生成。表现用混合错误率度量(英文用 WER,其他语种用 CER,↓)。最好的结果加粗。

语种 Qwen3.5-Omni-Plus Qwen3-Omni-30B-A3B CosyVoice3 CosyVoice2
English-to-Chinese 4.86 5.37 5.09 13.5
Japanese-to-Chinese 3.55 3.32 3.05 48.1
Korean-to-Chinese 0.84 0.99 1.06 7.70
Chinese-to-English 2.18 2.76 2.98 6.47
Japanese-to-English 2.18 3.31 4.20 17.1
Korean-to-English 2.51 3.34 4.19 11.2
Chinese-to-Japanese 5.92 8.29 7.08 13.1
English-to-Japanese 5.12 7.53 6.80 14.9
Korean-to-Japanese 2.16 4.24 3.93 5.86
Chinese-to-Korean 4.03 5.13 14.4 24.8
English-to-Korean 3.72 4.96 5.87 21.9
Japanese-to-Korean 5.12 6.23 7.92 21.5

5.2.4 定制音色语音生成评测

我们在多语种设定下评测 Qwen3.5-Omni 的定制音色语音生成能力。我们把 Qwen3.5-Omni 与几个通过官方 API 在 2026 年 3 月访问的强商用系统做对比,包括 ElevenLabs Multilingual v2(9YHcvj6GT2YYXdXww)、Gemini-2.5 Pro-Preview-TTS(Achernar)、GPT-Audio-2025-08-28(Alloy)和 MiniMax-Speech-2.8-HD(English_expressive_narrator)。

表 12:多语种测试集上的定制音色多语种语音生成。表现用词错误率(WER,↓)度量。最好的结果加粗。

语种 Qwen3.5-Omni-Plus ElevenLabs Gemini-2.5 Pro GPT-Audio MiniMax
Chinese 0.785 3.801 1.890 0.829 0.786
English 0.839 1.126 0.953 1.050 1.429
German 0.182 0.500 0.509 0.558 1.581
Italian 0.458 0.513 0.991 0.769 1.063
Portuguese 1.581 1.109 2.050 1.506 1.240
Spanish 0.768 0.520 0.891 0.936 0.691
Japanese 3.306 11.685 4.420 4.317 4.254
Korean 1.309 3.981 4.110 3.999 3.635
French 2.724 2.574 3.284 2.809 3.439
Russian 4.723 4.324 3.858 4.346 3.529
Thai 1.653 114.813 2.539 4.430 1.811
Indonesian 1.596 6.094 1.498 2.362 1.585
Arabic 3.183 5.400 5.525 5.326 3.309
Vietnamese 1.320 82.849 1.699 1.854 1.058
Turkish 1.309 0.551 2.237 1.389 0.652
Finnish 4.039 2.522 5.331 3.270 2.939
Polish 1.462 0.733 1.622 1.737 0.833
Hindi 6.776 6.388 6.596 7.191 6.146
Dutch 1.135 1.005 0.973 1.561 1.406
Czech 3.769 1.916 3.380 2.859 1.766
Urdu 14.916 12.970 14.141 13.362 24.151
Tagalog 5.090 5.473 6.784 5.352 5.674
Swedish 3.588 3.132 3.196 2.898 2.833
Danish 7.183 2.604 3.876 3.846 4.951
Hebrew 7.680 102.018 4.459 5.328 8.161
Icelandic 10.322 25.110 6.348 9.648 33.431
Malay 3.738 6.448 3.731 3.406 3.955
Norwegian 5.576 7.351 4.304 3.400 9.492
Persian 12.140 20.564 12.620 13.202 12.722

如表 12 所示,尽管 Qwen3.5-Omni 只在单语数据上做了微调,它在定制音色语音生成上仍展现出很强的跨语种泛化能力。模型能把目标说话人的特征迁移到全部 29 个被评测语种上,同时保持稳定的生成质量。总体上,Qwen3.5-Omni 在 10 个语种上取得最好的 WER,在其余不少语种上也保持竞争力。特别地,它在若干有挑战性的语种上优势明显,包括日语(3.306)和韩语(1.309),说明跨语种音色迁移下很强的可懂度。这些结果说明,Qwen3.5-Omni 能在广泛的语种范围内生成具有稳健语言保真度的定制音色语音。

6 结论

这项工作里我们提出 Qwen3.5-Omni,一个全模态的大语言模型,它把跨文本、图像、音频和视听输入的理解、推理、生成与行动统一起来。基于 Thinker–Talker 框架,Qwen3.5-Omni 引入了高效的 Hybrid-Attention MoE 架构、256k 长上下文建模、基于多码本 codec 预测与 ARIA 的改进流式语音生成,以及大幅扩展的多语种语音支持。这些进展带来三项关键能力:可控的视听描述、全面的实时交互,以及通过自主工具使用和视听代码生成体现的原生全模态 agentic 行为。经验上,Qwen3.5-Omni 在广泛的音频与视听 benchmark 上取得 SOTA 或极具竞争力的表现,同时保持了同规模 Qwen 模型在文本和视觉上的强能力。这些结果表明,把原生全模态训练规模化,能够产出这样一类统一系统:它们不只跨模态感知与推理,还能实时地交互与行动。我们希望 Qwen3.5-Omni 能为通用全模态 agent 的未来研究提供一个坚实的基础。

8 附录

8.1 多语种评测的详细结果

多语种 ASR。如表 13 所示,在 FLEURS 测试集上,Qwen3.5-Omni 相比最先进的竞争者展现出更强的语音识别能力。Qwen3.5-Omni-Plus 取得 6.6% 的最低平均 WER,优于 Gemini-3.1-Pro(7.3%)和 GPT-4o-Transcribe(10.4%)。它在多数语种上拿到最好成绩,在复杂声调语言和低资源语言上优势尤其显著,比如粤语(2.2% 对 Gemini-3.1-Pro 的 6.3%)、泰语和越南语。与此同时,Qwen3.5-Omni-Flash 提供了一个效率很高的替代选项,10.8% 的平均 WER 相对 Gemini-3-Flash(10.5%)仍有竞争力。值得注意的是,Qwen3.5-Omni-Flash 在有挑战性的场景下表现出格外的鲁棒性,把粤语的错误大幅降低(3.1% 对 Gemini-3-Flash 的 10.8%),在日语和韩语上也保持很强的表现,凸显了它在高价值亚洲语言对上的优势。

多语种翻译。如表 14 和表 15 所示,在 FLEURS 测试集上 Qwen3.5-Omni 系列相比最先进的竞争者展现出明显优势,在亚洲语言和特定高资源语言对上尤其如此。Qwen3.5-Omni-Plus 在多对多方向(en2xx/zh2xx)上全面优于 Gemini-3.1-Pro,在英译他(33.8 对 31.8)和中译他(21.4 对 19.6)上都取得更高的平均 BLEU。它在关键的 xx2en 语言对上也领先,比如葡萄牙语(49.4 对 47.7)和印尼语(45.7 对 45.1)。虽然 Gemini-3.1-Pro 在 xx2zh 的总体平均上略占优势,Qwen3.5-Omni-Plus 在几个关键亚洲语言上显著超过它,包括粤语(+15.6 BLEU)、韩语和日语。类似地,Qwen3.5-Omni-Flash 相对 Gemini-3-Flash 也展现出针对性的强项:在保持有竞争力的总体表现的同时,它在粤语翻译的所有方向上都大幅超过 Gemini(比如 xx2zh 上 37.5 对 22.4、en2xx 上 37.3 对 26.7),在日语和韩语的 xx2zh 任务上也给出更好的结果。这些结果凸显了 Qwen3.5-Omni 对复杂亚洲语言结构和关键区域语言的稳健优化。

表 13:FLEURS 测试集上的多语种 ASR 表现。结果用词错误率(WER,↓)报告,数值越低越好。斜体语种报告的是字错误率(CER,↓)。相比参与对比的模型,Qwen3.5-Omni-Plus 在多数语种上取得最好结果。最好的结果加粗。(原表覆盖 59 个语种,下表只保留正文点名讨论的语种和 Average 行)

语种 Qwen3.5-Omni-Plus Qwen3.5-Omni-Flash Gemini-3.1-Pro GPT-4o-Transcribe Gemini-3-Flash
Cantonese 2.2 3.1 6.3 5.2 10.8
Korean 1.7 2.1 2.0 2.1 2.4
Thai 2.8 3.2 4.3 4.9 4.5
Vietnamese 1.9 2.5 2.5 3.5 3.5
Japanese 1.9 2.5 2.3 3.0 3.4
Average(全部 59 语种) 6.6 10.8 7.3 10.4 10.5

表 14:FLEURS en2xx 与 zh2xx 测试集上的多语种翻译表现。结果用 BLEU(↑)报告。相比参与对比的模型,Qwen3.5-Omni-Plus 在多数语言对上更优。最好的结果加粗。(同样只保留正文点名的语种和 Average 行)

语种 en2xx(英译他) zh2xx(中译他)
Qwen3.5-Omni-Plus Qwen3.5-Omni-Flash Gemini-3.1-Pro Gemini-3-Flash Qwen3.5-Omni-Plus Qwen3.5-Omni-Flash Gemini-3.1-Pro Gemini-3-Flash
Cantonese 40.1 37.3 25.5 26.7 36.7 35.9 23.7 24.0
Korean 33.9 31.8 30.8 31.7 25.1 23.4 21.9 22.8
Japanese 53.2 50.6 51.3 50.8 45.6 41.6 43.0 42.0
Average(全部语种) 33.8 30.4 31.8 31.8 21.4 18.1 19.6 19.5

表 15:FLEURS xx2en 与 xx2zh 测试集上的多语种翻译表现。结果用 BLEU(↑)报告。最好的结果加粗。(同样只保留正文点名的语种和 Average 行)

语种 xx2en(他译英) xx2zh(他译中)
Qwen3.5-Omni-Plus Qwen3.5-Omni-Flash Gemini-3.1-Pro Gemini-3-Flash Qwen3.5-Omni-Plus Qwen3.5-Omni-Flash Gemini-3.1-Pro Gemini-3-Flash
Cantonese 30.3 29.9 27.7 26.3 36.8 37.5 21.2 22.4
Portuguese 49.4 48.2 47.7 47.5 43.6 41.8 42.5 42.4
Indonesian 45.7 43.1 45.1 44.9 43.5 41.4 42.8 42.9
Korean 34.1 32.4 32.0 32.1 39.9 37.5 37.0 37.2
Japanese 30.4 29.2 29.5 29.4 38.0 35.7 35.6 34.8
Average(全部语种) 37.0 33.5 37.4 36.6 38.9 35.7 39.4 38.9

  1. Qwen3.5-Omni Technical Report, https://arxiv.org/abs/2604.15804 ↩︎

  2. 阿里云百炼 Qwen-Omni API 文档, https://www.alibabacloud.com/help/en/model-studio/qwen-omni ↩︎

  3. Qwen2.5-Omni Technical Report, https://arxiv.org/abs/2503.20215 ↩︎ ↩︎

  4. Qwen3-Omni Technical Report, https://arxiv.org/abs/2509.17765 ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  5. Qwen3.5: Accelerating Productivity with Native Multimodal Agents, https://qwen.ai/blog?id=qwen3.5 ↩︎ ↩︎

  6. ChatML, https://github.com/openai/openai-python/blob/e389823ba013a24b4c32ce38fa0bd87e6bccae94/chatml.md ↩︎

  7. Direct Preference Optimization: Your Language Model is Secretly a Reward Model, https://arxiv.org/abs/2305.18290 ↩︎

  8. Group Sequence Policy Optimization, https://arxiv.org/abs/2507.18071 ↩︎