阿里旗下千问 AI 平台于 8 月 27 日正式推出 Qwen3-Max-Flash 模型,定位为多模态混合专家(MoE)架构,主打极致性价比。官方公布的最新定价为:输入每百万 Tokens 收费 RMB¥0.80 (约 HK$0)、输出每百万 Tokens 收费 RMB¥2.70 (约 HK$2)、快取命中每百万 Tokens 收费 RMB¥0.10 (约 HK$0)。
Qwen3-Max-Flash 采用全新混合注意力架构
Qwen3-Max-Flash 采用与过往千问大型模型截然不同的下一代(Next)架构,总参数量达千亿级别,但每次推论仅激活 60 亿(6B)参数,号称刷新全球模型效率基准。在注意力机制方面,模型引入独创的 QSA(Qwen Sparse Attention)稀疏注意力机制,与 GDN 形成高效融合的混合注意力架构,于高快取命中、1M Tokens 长上下文场景下,运算速度较传统方案提升 8 倍以上,同时兼顾准确度。
在内部分层通讯方面,模型采用自研 Gated Residual 方法,把传统 Transformer 单一信息主通道拆分成 4 条独立通道,让模型按需求动态决定读写路径,信息传递更高效,训练稳定性亦同步提升。此设计改变了过往单一通道造成的瓶颈,使大规模训练时的梯度流通更为顺畅。
51B N-gram Embedding 提升参数扩展效率
在参数扩展层面,模型额外引入 51B 的 N-gram Embedding 参数,为 Transformer 主干提供高效的查表定位功能。该参数在每次 Token 计算时无需即时激活,仅以极低资源消耗“外挂”一个大规模记忆指南手册,大幅提升模型参数扩展效率,并降低训练成本。通过这种解耦设计,模型得以在维持推论速度的同时,把更多世界知识预载至静态参数之中。
调参方面,Qwen3-Max-Flash 采取模型结构与后期优化协同推进的策略,令收敛效率及训练吞吐量均显著提升。综合上述技术,新模型在编程、Agent 等真实任务场景中,能以更低单价提供高效推理服务,为企业级应用提供更具成本效益的选项。
| 项目 | 规格 |
|---|---|
| 架构类型 | 多模态混合专家(MoE) |
| 总参数量 | 千亿级 |
| 激活参数 | 60 亿(6B) |
| N-gram Embedding 参数 | 51B |
| 注意力机制 | QSA 稀疏注意力 + GDN 混合架构 |
| 长上下文速度提升 | 高快取命中 1M Tokens 场景下提升 8 倍以上 |
| 输入价格 | RMB¥0.80 (约 HK$0) |
| 输出价格 | RMB¥2.70 (约 HK$2) |
| 快取命中价格 | RMB¥0.10 (约 HK$0) |

