DeepSeek发布V4.1-Flash AI模型提升推理速度及成本效益

DeepSeek 最近推出了新一代 AI 模型 V4.1-Flash。根据官方介绍,虽然 V4.1-Flash 的总参数规模和激活参数均低于 V4-Pro,但在性能、推理速度和成本控制方面的表现更为突出,特别是在智能体和编程相关任务上,部分基准测试成绩超过 V4-Pro 及 GPT-5.6 Sol 等前沿模型。

DeepSeek V4.1-Flash 在性能和成本方面表现优越

DeepSeek 指出,V4.1-Flash 采用专家混合架构,总参数为 5520 亿,输入阶段激活参数为 80 亿,输出阶段则为 160 亿。相比之下,上一代 V4-Flash 总参数为 2840 亿,而 V4-Pro 总参数则达到 1.6 万亿。该模型的一项主要改进是大幅压缩 KV 缓存,缓存占用降至每个 token 约 890 字节,同时输出速度达到每秒约 214.4 个 token,首个 token 响应时间为 1.13 秒。

独立评测机构 AA 给出了“速度显著较快”的评价。

在性能方面,DeepSeek 表示 V4.1-Flash 在高推理强度设置下,于终端操作、代码修复和自动化任务等测试中领先于 GPT 5.6 Sol 和 Claude Opus 5。不过,在更广泛的高难度通用推理任务中,该模型的成绩则相对一般。AA 的数据显示,V4.1-Flash 的综合智能指数为 40 分,高于多数同类开源权重模型的中位水平,但仍低于头部前沿模型。

需要注意的是,AA 最近升级了评测体系,整体评分标准明显收紧,不少高分模型的分数也出现下调。

在价格方面,AA 的数据显示,V4.1-Flash 每 100 万输入 token 价格为 US$0.30 (约 HK$2),每 100 万输出 token 价格为 US$1.20 (约 HK$9),综合成本约 US$0.18 (约 HK$1),低于同档模型的中位数。若命中缓存,价格可进一步降至每 100 万 token US$0.01 (约 HK$0)。AA 同时指出,该模型回答偏长,评测中输出 token 总量明显高于同类模型,可能对实际使用中的时间和费用带来影响。

在技术层面,V4.1-Flash 引入名为 CED 的新结构,将 40 层 Transformer 拆分为 20 层因果编码器和 20 层解码器,减少传统交叉注意力带来的重复计算,并结合 CSA2、FP4 量化等方法压缩缓存与内存占用。整体来看,DeepSeek 此次更新重点放在智能体执行、代码能力和部署成本的优化上。

原创内容
本文是 TechRitual 原创内容的简体中文版本。
Stein Yep
Stein Yep