DeepSeek V4.1 Flash 正式发布!小激活多模态 MoE 模型,大幅降低 Agent 调用成本

AI 概述
深度求索推出DeepSeek V4.1 Flash,为新架构里最小模型,原生支持多模态视觉,采用MoE非对称激活设计,大幅降低算力成本。它优化KV Cache,显著减少显存与存储开销,长任务Agent成本更低,综合性能超越V4 Pro。API已上线,旧模型标识自动路由切换;9月14日起V4 Pro请求将转发至该模型。多家伙伴完成接入,9月10日起实施新峰谷定价,权重与技术报告开源,兼顾性能与成本。

深度求索刚刚推出 DeepSeek V4.1 Flash,属于全新架构系列里体量最小的模型,自带原生多模态视觉能力。这套新模型架构的设计目标很明确:拉高模型能力上限、提升推理速度、提高吞吐,同时方便后续迭代更大参数版本。

很多人第一眼会被 552B 总参数吸引,但它是 MoE 混合专家模型,输入激活仅 8B,输出激活 16B,输入输出非对称设计。这就意味着实际运行时,参与计算的参数量远小于总参数,算力开销直接拉开差距,成本比同级别模型低不少。

模型使用全新预训练方案,搭配更大规模强化学习微调,在各项基准评测里,综合表现甚至超过 DeepSeek V4 Pro 旗舰模型。

这次更新最打动开发者的,是 KV Cache 缓存的优化。对比上一代模型,HBM 显存占用降到原来 1/4,SSD 存储需求缩减至 1/8;如果和初代模型对比,KV Cache 只有原先的 1/437。
做 Agent 智能体开发的朋友都清楚,缓存开销往往是调用成本大头。大幅压缩 KV Cache 之后,长任务、多轮对话类 Agent 场景的运行成本可以明显下降。

DeepSeek V4.1 Flash 正式发布!小激活多模态 MoE 模型,大幅降低 Agent 调用成本

API 侧也同步完成上线,调用时模型名填写`deepseek-flash`就能访问这个原生多模态模型。老版本 V4 Flash、V4 Flash Vision Exp 已经下线,为保证业务平滑迁移,旧模型标识`deepseek-v4-flash`、`deepseek-v4-flash-vision-exp`会临时路由到 V4.1 Flash。

实测数据显示 V4.1 Flash 在速度、价格、综合性能上全面超越 V4 Pro。官方安排了路由切换计划:北京时间 2026 年 9 月 14 日中午 12 点起,直到 V4.1 Pro 发布前,所有访问`deepseek-v4-pro`的请求都会自动转发到 V4.1 Flash,并且按 V4.1 Flash 的价格计费。

deepseek V4.1 Flash 的价格计费

生态方面,腾讯 WorkBuddy、CodeBuddy 以及 OpenCode 作为深度求索合作伙伴,已经完成全量接入。随着新模型落地,官方同步下调定价,继续保留峰谷计费模式,闲时单价仅为高峰时段一半,新资费将于 2026 年 9 月 10 日 12 点正式生效。模型权重和技术报告也已经在 Hugging Face 公开,开发者可以下载研究。

不管是企业 API 调用、Agent 应用开发,还是本地模型研究,DeepSeek V4.1 Flash 在性能与成本之间找到了不错的平衡点。

以上关于DeepSeek V4.1 Flash 正式发布!小激活多模态 MoE 模型,大幅降低 Agent 调用成本的文章就介绍到这了,更多相关内容请搜索码云笔记以前的文章或继续浏览下面的相关文章,希望大家以后多多支持码云笔记。

「点点赞赏,手留余香」

45

给作者打赏,鼓励TA抓紧创作!

微信微信 支付宝支付宝

还没有人赞赏,快来当第一个赞赏的人吧!

声明:本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如若内容造成侵权/违法违规/事实不符,请将相关资料发送至 admin@mybj123.com 进行投诉反馈,一经查实,立即处理!
重要:如软件存在付费、会员、充值等,均属软件开发者或所属公司行为,与本站无关,网友需自行判断
码云笔记 » DeepSeek V4.1 Flash 正式发布!小激活多模态 MoE 模型,大幅降低 Agent 调用成本

发表回复