首页 要闻 金融 物流 汽车 国企 财经 公司 环保 能源

您的位置:首页 > 快资讯 >

刚刚,deepseek新模型发布,KV Cache 压到上一代 1/8,Agent 成本继续下探

来源:网易智能    编审:    发布时间:2026-09-10 17:24:11


(相关资料图)

9月10日,DeepSeek正式发布并开源 DeepSeek V4.1 Flash 模型。

图注:DeepSeek-V4.1-Flash 与主流前沿模型在 Agentic Benchmark 上的性能对比

据介绍,V4.1 Flash 是其新模型结构系列中的小尺寸模型,采用552B 参数 MoE 架构和全新的 Causal Encoder-Decoder 结构,输入和输出激活参数分别为8B 和16B。该模型原生支持多模态视觉理解,可处理图像与文本输入,并以文本形式生成输出。

图注: DeepSeek 在减少上下文存储方面的持续进展

DeepSeek表示,V4.1 Flash 通过压缩 KV Cache 降低推理与存储成本,相比上一代模型,HBM 需求降至1/4,SSD 需求降至1/8;在 Agent 使用场景中,这一改动主要指向长上下文任务的缓存成本。DeepSeek 称,V4.1 Flash 在性能、费用、速度和总用时等指标上已超过 V4 Pro,并计划在北京时间9月14日12:00后,将 deepseek-v4-pro 请求临时路由至 V4.1 Flash,直至后续 V4.1 Pro 上线。

API 调用方面,开发者可将模型名改为 deepseek-flash 使用新模型;deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 将暂时路由到 V4.1 Flash。新价格自北京时间9月10日12:00生效,继续采用峰谷定价:高峰时段输入缓存命中、缓存未命中和输出价格分别为每百万 tokens 0.04元、2.0元和8.0元;空闲时段分别为0.02元、1.0元和4.0元。(袁宁)

标签: deepseek 路由 agent flash 上下文

精彩推送

最火资讯

Copyright @2008-2018 名企时报网 版权所有
本站点信息未经允许不得复制或镜像 联系邮箱:345 5005 708@qq.com
京ICP备2022016840号-12 营业执照公示信息