DeepSeek V4.1 Flash发布,用pro的能力收flash的钱
来源:36kr 4 小时前

图片由AI生成

9月10日,DeepSeek正式发布V4.1 Flash,同步下调API价格,并宣布将于北京时间9月14日12时下线V4 Pro服务,相关请求随后转由新模型处理。

按照DeepSeek官方的说法,V4.1 Flash在性能、费用、速度和任务总用时等指标上已全面超越V4 Pro。这款采用新架构、原生支持视觉理解的模型,开始接过上一代Pro的位置。

此次更新的重点,也由此落在了三个相互关联的变化上:新架构提升能力与效率,视觉理解并入主力模型,更低的价格让开发者有机会把更多工作交给Flash。

01、5520亿参数,输入与输出采用不同计算规模

V4.1 Flash的升级深入到了模型结构。

此前7月31日发布的V4 Flash正式版,保持了预览版的模型结构和尺寸,主要重新进行了后训练。此次,V4.1 Flash采用全新的Causal-Encoder-Decoder(因果编码器—解码器)结构,是一个总参数量为552B的混合专家模型(MoE)。

这套架构的特点,是输入与输出不对称:处理输入时激活80亿参数,生成输出时激活160亿参数。 模型拥有较大的总参数规模,每次计算只调用其中一部分,并为读取信息和生成内容分配不同的计算规模。DeepSeek称,其成本显著低于已知的同尺寸模型。

这种设计与Agent的工作方式有较强关联。处理代码仓库、长文档和历史对话时,模型需要读取大量信息,再生成相对有限的判断、代码或操作指令。降低输入环节的计算开销,有望改善这类任务的整体效率。

架构之外,V4.1 Flash还采用了新的预训练方式,并进行了更大规模的强化学习后训练。DeepSeek称,新模型在基准测试中超越了包括V4 Pro在内的多款旗舰模型。

根据官方公布的结果,V4.1 Flash在科学问答测试GPQA Diamond中得分90.9,Codeforces竞赛编程评级为3471,MathArena Apex得分65.6。在考察终端任务执行的Terminal-Bench 2.1上,新模型得分90.6;在网络安全测试CyberGym上得分88.1,此前V4 Pro公布的对应成绩分别为87.9和83.3。

V4.1 Flash是新架构系列中尺寸最小的型号。按照DeepSeek的介绍,这套结构还支持向更大参数规模扩展,为后续更大型号提供基础。

02、视觉理解并入主力模型

V4.1 Flash的另一项变化,是原生支持多模态视觉理解。

此前,DeepSeek通过V4 Flash Vision Exp提供实验性质的视觉能力。此次发布后,旧版V4 Flash及视觉实验版已经下线,原有两个模型名的请求均由V4.1 Flash承接,文字与图片处理进入同一个主力API模型。

按照最新图像理解文档,开发者可以让模型描述图片、识别截图文字、分析图表。图片可以通过公开链接传入,也可以编码后直接提交,或通过Files API上传后引用。

这对处理真实资料的Agent有实际意义。业务文档里的说明文字与图表、代码与界面截图,经常需要结合起来理解。统一模型入口,可以减少开发者在不同模型之间分配和切换任务的工作。

在基础规格上,V4.1 Flash支持100万Token上下文、最大384K输出,以及JSON Output、工具调用、Responses API等功能。模型同时提供思考与非思考模式,默认开启思考,思考强度支持low、high、max三档,开发者可以根据任务复杂度配置。

03、缓存输入降价60%,连续工作更便宜

V4.1 Flash的新价格于北京时间9月10日12时生效,继续采用峰谷定价。按每百万Token计算,空闲时段的缓存命中输入价格为0.02元、缓存未命中输入为1元、输出为4元;高峰时段分别为0.04元、2元和8元。

高峰时段为北京时间周一至周五9:00—12:00、14:00—18:00,其余为空闲时段。

与此前V4 Flash同一时段的价格相比,缓存命中输入降价60%,未命中输入降价约33.3%,输出降价约11.1%。

需要反复读取大量上下文的任务,受益更加明显。Agent连续工作时,往往多次输入历史对话、工具说明和代码,缓存价格下降可以降低这部分重复开销。对于以生成新内容为主的任务,节省幅度则相对有限。

以固定用量测算,一次任务若消耗100万缓存命中输入Token、10万未命中输入Token和1万输出Token,空闲时段费用将从0.245元降至0.16元,下降约34.7%。实际账单还取决于模型的思考长度、工具调用轮次和失败重试次数。

deepseek-v4-pro将在9月14日12时后转向新Flash,并按Flash价格计费,直至未来V4.1 Pro上线。

04、模型与Harness一起训练,强化连续工作能力

与V4.1 Flash同步更新的,还有DeepSeek Harness v0.1.5。此次升级进一步将模型训练与Agent运行框架结合:V4.1 Flash针对Harness的标准模式、程序化工具调用(PTC)模式和极简模式,都进行了专项训练与优化。

这意味着,训练开始覆盖模型实际工作的不同环境。Agent完成任务时,需要在工具调用、结果读取和下一步决策之间持续循环。针对不同运行模式训练,有助于模型适应工具组织和调用方式,减少执行中的衔接问题。

一个值得关注的细节是,使用V4.1 Flash时,新版Harness支持在保留已有KV Cache的情况下更新系统提示词。对于需要调整工作规则的长任务,这为复用此前计算结果、减少重复处理提供了条件,也与此次缓存输入降价形成呼应。

文件处理能力也随之完善。Web界面支持上传图片、PDF等文件,由模型通过文件工具按需读取;右侧栏可以浏览工作区文件树,预览Markdown、HTML、PDF、代码和图片。结合V4.1 Flash的原生视觉理解,用户可以把资料交给Agent,再直接查看它生成的文件。

多Agent协作则向前走了一步。父Agent与子Agent支持双向通信,执行过程中可以补充信息、调整方向;主Agent也可以为子Agent选择模型和推理强度。新增的实验性功能Agent Teams允许主Agent创建多个成员,通过共享任务列表分配、跟踪工作,成员之间可以互发消息,最终由主Agent汇总结果。该功能默认关闭,启用后会增加Token消耗。

此外,新版Harness为插件提供了左右侧栏的标准化界面入口,并优化了长会话加载、恢复和内存占用。DeepSeek计划继续加入内置插件管理面板,扩展“一切皆插件”的设计。

从这次更新看,DeepSeek正在把模型能力与运行环境一起优化。 新架构解决计算效率,专项训练改善工具使用,Harness承接文件、会话和任务协作。这些环节共同影响Agent能否稳定完成一项工作。

05、如何使用

开发者可在DeepSeek开放平台创建API Key,将模型名设为deepseek-flash调用新版本。OpenAI兼容接口的base_url为https://api.deepseek.com,Anthropic兼容接口为https://api.deepseek.com/anthropic。

普通用户可通过DeepSeek网页版和官方App使用DeepSeek产品。旧模型名deepseek-v4-flash和deepseek-v4-flash-vision-exp仍可调用,但底层已经切换为V4.1 Flash。

此外,腾讯WorkBuddy已接入DeepSeek V4.1 Flash,用户可在客户端选择该模型,体验文件处理、内容生成等办公任务。

模型更新之外,DeepSeek近期也传出上市筹备消息。据此前公开报道,公司已推进科创板上市工作,并与中信证券等多家头部券商接触上市辅导合作;数位接近相关资本市场运作的人士称,公司当前最新估值为5000亿元人民币。中信证券对此暂未回应,具体上市安排仍待进一步披露。

V4.1 Flash正在拉高低价模型的能力边界,也为未来V4.1 Pro设置了更高的起点:如果Flash能够承接更多复杂工作,更大型号需要拿出更有说服力的能力增量。

简体中文 English