出品|虎嗅科技组
作者|宋思杭
编辑|苗正卿
头图|视觉中国
这是进击的独角兽第31篇,,,该系列关注月之暗面、智谱、MiniMax、阶跃星辰、零一万物、百川智能、面壁智能和DeepSeek共8家大模子独角兽公司。。。。
梁文锋的热度一直在AI圈的Top级,,,尤其是今年。。。。
从V4预览版宣布,,,到厥后的融资与IPO听说,,,再到一份撒播甚广的四小时谈话实录,,,DeepSeek的每一次行动,,,都能迅速成为行业话题。。。。
7月31日下昼,,,DeepSeek又更新了。。。。
这次,,,DeepSeek只是在API文档的更新日志里宣布,,,V4-Flash正式版API上线公测。。。。
从“正式版”和“公测”两个词同时泛起来看,,,这并不是V4的最终形态。。。。DeepSeek也特意强调,,,本次更新只涉及V4-Flash的API,,,V4-Pro及App、Web端模子均未爆发转变,,,V4-Pro正式版还要再等等。。。。
但这次更新依然值得关注。。。。
从最新版原来看,,,V4-Flash-0731没有改变模子架构和参数规模,,,只重新举行了一次后训练。。。。更新后,,,DeepSeek把险些所有篇幅都用来强调它在Agent,,,尤其是Code Agent上的前进。。。。
这意味着,,,V4-Flash并不是一次简朴的模子更新。。。。
DeepSeek正在实验回覆一个新的问题:到了Agent阶段,,,一家公司最需要的,,,事实是一个能力最强的模子,,,照旧一个足够强、足够快,,,也足够自制的模子??
这一次,,,DeepSeek没有继续堆参数
V4-Flash并不是7月31日才第一次泛起。。。。
4月24日,,,DeepSeek宣布V4预览版时,,,已经同时推出V4-Pro和V4-Flash。。。。两者都是MoE模子,,,但体量差别显着:V4-Pro拥有1.6万亿总参数,,,每次推理激活49B参数;;;;;;V4-Flash拥有284B总参数,,,每次只激活13B参数。。。。两款模子均支持100万Token上下文。。。。
在DeepSeek的定位里,,,Pro认真能力上限,,,Flash认真效率。。。。
参数规模更大的V4-Pro,,,在天下知识以及高难度Agent使命上体现更好;;;;;;V4-Flash则可以通过增添思索预算,,,在部分推理使命上靠近Pro。。。;;;;;;痪浠八担,,Flash牺牲了一部分知识容量,,,却用更小的激活参数换来了速率和本钱。。。。
7月31日的更新没有改变这套架构。。。。
DeepSeek明确体现,,,V4-Flash-0731与预览版的模子结构、尺寸完全一致,,,仅重新举行了后训练。。。。
但就是这次后训练,,,让V4-Flash的Agent能力泛起了显着转变。。。。
凭证DeepSeek宣布的效果,,,V4-Flash-0731在Terminal Bench 2.1上抵达82.7,,,在NL2Repo上抵达54.2,,,在DeepSWE上抵达54.4,,,在Toolathlon Verified上抵达70.3。。。。DeepSeek称,,,这些效果已经大幅凌驾V4-Pro预览版。。。。
这件事的意义在于,,,DeepSeek没有通过增添参数和重新预训练,,,来提高模子的Agent能力。。。。
用通俗的话来讲就是,,,DeepSeek虽然继续在追求AGI,,,可是并没有通过一味地增添参数来实现这件事情,,,而是让模子学会更好地拆解使命、挪用工具、执行代码,,,并在更长的使命轨迹中镌汰过失。。。。
已往,,,大模子公司的主要竞争爆发在预训练阶段。。。。谁有更多算力、更大都据,,,谁就有时机训练出参数更大、知识更多的模子。。。。但进入Agent阶段后,,,模子能力不再完全由预训练决议。。。。
一个模子会不会使用终端,,,能不可在数百次交互中维持使命状态,,,遇到过失后能否修正,,,以及是否知道什么时间应该挪用什么工具,,,这些能力越来越依赖后训练、强化学习和模子外部的执行框架。。。。
V4-Flash的转变,,,恰恰说明晰这一点。。。。
这也是为什么,,,DeepSeek这次除了更新模子,,,还原生支持了Responses API,,,并专门适配Codex。。。。同时,,,DeepSeek在测试Code Agent使命时,,,使用了尚未正式宣布的DeepSeek Harness minimal mode。。。。
换句话说,,,这些Agent效果不完全属于模子自己,,,而是属于“模子、推理预算与Harness”配合组成的系统。。。。
这虽然也意味着,,,现在宣布的数据仍需审慎看待。。。。
一方面,,,部分效果来自DeepSeek内部测试集;;;;;;另一方面,,,DeepSeek Harness尚未果真,,,外界还无法在完全相同的情形下复现这些效果。。。。正式版V4-Flash事实比预览版前进了几多,,,还需要期待自力评测以及真实开发场景验证。。。。
但至少从这次更新可以看出,,,DeepSeek正在从只提供模子和API,,,向Agent所需要的执行情形多走一步。。。。
但DeepSeek现在还没有亲自做一个完整的Agent产品,,,却最先提供让模子进入Agent事情流所必需的接口、适配和Harness。。。。
这是一种非?Uト〉牟坊。。。
为什么是Flash??
既然V4-Pro的能力上限更高,,,DeepSeek为什么不先更新Pro??
最直接的原因是,,,Agent并不是一次模子挪用。。。。
在谈天机械人阶段,,,用户提出一个问题,,,模子天生一次谜底,,,一次交互就竣事了。。。。但在Agent使命里,,,模子需要先明确目的,,,再拆解使命、检索信息、挪用工具、读取效果、修正过失,,,最后完成交付。。。。
一个重大使命,,,可能包括几十次甚至数百次模子挪用。。。。
这时,,,模子单次推理增添的本钱和延迟,,,会在整个使命轨迹中被一直放大。。。。一个能力更强、但速率更慢、本钱更高的模子,,,未必能带来更好的现实效果。。。。
Agent真正需要的,,,往往不是每一步都挪用能力最强的模子,,,而是在绝大大都方法中,,,使用一个能力足够、价钱更低、响应更快的模子。。。。
这正是V4-Flash的价值。。。。
凭证DeepSeek手艺报告,,,在100万Token上下文下,,,V4-Flash单Token推理所需的盘算量,,,约为V3.2的10%,,,KV Cache则约为V3.2的7%。。。。它的总参数只有V4-Pro的约六分之一,,,每次激活参数也只有Pro的约四分之一。。。。
这种差别最终也体现在API定价上。。。。
现在,,,V4-Flash每百万Token未掷中缓存的输入价钱为1元,,,输出价钱为2元;;;;;;V4-Pro划分为3元和6元。。。。V4-Flash的并发限制为2500,,,Pro则为500。。。。Responses API现在也只有V4-Flash支持,,,V4-Pro预计到8月初才会接入。。。。
在V4的产品系统里,,,Pro认真证实DeepSeek的模子能力能够抵达什么位置,,,Flash则认真肩负真正高频、长链条的Agent使命。。。。前者是能力模子,,,后者更像生产模子。。。。
梁文锋曾在内部果真说道,,,“模子应该放在相同本钱下较量;;;;;;在现阶段,,,Coding Agent的优先级高于其他笔直Agent。。。。”
从这个角度来看,,,V4-Flash此次更新的偏向,,,确实与这两个判断形成了呼应。。。。
DeepSeek没有选择通过扩大参数,,,让Flash在所有能力上追上Pro;;;;;;它选择在模子架构稳固的情形下,,,通事后训练和Agent框架,,,提高Flash完成真实使命的能力。。。。
这背后是一种更现实的盘算。。。。
若是Agent最终要进入企业和开发者的日常事情流,,,那么决议模子能否被大规模使用的,,,不但是Benchmark,,,而是完成一个使命需要几多时间、消耗几多Token,,,以及最终乐成率是几多。。。。
不过,,,这也是V4-Flash现在最需要证实的地方。。。。
DeepSeek宣布的Agent效果大多使用Max reasoning effort完成。。。。更高的思索强度通常意味着更长的推理历程和更多Token消耗。。。。一个模子每百万Token的价钱很低,,,不即是完成一项使命的总本钱一定更低。。。。
若是V4-Flash需要消耗更多Token才华抵达靠近Pro的效果,,,那么它在单价上的优势,,,可能会被更长的使命轨迹部分抵消。。。。
因此,,,真正有价值的比照,,,不是V4-Flash在某一项Benchmark上凌驾了谁,,,而是在完成统一个Agent使命时,,,它与V4-Pro、Kimi、GLM以及闭源模子划分需要几多Token、几多时间和几多次重试。。。。
DeepSeek暂时还没有给出这个谜底。。。。
本文来自虎嗅,,,原文链接:https://www.huxiu.com/article/4879740.html?f=wyxwapp