出品|虎嗅科技组
作者|宋思杭
编辑|苗正卿
头图|视觉中国
这是进击的独角兽第31篇,,该系列关注月之暗面、智谱、MiniMax、阶跃星辰、零一万物、百川智能、面壁智能和DeepSeek共8家大模子独角兽公司。。。
梁文锋的热度一直在AI圈的Top级,,尤其是今年。。。
从V4预览版宣布,,到厥后的融资与IPO听说,,再到一份撒播甚广的四小时谈话实录,,DeepSeek的每一次行动,,都能迅速成为行业话题。。。
7月31日下昼,,DeepSeek又更新了。。。
这次,,DeepSeek只是在API文档的更新日志里宣布,,V4-Flash正式版API上线公测。。。
从“正式版”和“公测”两个词同时泛起来看,,这并不是V4的最终形态。。。DeepSeek也特意强调,,本次更新只涉及V4-Flash的API,,V4-Pro及App、Web端模子均未爆发转变,,V4-Pro正式版还要再等等。。。
但这次更新依然值得关注。。。
从最新版原来看,,V4-Flash-0731没有改变模子架构和参数规模,,只重新举行了一次后训练。。。更新后,,DeepSeek把险些所有篇幅都用来强调它在Agent,,尤其是Code Agent上的前进。。。
这意味着,,V4-Flash并不是一次简朴的模子更新。。。
DeepSeek正在实验回覆一个新的问题:到了Agent阶段,,一家公司最需要的,,事实是一个能力最强的模子,,照旧一个足够强、足够快,,也足够自制的模子?????
这一次,,DeepSeek没有继续堆参数
V4-Flash并不是7月31日才第一次泛起。。。
4月24日,,DeepSeek宣布V4预览版时,,已经同时推出V4-Pro和V4-Flash。。。两者都是MoE模子,,但体量差别显着:V4-Pro拥有1.6万亿总参数,,每次推理激活49B参数;;;V4-Flash拥有284B总参数,,每次只激活13B参数。。。两款模子均支持100万Token上下文。。。
在DeepSeek的定位里,,Pro认真能力上限,,Flash认真效率。。。
参数规模更大的V4-Pro,,在天下知识以及高难度Agent使命上体现更好;;;V4-Flash则可以通过增添思索预算,,在部分推理使命上靠近Pro。。。;;痪浠八担,Flash牺牲了一部分知识容量,,却用更小的激活参数换来了速率和本钱。。。
7月31日的更新没有改变这套架构。。。
DeepSeek明确体现,,V4-Flash-0731与预览版的模子结构、尺寸完全一致,,仅重新举行了后训练。。。
但就是这次后训练,,让V4-Flash的Agent能力泛起了显着转变。。。
凭证DeepSeek宣布的效果,,V4-Flash-0731在Terminal Bench 2.1上抵达82.7,,在NL2Repo上抵达54.2,,在DeepSWE上抵达54.4,,在Toolathlon Verified上抵达70.3。。。DeepSeek称,,这些效果已经大幅凌驾V4-Pro预览版。。。
这件事的意义在于,,DeepSeek没有通过增添参数和重新预训练,,来提高模子的Agent能力。。。
用通俗的话来讲就是,,DeepSeek虽然继续在追求AGI,,可是并没有通过一味地增添参数来实现这件事情,,而是让模子学会更好地拆解使命、挪用工具、执行代码,,并在更长的使命轨迹中镌汰过失。。。
已往,,大模子公司的主要竞争爆发在预训练阶段。。。谁有更多算力、更大都据,,谁就有时机训练出参数更大、知识更多的模子。。。但进入Agent阶段后,,模子能力不再完全由预训练决议。。。
一个模子会不会使用终端,,能不可在数百次交互中维持使命状态,,遇到过失后能否修正,,以及是否知道什么时间应该挪用什么工具,,这些能力越来越依赖后训练、强化学习和模子外部的执行框架。。。
V4-Flash的转变,,恰恰说明晰这一点。。。
这也是为什么,,DeepSeek这次除了更新模子,,还原生支持了Responses API,,并专门适配Codex。。。同时,,DeepSeek在测试Code Agent使命时,,使用了尚未正式宣布的DeepSeek Harness minimal mode。。。
换句话说,,这些Agent效果不完全属于模子自己,,而是属于“模子、推理预算与Harness”配合组成的系统。。。
这虽然也意味着,,现在宣布的数据仍需审慎看待。。。
一方面,,部分效果来自DeepSeek内部测试集;;;另一方面,,DeepSeek Harness尚未果真,,外界还无法在完全相同的情形下复现这些效果。。。正式版V4-Flash事实比预览版前进了几多,,还需要期待自力评测以及真实开发场景验证。。。
但至少从这次更新可以看出,,DeepSeek正在从只提供模子和API,,向Agent所需要的执行情形多走一步。。。
但DeepSeek现在还没有亲自做一个完整的Agent产品,,却最先提供让模子进入Agent事情流所必需的接口、适配和Harness。。。
这是一种非????Uト〉牟坊!。
为什么是Flash?????
既然V4-Pro的能力上限更高,,DeepSeek为什么不先更新Pro?????
最直接的原因是,,Agent并不是一次模子挪用。。。
在谈天机械人阶段,,用户提出一个问题,,模子天生一次谜底,,一次交互就竣事了。。。但在Agent使命里,,模子需要先明确目的,,再拆解使命、检索信息、挪用工具、读取效果、修正过失,,最后完成交付。。。
一个重大使命,,可能包括几十次甚至数百次模子挪用。。。
这时,,模子单次推理增添的本钱和延迟,,会在整个使命轨迹中被一直放大。。。一个能力更强、但速率更慢、本钱更高的模子,,未必能带来更好的现实效果。。。
Agent真正需要的,,往往不是每一步都挪用能力最强的模子,,而是在绝大大都方法中,,使用一个能力足够、价钱更低、响应更快的模子。。。
这正是V4-Flash的价值。。。
凭证DeepSeek手艺报告,,在100万Token上下文下,,V4-Flash单Token推理所需的盘算量,,约为V3.2的10%,,KV Cache则约为V3.2的7%。。。它的总参数只有V4-Pro的约六分之一,,每次激活参数也只有Pro的约四分之一。。。
这种差别最终也体现在API定价上。。。
现在,,V4-Flash每百万Token未掷中缓存的输入价钱为1元,,输出价钱为2元;;;V4-Pro划分为3元和6元。。。V4-Flash的并发限制为2500,,Pro则为500。。。Responses API现在也只有V4-Flash支持,,V4-Pro预计到8月初才会接入。。。
在V4的产品系统里,,Pro认真证实DeepSeek的模子能力能够抵达什么位置,,Flash则认真肩负真正高频、长链条的Agent使命。。。前者是能力模子,,后者更像生产模子。。。
梁文锋曾在内部果真说道,,“模子应该放在相同本钱下较量;;;在现阶段,,Coding Agent的优先级高于其他笔直Agent。。。”
从这个角度来看,,V4-Flash此次更新的偏向,,确实与这两个判断形成了呼应。。。
DeepSeek没有选择通过扩大参数,,让Flash在所有能力上追上Pro;;;它选择在模子架构稳固的情形下,,通事后训练和Agent框架,,提高Flash完成真实使命的能力。。。
这背后是一种更现实的盘算。。。
若是Agent最终要进入企业和开发者的日常事情流,,那么决议模子能否被大规模使用的,,不但是Benchmark,,而是完成一个使命需要几多时间、消耗几多Token,,以及最终乐成率是几多。。。
不过,,这也是V4-Flash现在最需要证实的地方。。。
DeepSeek宣布的Agent效果大多使用Max reasoning effort完成。。。更高的思索强度通常意味着更长的推理历程和更多Token消耗。。。一个模子每百万Token的价钱很低,,不即是完成一项使命的总本钱一定更低。。。
若是V4-Flash需要消耗更多Token才华抵达靠近Pro的效果,,那么它在单价上的优势,,可能会被更长的使命轨迹部分抵消。。。
因此,,真正有价值的比照,,不是V4-Flash在某一项Benchmark上凌驾了谁,,而是在完成统一个Agent使命时,,它与V4-Pro、Kimi、GLM以及闭源模子划分需要几多Token、几多时间和几多次重试。。。
DeepSeek暂时还没有给出这个谜底。。。
本文来自虎嗅,,原文链接:https://www.huxiu.com/article/4879740.html?f=wyxwapp