出品|虎嗅科技组
作者|宋思杭
编辑|苗正卿
头图|视觉中国
这是进击的独角兽第31篇,,,,,该系列关注月之暗面、智谱、MiniMax、阶跃星辰、零一万物、百川智能、面壁智能和DeepSeek共8家大模子独角兽公司。。。
梁文锋的热度一直在AI圈的Top级,,,,,尤其是今年。。。
从V4预览版宣布,,,,,到厥后的融资与IPO听说,,,,,再到一份撒播甚广的四小时谈话实录,,,,,DeepSeek的每一次行动,,,,,都能迅速成为行业话题。。。
7月31日下昼,,,,,DeepSeek又更新了。。。
这次,,,,,DeepSeek只是在API文档的更新日志里宣布,,,,,V4-Flash正式版API上线公测。。。
从“正式版”和“公测”两个词同时泛起来看,,,,,这并不是V4的最终形态。。。DeepSeek也特意强调,,,,,本次更新只涉及V4-Flash的API,,,,,V4-Pro及App、Web端模子均未爆发转变,,,,,V4-Pro正式版还要再等等。。。
但这次更新依然值得关注。。。
从最新版原来看,,,,,V4-Flash-0731没有改变模子架构和参数规模,,,,,只重新举行了一次后训练。。。更新后,,,,,DeepSeek把险些所有篇幅都用来强调它在Agent,,,,,尤其是Code Agent上的前进。。。
这意味着,,,,,V4-Flash并不是一次简朴的模子更新。。。
DeepSeek正在实验回覆一个新的问题:到了Agent阶段,,,,,一家公司最需要的,,,,,事实是一个能力最强的模子,,,,,照旧一个足够强、足够快,,,,,也足够自制的模子?????
这一次,,,,,DeepSeek没有继续堆参数
V4-Flash并不是7月31日才第一次泛起。。。
4月24日,,,,,DeepSeek宣布V4预览版时,,,,,已经同时推出V4-Pro和V4-Flash。。。两者都是MoE模子,,,,,但体量差别显着:V4-Pro拥有1.6万亿总参数,,,,,每次推理激活49B参数;;;;;V4-Flash拥有284B总参数,,,,,每次只激活13B参数。。。两款模子均支持100万Token上下文。。。
在DeepSeek的定位里,,,,,Pro认真能力上限,,,,,Flash认真效率。。。
参数规模更大的V4-Pro,,,,,在天下知识以及高难度Agent使命上体现更好;;;;;V4-Flash则可以通过增添思索预算,,,,,在部分推理使命上靠近Pro。。。唬;;;痪浠八,,,,,Flash牺牲了一部分知识容量,,,,,却用更小的激活参数换来了速率和本钱。。。
7月31日的更新没有改变这套架构。。。
DeepSeek明确体现,,,,,V4-Flash-0731与预览版的模子结构、尺寸完全一致,,,,,仅重新举行了后训练。。。
但就是这次后训练,,,,,让V4-Flash的Agent能力泛起了显着转变。。。
凭证DeepSeek宣布的效果,,,,,V4-Flash-0731在Terminal Bench 2.1上抵达82.7,,,,,在NL2Repo上抵达54.2,,,,,在DeepSWE上抵达54.4,,,,,在Toolathlon Verified上抵达70.3。。。DeepSeek称,,,,,这些效果已经大幅凌驾V4-Pro预览版。。。
这件事的意义在于,,,,,DeepSeek没有通过增添参数和重新预训练,,,,,来提高模子的Agent能力。。。
用通俗的话来讲就是,,,,,DeepSeek虽然继续在追求AGI,,,,,可是并没有通过一味地增添参数来实现这件事情,,,,,而是让模子学会更好地拆解使命、挪用工具、执行代码,,,,,并在更长的使命轨迹中镌汰过失。。。
已往,,,,,大模子公司的主要竞争爆发在预训练阶段。。。谁有更多算力、更大都据,,,,,谁就有时机训练出参数更大、知识更多的模子。。。但进入Agent阶段后,,,,,模子能力不再完全由预训练决议。。。
一个模子会不会使用终端,,,,,能不可在数百次交互中维持使命状态,,,,,遇到过失后能否修正,,,,,以及是否知道什么时间应该挪用什么工具,,,,,这些能力越来越依赖后训练、强化学习和模子外部的执行框架。。。
V4-Flash的转变,,,,,恰恰说明晰这一点。。。
这也是为什么,,,,,DeepSeek这次除了更新模子,,,,,还原生支持了Responses API,,,,,并专门适配Codex。。。同时,,,,,DeepSeek在测试Code Agent使命时,,,,,使用了尚未正式宣布的DeepSeek Harness minimal mode。。。
换句话说,,,,,这些Agent效果不完全属于模子自己,,,,,而是属于“模子、推理预算与Harness”配合组成的系统。。。
这虽然也意味着,,,,,现在宣布的数据仍需审慎看待。。。
一方面,,,,,部分效果来自DeepSeek内部测试集;;;;;另一方面,,,,,DeepSeek Harness尚未果真,,,,,外界还无法在完全相同的情形下复现这些效果。。。正式版V4-Flash事实比预览版前进了几多,,,,,还需要期待自力评测以及真实开发场景验证。。。
但至少从这次更新可以看出,,,,,DeepSeek正在从只提供模子和API,,,,,向Agent所需要的执行情形多走一步。。。
但DeepSeek现在还没有亲自做一个完整的Agent产品,,,,,却最先提供让模子进入Agent事情流所必需的接口、适配和Harness。。。
这是一种非????Uト〉牟坊。。。
为什么是Flash?????
既然V4-Pro的能力上限更高,,,,,DeepSeek为什么不先更新Pro?????
最直接的原因是,,,,,Agent并不是一次模子挪用。。。
在谈天机械人阶段,,,,,用户提出一个问题,,,,,模子天生一次谜底,,,,,一次交互就竣事了。。。但在Agent使命里,,,,,模子需要先明确目的,,,,,再拆解使命、检索信息、挪用工具、读取效果、修正过失,,,,,最后完成交付。。。
一个重大使命,,,,,可能包括几十次甚至数百次模子挪用。。。
这时,,,,,模子单次推理增添的本钱和延迟,,,,,会在整个使命轨迹中被一直放大。。。一个能力更强、但速率更慢、本钱更高的模子,,,,,未必能带来更好的现实效果。。。
Agent真正需要的,,,,,往往不是每一步都挪用能力最强的模子,,,,,而是在绝大大都方法中,,,,,使用一个能力足够、价钱更低、响应更快的模子。。。
这正是V4-Flash的价值。。。
凭证DeepSeek手艺报告,,,,,在100万Token上下文下,,,,,V4-Flash单Token推理所需的盘算量,,,,,约为V3.2的10%,,,,,KV Cache则约为V3.2的7%。。。它的总参数只有V4-Pro的约六分之一,,,,,每次激活参数也只有Pro的约四分之一。。。
这种差别最终也体现在API定价上。。。
现在,,,,,V4-Flash每百万Token未掷中缓存的输入价钱为1元,,,,,输出价钱为2元;;;;;V4-Pro划分为3元和6元。。。V4-Flash的并发限制为2500,,,,,Pro则为500。。。Responses API现在也只有V4-Flash支持,,,,,V4-Pro预计到8月初才会接入。。。
在V4的产品系统里,,,,,Pro认真证实DeepSeek的模子能力能够抵达什么位置,,,,,Flash则认真肩负真正高频、长链条的Agent使命。。。前者是能力模子,,,,,后者更像生产模子。。。
梁文锋曾在内部果真说道,,,,,“模子应该放在相同本钱下较量;;;;;在现阶段,,,,,Coding Agent的优先级高于其他笔直Agent。。。”
从这个角度来看,,,,,V4-Flash此次更新的偏向,,,,,确实与这两个判断形成了呼应。。。
DeepSeek没有选择通过扩大参数,,,,,让Flash在所有能力上追上Pro;;;;;它选择在模子架构稳固的情形下,,,,,通事后训练和Agent框架,,,,,提高Flash完成真实使命的能力。。。
这背后是一种更现实的盘算。。。
若是Agent最终要进入企业和开发者的日常事情流,,,,,那么决议模子能否被大规模使用的,,,,,不但是Benchmark,,,,,而是完成一个使命需要几多时间、消耗几多Token,,,,,以及最终乐成率是几多。。。
不过,,,,,这也是V4-Flash现在最需要证实的地方。。。
DeepSeek宣布的Agent效果大多使用Max reasoning effort完成。。。更高的思索强度通常意味着更长的推理历程和更多Token消耗。。。一个模子每百万Token的价钱很低,,,,,不即是完成一项使命的总本钱一定更低。。。
若是V4-Flash需要消耗更多Token才华抵达靠近Pro的效果,,,,,那么它在单价上的优势,,,,,可能会被更长的使命轨迹部分抵消。。。
因此,,,,,真正有价值的比照,,,,,不是V4-Flash在某一项Benchmark上凌驾了谁,,,,,而是在完成统一个Agent使命时,,,,,它与V4-Pro、Kimi、GLM以及闭源模子划分需要几多Token、几多时间和几多次重试。。。
DeepSeek暂时还没有给出这个谜底。。。
本文来自虎嗅,,,,,原文链接:https://www.huxiu.com/article/4879740.html?f=wyxwapp