凯时AG

2026-07-24 15:57:48 设为首页 | 加入珍藏

GPT-5.6中档模子封神,,,最贵版尴尬翻车

2026-07-24 15:57:48 宣布 泉源:爱游戏 作者:吴刚睿 浏览:3001次

出品 | 网易智能

作者 | 辰辰

编辑 | 王凤枝

OpenAI说,,,GPT-5.6的要害词是"效率" 。。。。。

社区测了一天,,,算出了三个谜底 。。。。。

Terra意外出圈;;Sol稳,,,但谈不上革命;;最耗资源的Ultra,,,却在一组物理测试里花了GPT-5.5三倍的钱,,,效果还更差 。。。。。

7月10日,,,OpenAI周全开放GPT-5.6系列:Sol、Terra和Luna 。。。。。一起上线的尚有ChatGPT Work,,,OpenAI把Codex的部分能力带进ChatGPT桌面端,,,直接对标Claude Cowork 。。。。。

两周前,,,GPT-5.6还因网络清静问题,,,只向少数经美国政府批准的机构开放 。。。。。

现在限制扫除,,,用户只体贴一件事:

多花出去的token,,,究竟有没有换来更好的效果??????

一、被低估的谁人

第一波体验中,,,一个容易被忽略的名字最先泛起:Terra 。。。。。

有人用Terra跑了钟表制造测试,,,天生完整的瑞士杠杆擒纵机构三维模子 。。。。。真实的齿轮比、可事情的擒纵、呼吸式游丝,,,指针真的在走时 。。。。。然后它自己检查了力学和视觉接触点,,,重复迭代直到整个机芯稳固 。。。。。

评测者的原话:"感受很是靠近 Mythos级别的模子 。。。。。"

Terra 的官方定价:输入每百万 token 2.5美元,,,输出15美元 。。。。。按 OpenAI 官方估算,,,在考察长程专业事情流的 Agents' Last Exam 中,,,Terra 和 Luna 以约十六分之一的本钱凌驾了 Fable 5 。。。。。

这不是 Sol 。。。。。这是中心那档 。。。。。

Notion 联合首创人西蒙·拉斯特(Simon Last)在官方通告中的评价更直接:"许多跑在 GPT-5.5上的智能体,,,换到 Terra 上体现一样好,,,本钱减半,,,token 消耗少16% 。。。。。"

对 Sol 自己的评价,,,社区要冷静得多 。。。。。

手艺大 V Jun Song 是活跃在 X 上的开源 AI 开发者,,,他的总结被大宗转发:"不是 Fable 那样的全新架构 。。。。。只是基于 GPT-5.5的一次扎实升级 。。。。。三个月等来的更新,,,谈不上革命 。。。。。"但他加了一句:"仍然是订阅妄想里能用到的最好的模子 。。。。。"

另一个撒播更广的比喻来自 Every 公司的联合首创人兼 CEO 丹·希珀(Dan Shipper),,,他发帖称:"GPT-5.6像保时捷,,,Fable 5像曲速引擎 。。。。??????缧窍涤 Fable 。。。。。日常通勤用5.6 。。。。。"

前端设计有这样一个详细数字 。。。。。在 Triple Whale 的七项基准测试中,,,Sol 得分4.4,,,GPT-5.5是4.0,,,Claude 4.8是3.5 。。。。。从电商页面到仪表盘,,,一连交付完整、响应式的界面 。。。。。每一项都恰恰够好 。。。。。这恰恰是"日常通勤"所需要的:不是最快的车,,,是最不会让你迟到的车 。。。。。

这是一个比"倾覆性"更忠实的定位 。。。。。Sol 不是来推翻 Fable 的 。。。。。它是来让更多人在更多场景下用得起够好的 AI 。。。。。

听起来像是精准的市场定位 。。。。。

更准确地说,,,OpenAI 没有在所有场景里和 Fable 硬拼极限能力,,,而是把重点放在性能、速率和本钱的平衡上 。。。。。

但也有人差别意 Terra 的好评 。。。。。有用户看了 Artificial Analysis 的性价比曲线图后直接谈论:"看不出用 Terra 的理由 。。。。。Luna 或 Sol 在整条线上都是更好的选择 。。。。。"

二、Ultra 的翻车现场

若是 GPT-5.6的故事到此为止,,,它是清洁的 。。。。。效率提升,,,定位清晰,,,社区大都人颔首 。。。。。

但至少在一组 HTML5物理演示测试里,,,Ultra 翻车了 。。。。。

Atomic Chat 项目团队跑了一组 HTML5物理演示测试 。。。。。四个模子,,,统一个提醒词:天生三个自包括的物理场景,,,怪物卡车后空翻落车顶、特技车飞跃六辆大巴撞墙、火车脱轨坠桥入水 。。。。。

效果如下:

三倍的价钱 。。。。。更差的效果 。。。。。

依据这个账单,,,测试者的结论不留人情:"Sol Ultra 绘图跟 GPT-5.5一样,,,只是细节更多 。。。。。物理真的变弱了 。。。。。实质上是 GPT-5.5加更弱的物理和更悦目的画面,,,收你三倍的钱 。。。。。"

OpenAI 对 Ultra 的界说是"协调多个智能体并行事情",,,默认四个智能体同时跑,,,用更多 token 换更强效果和更快交付 。。。。。

逻辑上说得通 。。。。。

但物理测试揭开了逻辑裂痕:多智能体协调自己消耗 token 。。。。。若是协调没有让最终输出更好,,,用户就是在花钱买更多内部讨论,,,而不是更好的效果 。。。。。

AI 领域意见首脑罗翰·保罗(Rohan Paul)转述了这项测试,,,并增补了手艺诠释:"物理演示袒露了通俗编码基准隐藏的弱点 。。。。。一个模子可以花更多 token 形貌更富厚的场景,,,却仍在难的部分失败:维持力、动量、碰撞时机和跨帧的可信物体行为 。。。。。"

虽然,,,需要说明的是,,,这组测试选的是物理模拟,,,一个需要全局一致性的使命类型 。。。。。Ultra 的多智能体架构在可拆分的并行使命上可能体现差别 。。。。。但物理测试恰恰袒露了它的结构性弱点:当使命不可拆分时,,,更多智能体不即是更好效果 。。。。。

并且烧掉的更多 token,,,是用户在付钱 。。。。。

三、模子还没用熟,,,下一代听说已经来了

GPT-5.6宣布当天,,,X 上已经最先撒播 GPT-6可能很快到来的新闻 。。。。。相关听说尚未获得 OpenAI 确认,,,其宣布时间和手艺蹊径也都没有可靠结论 。。。。。

但听说自己仍然击中了开发者的一种真实焦虑:模子迭代越来越快,,,为一个新模子调解提醒词、参数和事情流之后,,,这套适配事实能使用多久??????

一位用户问:"人们还没时间真正用上5.6,,,已经在谈6了 。。。。。这不就让整个5.6系列显得毫无意义??????"

这个判断未必公正 。。。。。新模子泛起,,,也不料味着旧模子连忙失去价值 。。。。。

但对企业来说,,,模子效率不可只算每百万 token 的价钱 。。。。。切换模子、重新测试界线、修改提醒词和迁徙事情流,,,同样都是本钱 。。。。。

模子省下的钱,,,只有在它被稳固使用足够长时间后,,,才真正算数 。。。。。

四、效率牌,,,打给谁看

GPT-5.6的效率故事,,,有两个观众 。。。。。

一个是开发者社区 。。。。。他们在跑分、比价、算性价比 。。。。。结论是破碎的 。。。。。Ultra 不值,,,Sol 够用,,,Terra 吵得最凶 。。。。。有人说它靠近 Mythos,,,有人说它在性价比曲线上没有保存理由 。。。。。两种判断同时建设,,,由于测的不是统一件事 。。。。。

另一个是华尔街 。。。。。

OpenAI 已神秘提交 IPO 招股书 。。。。。CNBC 和《纽约时报》的最新报道显示,,,其私募市场估值约为8520亿美元,,,并且 OpenAI 正在追求1万亿美元的 IPO 估值 。。。。。Anthropic 在5月完成新一轮融资,,,据《卫报》其时的报道,,,估值抵达9650亿美元,,,由此成为全球最有价值的 AI 公司 。。。。。两家都在抢上市窗口 。。。。。

"更好或持平,,,但更自制",,,这是说给企业 CFO 听的,,,不是说给开发者听的 。。。。。 CFO 体贴单位智能本钱,,,开发者体贴极端场景下的体现 。。。。。两种人体贴的不是统一件事 。。。。。

而在 GPT-5.6宣布当天,,,三个外围行动让"效率"这张牌更显拥挤 。。。。。

GPT-5.6宣布后,,,Anthropic 也宣布调解 Claude 的周度费率 。。。。。有用户将这一时间点解读为对 OpenAI 新行动的回应 。。。。。

科技剖析师、AI 领域大 V 金·艾森伯格(Kim Isenberg)的说辞一针见血:"态度很明确了 。。。。。"

Meta 同日宣布 Muse Spark 1.1 。。。。。SpaceX 前一天发了 Grok 4.5 。。。。。统一周,,,四家公司有大行动 。。。。。

效率不是 OpenAI 的独家故事 。。。。。它是全行业的价钱战 。。。。。 OpenAI 说"我们效率高",,,翻译一下:别去找更自制的替换品 。。。。。

GPT-6的幽灵在上面飘着 。。。。。你刚买的模子,,,可能下个月就过时了 。。。。。效率是时间的函数,,,你得用够久,,,省下的钱才算数 。。。。。

五、那道线

回到社区评测 。。。。。

把24小时的数据放在一起看,,,GPT-5.6的画像比官方博客重大,,,也更忠实 。。。。。

第一,,,Terra 是最被低估的一款 。。。。。 靠近 Mythos 级的体现,,,十六分之一的价钱 。。。。。若是 OpenAI 的定价让你疑心,,,为什么 Terra 夹在 Sol 和 Luna 中心似乎没有保存感,,,Terra 的保存自己就是诠释 。。。。。它证实晰效率提升是真实的,,,只是不在你最先关注的谁人型号上 。。。。。

第二,,,Sol 是清静的选择,,,不是革命的选择 。。。。。 "保时捷不是曲速引擎"被撒播得这么快,,,由于它精准地绕过了官方叙事的强调,,,给了一个用户能用的定位:日常通勤的最优解 。。。。。

第三,,,Ultra 的物理测试至少袒露了一个问题:多智能体并行并不会自动带来更好的效果 。。。。。 在需要维持统一物理规则和跨帧一致性的使命里,,,协调本钱可能抵消并行收益 。。。。。这不是对多智能体蹊径的否认,,,而是提醒用户:Ultra 适合什么使命,,,仍需要按场景验证 。。。。。

第四,,,GPT-6的幽灵悬在整个5.6系列上空 。。。。。 这是效率叙事最深的矛盾:你告诉我这个模子很省、很值,,,但我也知道你可能下个月就让它过时 。。。。。

社区翻完 GPT-5.6的第一天账单,,,谜底不是"好"或者"坏" 。。。。。

而是统一个"效率",,,在差别使命里算出了差别效果 。。。。。

OpenAI 算的是基准效果、token 消耗和预估本钱;;开发者算的是详细使命能不可一次做对;;企业最终要算的,,,则是切换模子、重新适配和恒久运行之后的总账 。。。。。

GPT-5.6的效率提升是真的 。。。。。但它不是统一的、周全的,,,也不是换上新模子就会自动兑现 。。。。。

Terra 在部分事情流里显示出了很强的性价比;;Sol 提供了更稳妥的性能与本钱平衡;;Ultra 则需要更挑使命,,,多花的 token,,,必需换来足够好的效果,,,才算效率 。。。。。

归根结底,,,模子变得更自制,,,不即是使命一定做得更省 。。。。。

真正有意义的效率,,,仍然只有一种:花更少的钱,,,把事情做完,,,还不必返工 。。。。。

“中俄美食文化月”同步开启,,,40其中俄特色主题摊位搜集两国风味美食,,,包括滚烫的俄式大肉串、酸甜的红菜汤、隧道的俄式煎饺、鲜美的大马哈鱼等俄罗斯美食,,,以及大绥冰棍、哈尔滨红肠、老北京水爆肚等中国美食,,,令游客大快朵颐 。。。。。

责任编辑:林佳慧    校对:戴火劭

今日热门

  1. 土耳其男子近身射击一发未中
  2. 广西武警官兵全力清淤复家园 全身泥浆的他们真帅 致敬人民子弟兵
  3. 中国官方连打三“虎” 中南大学原校长张尧学被“双开”
  4. 水师:东海砺兵 战舰编队跨昼夜实战淬锋芒
  5. 受降雨影响 国铁北京局部分列车接纳停运步伐
  6. 2026年第一批“中国好人榜”宣布
  7. 从已往探寻未来
  8. 电车车主最怕的事是去4S店修车
  9. 闽北百年涉台古厝修旧如旧延续两岸文脉
  10. 山东荣成:“海上夏耕”一派忙碌

相关推荐

【网站地图】