凯时AG

GPT5.6吞了Codex

作者:赖欣怡
宣布时间:2026-07-23 05:52:28
阅读量:1603

GPT5.6吞了Codex

出品|虎嗅科技组

作者|余杨

编辑|苗正卿

头图|视觉中国

7月10日新闻,,,,OpenAI 正式推出 GPT-5.6 系列模子,,,,包括新旗舰模子 Sol,,,,适合日常事情的平衡模子 Terra,,,,以及最具本钱效益的模子Luna 。。。。。

在这次宣布的主题中,,,,OpenAI 重点强调了智能的尖端、动态的生长和自身的协作性 。。。。。以及一个醒目的细节:它直接将性价比打在了公屏上 。。。。。

“每个代币都能带来更多智能,,,,每美元能带来更强的性能,,,,并可凭证您的最难题事情需求提供更多功效 。。。。。”

模子试图丝滑进入你的事情

在已往的几个周,,,,GPT-5.6 在天下的各个角落被差别水平地使用 。。。。。使用者包括日本的农场主Hiroki 和纽约的一个三口之家 。。。。。Ian 、Margaret以及他们的儿子Alice在起居室里使用GPT-5.6完成一系列的事情 。。。。。别的尚有波兰的数学领域,,,,Batosz用GPT-5.6 解决无法解决的问题 。。。。。

宣传片最先于日本北海道的一个农场,,,,农场主 Hiroki 正在通过GPT-5.6治理温室 。。。。。他说,,,,“我不是一个工程师,,,,但我已经在使用Codex来使事情更有用率了 。。。。。”他使用GPT-5.6翻开和关闭温室:“人们已往手动把温室侧面的塑料薄膜卷起来透风 。。。。。”但现在,,,,GPT-5.6 资助妄想多年的采购,,,,妥善安排维修以及装置它们,,,,并且它确实有用 。。。。。

Hiroki 体现,,,,GPT-5.6 处理prompt并且一直跟进到效果 。。。。。“使用之前的模子,,,,我不得不重复做提升,,,,给出新说明,,,,现在,,,,使用单个prompt,,,,它能读取整个对话线索,,,,选择准确的工具,,,,自主判断并完成使命直到竣事 。。。。。这是一个难以置信的转变 。。。。。”

GPT-5.6同样在一些小事情上资助人们 。。。。。Jake 在“Three Wishes”团队事情,,,,这是一个美国早餐麦片品牌,,,,由 Ian 和 Margaret Wishingrad 于2019年配合建设,,,,主打康健、无谷物、高卵白的麦片产品,,,,目的人群为注重营养与口感的消耗者 。。。。。其产品线包括多种口胃,,,,如“Fruity”、“Cocoa”等,,,,强调“Sneaky Delicious, Sneaky Nutritious”,,,,即在鲜味中隐藏营养 。。。。。

已往,,,,“Three Wishes”由 Ian 和Margaret自己重新到尾运营 。。。。。Jake展示了怎样对模子举行提醒 。。。。。

他使用GPT-5.6 完成一个安排开发销售仪表盘的使命 。。。。。首先,,,,他给出了一个销售仪表盘的组件,,,,要求从六个差别的零售商那里抓取数据,,,,拉取这些数据后,,,,还要建设一个Codex 自动化程序,,,,把它牢靠在谈天里,,,,让它每小时同步并拉取一次这些信息,,,,这样 Margaret 就能拥有一个实时更新的数据仪表盘 。。。。。他们即将有一个新产品宣布,,,,因此需要把这次新宣布的品牌素材以及新包装盒的图片拉取进来,,,,确保仪表盘能反映出这些内容 。。。。。

GPT-5.6 在五分钟内制订了妄想 。。。。。它拉取了相关的数据,,,,包括品牌等等,,,,以及可使用的润色版本,,,,设计了演示环节和撒播表格 。。。。。

GPT-5.6也能资助科研职员做一些新发明 。。。。。在波兰的波兹南,,,,Batosz在统一个数学难题上泯灭了3年,,,,但解决不了它,,,,新Codex的到来资助了他 。。。。。“Codex能够提出新点子,,,,也能资助演算和证实,,,,解决了三年来没有解决的问题 。。。。。” GPT-5.6可以划分要害协作事项,,,,匹配差别事情流,,,,从而解决差别部分的问题 。。。。。“新发明让他感应很兴奋” 。。。。。

宣传片想要表达,,,,GPT-5.6 使事情不但仅停留在屏幕上,,,,而是进入到现实的天下,,,,从生涯中的小事情到农场主的事情,,,,再到最好的数学研究领域,,,,大模子正在实验进入每一件事 。。。。。

GPT-5.6 的效果单

GPT-5.6 Sol 在智能和效率方面均有大幅提升 。。。。。尤其是在编码、知识事情、网络清静和科学等领域,,,,消耗更少的token,,,,完成更重大的使命,,,,性价比极高 。。。。。它的特点在于,,,,协调多个署理在并行事情流中运行,,,,这种成熟的协作能力使它能够检查、刷新并交付可直接使用的效果,,,,从而逾越了以往的同类前沿模子 。。。。。

在对 55 个领域恒久运行的专业事情流程举行评估后,,,,GPT-5.6 Sol 创下 53.6 的新高,,,,比 Claude Fable 5(自顺应推理)横跨 13.1 分 。。。。。纵然在中等推理水平下,,,,它也比 Fable 5 横跨 11.4 分,,,,而本钱约为其预估本钱的四分之一 。。。。。这种效率也体现在更小的模子上,,,,而这些模子关于实现更富厚、更经济的智能至关主要:GPT-5.6 Terra 和 GPT-5.6 Luna 的性能优于 Fable 5,,,,而本钱约为其十六分之一 。。。。。

在人工智能剖析智能指数(AII)上(在新窗口中翻开)GPT-5.6 Sol 的推理能力涵盖了智能的普遍权衡标准,,,,包括自主事情、编码、科学推理和一般能力 。。。。。其推理能力最高时,,,,得分仅比 Fable 5 低 1 分,,,,完成使命的时间镌汰了 61%,,,,本钱也只有预估本钱的一半左右 。。。。。

GPT-5.6 Sol 在人工智能剖析编码署理指数 (ACI) 上取得了 80 分的全新最佳效果,,,,比 Fable 5 横跨 2.8 分,,,,同时输出标记数目不到 Fable 5 的一半,,,,运行时间不到一半,,,,本钱也降低了约三分之一 。。。。。

不但云云,,,,在整个GPT-5.6 系列模子中,,,,Terra 的性能也略高于 Fable 5,,,,而 Luna 的性能优于 Opus 4.8;;;;它们的运行时间划分约为 Fable 5 的三分之一,,,,输出标记数目约为其一半,,,,本钱约为其预估本钱的四分之一 。。。。。

别的,,,,GPT-5.6 Sol 在 Terminal-Bench 2.1 和 DeepSWE 测试中也取得了新的最佳效果,,,,这两个测试旨在评估真实代码库中重大的下令行事情流和恒久工程 。。。。。

同时,,,,GPT-5.6 可以编写和运行轻量级程序,,,,协调种种工具、处理中心效果、监控进度,,,,并在事情举行历程中选择下一步操作 。。。。。这使得工具麋集型使命能够以更少的标记、更少的模子往返次数和更少的指导推进 。。。。。宣传片中的北海道农场和“Three Wishes”麦片公司都用到了这个功效 。。。。。

开发者不需要编写每个方法的剧本或将每个工具响应都转达给模子,,,,仅仅挪用程序化工具就可以实现这一点 。。。。。响应 API 可以过滤大宗中心数据,,,,只保存主要信息,,,,并在此历程中调解其事情流程 。。。。。

关于那些需要投入更多时间和盘算资源才华解决的问题,,,,GPT-5.6 可以逾越这种高效的默认设置,,,,并行协调四个智能体,,,,以更高的令牌消耗换取更优的效果和更快的响应速率 。。。。。以下是较量了 ultra 的默认四智能体设置与单智能体基准在 BrowseComp(浏览盘算)、SEC-Bench Pro 和 Terminal-Bench 2.1 上的体现;;;;

在所有三个评估中,,,,添加并行智能体都会使得分-延迟曲线向上向左移动,,,,从而在更短的时间内获得更优的效果 。。。。。

这也就不难明确,,,,GPT-5.6获得了包括来自CURSOR、qodo、Notion、Cognition等公司的开发者的一众好评 。。。。。

要知识,,,,还要漂亮

与此同时,,,,GPT-5.6 在设计判断方面实现了质的飞跃 。。。。。

它能够检查和优化渲染效果——而不但仅是天生底层代码或内容——从而发明视觉和功效上的问题,,,,并在最终交付作品前举行润色 。。。。。其前端功效还可以将自然语言请求转换为 ChatGPT Work 中细腻的交互式诠释和可视化效果 。。。。。

在知识型事情方面,,,,它的优势体现在涵盖恒久专业剖析、浏览、工具使用和盘算机使用的各项评估中 。。。。。

GPT-5.6 Sol 在BrowseComp和OSWorld 2.0测试中划分取得了92.2% 和62.6%的优异效果;;;;在 OSWorld 测试中,,,,它逾越了 Opus 4.8,,,,同时输出令牌数目镌汰了 85% 。。。。。

这一系列的性价比优势也十分显著 。。。。。Luna 的性能险些抵达了 GPT-5.5 的峰值水平,,,,而本钱却不到其一半;;;;Terra 的性能则更胜一筹,,,,且本钱更低 。。。。。

这带来的效果是,,,,当使用模板和参考资料时,,,,提高尤为显著 。。。。。

GPT-5.6 可以推断出资料的设计系统——结构、字体、间距、颜色和重复泛起的内容模式(包括嵌入在幻灯片母版中的规则)——并将这些规范一致地应用于新内容 。。。。。

例如,,,,当要求凭证参考文件更新数字时,,,,GPT-5.5 的输有缺少母版幻灯片中的要害组件,,,,而 GPT-5.6 则能更忠实地遵照参考结构 。。。。。

清静,,,,但一直对清静

OpenAI体现,,,,GPT-5.6 是其迄今为止最强盛的网络清静模子 。。。。。

在ExploitBench2测试中(该测试权衡从找到易受攻击代码到执行恣意代码的希望),,,,GPT-5.6 的得分为 73.5%,,,,而 GPT-5.5 在类似的输出令牌预算下得分为 47.9% 。。。。。

在ExploitGym3测试中(该测试要求署理将真实天下的误差转化为可用的攻击代码),,,,GPT-5.6 的峰值通过率险些是 GPT-5.5 的两倍,,,,在两小时的测试时间内从 15.1% 提升至 24.9%;;;;在六小时的测试时间内,,,,其通过率抵达了 33.7% 。。。。。

在SEC-Bench Pro测试中(该测试测试重大软件的看法验证天生能力),,,,GPT-5.6 的得分为 71.2%,,,,而 GPT-5.5 的得分为 45.8%,,,,并且延迟更低 。。。。。

GPT-5.6 支持主要的防御使命,,,,例如清静代码审查、补丁程序修补、威胁建模和蓝队演练 。。。。。OpenAIDaybreak 的“网络清静可信会见”妄想中切合资格的个人和组织可以通过更精准的清静包管步伐,,,,在授权情形中执行经由验证的事情,,,,从而获得更多防御功效,,,,包括误差分类和验证、恶意软件剖析、检测工程和补丁验证 。。。。。

在 OpenAI 内部,,,,研究职员将其应用于整个开发流程:诊断故障、优化训练系统、运行实验息争读效果 。。。。。

但“绝对的清静”是不保存的,,,,OpenAI 同样声明晰其局限 。。。。。

GPT-5.6 模子在生物学和网络清静领域均比之前的模子更强盛,,,,但在这两个领域均未抵达“要害”标准 。。。。。在网络清静领域,,,,GPT-5.6 更善于发明和修复误差,,,,但难以可靠地对强化目的提倡自主的端到端攻击——这使得防御者有时机在误差被使用之前增强系统 。。。。。在生物学领域,,,,GPT-5.6 可以支持正当的研究,,,,但并不具备建设、设计或合成高危新型威胁所需的端到端能力 。。。。。

“一分钱一分货”

GPT-5.6 克日起在 ChatGPT、Codex 和 OpenAI API 上线,,,,详细的使用上也附带了说明 。。。。。这次推送将在全球规模内举行,,,,并在未来 24 小时内逐步笼罩所有版本 。。。。。

Chat: Plus、Pro、Business 和 Enterprise 用户可以通过中等和较高难度设置会见 GPT-5.6 Sol 。。。。。Pro 和 Enterprise 用户还可以选择 GPT-5.6 Sol Pro,,,,以获得重大使命的最高质量效果 。。。。。

ChatGPT Work 和 Codex:免费版和 Go 版用户可使用 GPT-5.6 Terra 版本 。。。。。Plus、Pro、Business 和 Enterprise 版用户可以选择 GPT-5.6 Sol、Terra 和 Luna 版本,,,,并为每个版本设置事情量级别 。。。。。所有在 ChatGPT Work 和 Codex 中拥有 GPT-5.6 会见权限的用户均可使用此功效,,,,并且可以在设置中启用 。。。。。在 ChatGPT Work 中,,,,此功效仅对 Pro 和 Enterprise 版用户可用 。。。。。在 Codex 中,,,,此功效仅对 Plus 及更高级别的衣餐用户可用 。。。。。

API:开发者可以通过 OpenAI API 会见 Sol、Terra 和 Luna 。。。。。在响应 API 中,,,,程序化工具挪用功效允许 GPT-5.6 在内存中编写和运行程序,,,,以协调工具并处理中心效果,,,,从而实现零数据保存 (ZDR) 兼容 。。。。。多智能体功效(现在以 Beta 版形式提供)允许 GPT-5.6 运行多个子智能体,,,,并在单个请求中综合它们的运行效果 。。。。。

GPT-5.6 的定价基于每百万代币,,,,分为三种模子:Sol 为 5 美元输入/30 美元输出;;;;Terra 为 2.50 美元输入/15 美元输出;;;;Luna 为 1 美元输入/6 美元输出 。。。。。

与此同时,,,,OpenAI 更是拿专业、编程、科学与康健、盘算机使用、网络清静性、自我提升、多模态、学术研究、工具使用等一系列维度的数听说明晰自己的“一分钱一分货” 。。。。。

OpenAI 越发“接地气”了

OpenAI年中节点的这场宣布,,,,从跑分宣传笼罩到了性能的落地应用 。。。。。与手艺前进相比,,,,更为主要的可能是,,,,GPT-5.6 比以往任何时间都越发务实,,,,更“接地气”了 。。。。。

首先是按需分配算力,,,,离别了古板的“一刀切”,,,,GPT-5.6 的产品越来越矩阵化 。。。。。已往OpenAI 的战略是“做一个最强的模子,,,,让所有人用它”,,,, GPT-5.6则把模子酿成了类似手机一样的产品线,,,,让差别预算的用户都能找到合适的方案 。。。。。

Sol旗舰版主打极致性能,,,,Terra平衡版主打性价比,,,,Luna轻量版主打极速和低本钱 。。。。。

并且旗舰版 Sol 的定价,,,,输入5美元/百万token,,,,输出30美元,,,,这仅仅是其竞争敌手 Anthropic 同级产品 Fable 5 的一半,,,,但性能更优 。。。。。

其次,,,,GPT-5.6 也不再仅仅知足于“回覆问题更智慧”,,,,而是最先把“明确意图、挪用工具、拆分使命”毗连成完整的事情流,,,,推出由 Codex 驱动的 ChatGPT Work,,,,一键天生 PPT、表格并直接导出到 Microsoft Office,,,,让 AI 真正落地打工人的日常办公场景 。。。。。

这既是一种手艺选择,,,,也是一种商业战略 。。。。。OpenAI 还通过和 Cerebras 相助定制芯片等一系列战略降本增效,,,,改善公司的现金流 。。。。。一些看法以为,,,,这是OpenAI 在为自己2027年的IPO妄想做准备 。。。。。

也就是说,,,,OpenAI正在起劲从一个“腾贵的极客玩具”,,,,酿成通俗人和企业“用得起、用得顺”的生产力基础设施,,,,深入“everything” 。。。。。

直播中,,,,农场主Hiroki 体现身边的人都问他怎样使用AI ,,,,而他自己感受,,,,“那险些像是在变魔术 。。。。。” 从中可以嗅到的信号是,,,,天下的一些角落,,,,正在悄悄爆发转变 。。。。。

当蝴蝶扇动同党,,,,在时间的催化下,,,,可能会酿成现实的魔术 。。。。。

本内容由作者授权宣布,,,,看法仅代表作者自己,,,,不代表虎嗅态度 。。。。。如对本稿件有异议或投诉,,,,请联系 tougao@huxiu.com 。。。。。

本文来自虎嗅,,,,原文链接:https://www.huxiu.com/article/4874356.html?f=wyxwapp

 

文章点评

未盘问到任何数据!

揭晓谈论

◎接待加入讨论,,,,请在这里揭晓您的看法、交流您的看法 。。。。。

最新文章

热门文章

随机推荐

【网站地图】