出品|虎嗅科技组
作者|余杨
编辑|苗正卿
头图|视觉中国
7月10日新闻,,,,,OpenAI 正式推出 GPT-5.6 系列模子,,,,,包括新旗舰模子 Sol,,,,,适合日常事情的平衡模子 Terra,,,,,以及最具本钱效益的模子Luna。。。
在这次宣布的主题中,,,,,OpenAI 重点强调了智能的尖端、动态的生长和自身的协作性。。。以及一个醒目的细节:它直接将性价比打在了公屏上。。。
“每个代币都能带来更多智能,,,,,每美元能带来更强的性能,,,,,并可凭证您的最难题事情需求提供更多功效。。。”
模子试图丝滑进入你的事情
在已往的几个周,,,,,GPT-5.6 在天下的各个角落被差别水平地使用。。。使用者包括日本的农场主Hiroki 和纽约的一个三口之家。。。Ian 、Margaret以及他们的儿子Alice在起居室里使用GPT-5.6完成一系列的事情。。。别的尚有波兰的数学领域,,,,,Batosz用GPT-5.6 解决无法解决的问题。。。
宣传片最先于日本北海道的一个农场,,,,,农场主 Hiroki 正在通过GPT-5.6治理温室。。。他说,,,,,“我不是一个工程师,,,,,但我已经在使用Codex来使事情更有用率了。。。”他使用GPT-5.6翻开和关闭温室:“人们已往手动把温室侧面的塑料薄膜卷起来透风。。。”但现在,,,,,GPT-5.6 资助妄想多年的采购,,,,,妥善安排维修以及装置它们,,,,,并且它确实有用。。。
Hiroki 体现,,,,,GPT-5.6 处理prompt并且一直跟进到效果。。。“使用之前的模子,,,,,我不得不重复做提升,,,,,给出新说明,,,,,现在,,,,,使用单个prompt,,,,,它能读取整个对话线索,,,,,选择准确的工具,,,,,自主判断并完成使命直到竣事。。。这是一个难以置信的转变。。。”
GPT-5.6同样在一些小事情上资助人们。。。Jake 在“Three Wishes”团队事情,,,,,这是一个美国早餐麦片品牌,,,,,由 Ian 和 Margaret Wishingrad 于2019年配合建设,,,,,主打康健、无谷物、高卵白的麦片产品,,,,,目的人群为注重营养与口感的消耗者。。。其产品线包括多种口胃,,,,,如“Fruity”、“Cocoa”等,,,,,强调“Sneaky Delicious, Sneaky Nutritious”,,,,,即在鲜味中隐藏营养。。。
已往,,,,,“Three Wishes”由 Ian 和Margaret自己重新到尾运营。。。Jake展示了怎样对模子举行提醒。。。
他使用GPT-5.6 完成一个安排开发销售仪表盘的使命。。。首先,,,,,他给出了一个销售仪表盘的组件,,,,,要求从六个差别的零售商那里抓取数据,,,,,拉取这些数据后,,,,,还要建设一个Codex 自动化程序,,,,,把它牢靠在谈天里,,,,,让它每小时同步并拉取一次这些信息,,,,,这样 Margaret 就能拥有一个实时更新的数据仪表盘。。。他们即将有一个新产品宣布,,,,,因此需要把这次新宣布的品牌素材以及新包装盒的图片拉取进来,,,,,确保仪表盘能反映出这些内容。。。
GPT-5.6 在五分钟内制订了妄想。。。它拉取了相关的数据,,,,,包括品牌等等,,,,,以及可使用的润色版本,,,,,设计了演示环节和撒播表格。。。
GPT-5.6也能资助科研职员做一些新发明。。。在波兰的波兹南,,,,,Batosz在统一个数学难题上泯灭了3年,,,,,但解决不了它,,,,,新Codex的到来资助了他。。。“Codex能够提出新点子,,,,,也能资助演算和证实,,,,,解决了三年来没有解决的问题。。。” GPT-5.6可以划分要害协作事项,,,,,匹配差别事情流,,,,,从而解决差别部分的问题。。。“新发明让他感应很兴奋”。。。
宣传片想要表达,,,,,GPT-5.6 使事情不但仅停留在屏幕上,,,,,而是进入到现实的天下,,,,,从生涯中的小事情到农场主的事情,,,,,再到最好的数学研究领域,,,,,大模子正在实验进入每一件事。。。
GPT-5.6 的效果单
GPT-5.6 Sol 在智能和效率方面均有大幅提升。。。尤其是在编码、知识事情、网络清静和科学等领域,,,,,消耗更少的token,,,,,完成更重大的使命,,,,,性价比极高。。。它的特点在于,,,,,协调多个署理在并行事情流中运行,,,,,这种成熟的协作能力使它能够检查、刷新并交付可直接使用的效果,,,,,从而逾越了以往的同类前沿模子。。。
在对 55 个领域恒久运行的专业事情流程举行评估后,,,,,GPT-5.6 Sol 创下 53.6 的新高,,,,,比 Claude Fable 5(自顺应推理)横跨 13.1 分。。。纵然在中等推理水平下,,,,,它也比 Fable 5 横跨 11.4 分,,,,,而本钱约为其预估本钱的四分之一。。。这种效率也体现在更小的模子上,,,,,而这些模子关于实现更富厚、更经济的智能至关主要:GPT-5.6 Terra 和 GPT-5.6 Luna 的性能优于 Fable 5,,,,,而本钱约为其十六分之一。。。
在人工智能剖析智能指数(AII)上(在新窗口中翻开)GPT-5.6 Sol 的推理能力涵盖了智能的普遍权衡标准,,,,,包括自主事情、编码、科学推理和一般能力。。。其推理能力最高时,,,,,得分仅比 Fable 5 低 1 分,,,,,完成使命的时间镌汰了 61%,,,,,本钱也只有预估本钱的一半左右。。。
GPT-5.6 Sol 在人工智能剖析编码署理指数 (ACI) 上取得了 80 分的全新最佳效果,,,,,比 Fable 5 横跨 2.8 分,,,,,同时输出标记数目不到 Fable 5 的一半,,,,,运行时间不到一半,,,,,本钱也降低了约三分之一。。。
不但云云,,,,,在整个GPT-5.6 系列模子中,,,,,Terra 的性能也略高于 Fable 5,,,,,而 Luna 的性能优于 Opus 4.8;;;它们的运行时间划分约为 Fable 5 的三分之一,,,,,输出标记数目约为其一半,,,,,本钱约为其预估本钱的四分之一。。。
别的,,,,,GPT-5.6 Sol 在 Terminal-Bench 2.1 和 DeepSWE 测试中也取得了新的最佳效果,,,,,这两个测试旨在评估真实代码库中重大的下令行事情流和恒久工程。。。
同时,,,,,GPT-5.6 可以编写和运行轻量级程序,,,,,协调种种工具、处理中心效果、监控进度,,,,,并在事情举行历程中选择下一步操作。。。这使得工具麋集型使命能够以更少的标记、更少的模子往返次数和更少的指导推进。。。宣传片中的北海道农场和“Three Wishes”麦片公司都用到了这个功效。。。
开发者不需要编写每个方法的剧本或将每个工具响应都转达给模子,,,,,仅仅挪用程序化工具就可以实现这一点。。。响应 API 可以过滤大宗中心数据,,,,,只保存主要信息,,,,,并在此历程中调解其事情流程。。。
关于那些需要投入更多时间和盘算资源才华解决的问题,,,,,GPT-5.6 可以逾越这种高效的默认设置,,,,,并行协调四个智能体,,,,,以更高的令牌消耗换取更优的效果和更快的响应速率。。。以下是较量了 ultra 的默认四智能体设置与单智能体基准在 BrowseComp(浏览盘算)、SEC-Bench Pro 和 Terminal-Bench 2.1 上的体现;;;
在所有三个评估中,,,,,添加并行智能体都会使得分-延迟曲线向上向左移动,,,,,从而在更短的时间内获得更优的效果。。。
这也就不难明确,,,,,GPT-5.6获得了包括来自CURSOR、qodo、Notion、Cognition等公司的开发者的一众好评。。。
要知识,,,,,还要漂亮
与此同时,,,,,GPT-5.6 在设计判断方面实现了质的飞跃。。。
它能够检查和优化渲染效果——而不但仅是天生底层代码或内容——从而发明视觉和功效上的问题,,,,,并在最终交付作品前举行润色。。。其前端功效还可以将自然语言请求转换为 ChatGPT Work 中细腻的交互式诠释和可视化效果。。。
在知识型事情方面,,,,,它的优势体现在涵盖恒久专业剖析、浏览、工具使用和盘算机使用的各项评估中。。。
GPT-5.6 Sol 在BrowseComp和OSWorld 2.0测试中划分取得了92.2% 和62.6%的优异效果;;;在 OSWorld 测试中,,,,,它逾越了 Opus 4.8,,,,,同时输出令牌数目镌汰了 85%。。。
这一系列的性价比优势也十分显著。。。Luna 的性能险些抵达了 GPT-5.5 的峰值水平,,,,,而本钱却不到其一半;;;Terra 的性能则更胜一筹,,,,,且本钱更低。。。
这带来的效果是,,,,,当使用模板和参考资料时,,,,,提高尤为显著。。。
GPT-5.6 可以推断出资料的设计系统——结构、字体、间距、颜色和重复泛起的内容模式(包括嵌入在幻灯片母版中的规则)——并将这些规范一致地应用于新内容。。。
例如,,,,,当要求凭证参考文件更新数字时,,,,,GPT-5.5 的输有缺少母版幻灯片中的要害组件,,,,,而 GPT-5.6 则能更忠实地遵照参考结构。。。
清静,,,,,但一直对清静
OpenAI体现,,,,,GPT-5.6 是其迄今为止最强盛的网络清静模子。。。
在ExploitBench2测试中(该测试权衡从找到易受攻击代码到执行恣意代码的希望),,,,,GPT-5.6 的得分为 73.5%,,,,,而 GPT-5.5 在类似的输出令牌预算下得分为 47.9%。。。
在ExploitGym3测试中(该测试要求署理将真实天下的误差转化为可用的攻击代码),,,,,GPT-5.6 的峰值通过率险些是 GPT-5.5 的两倍,,,,,在两小时的测试时间内从 15.1% 提升至 24.9%;;;在六小时的测试时间内,,,,,其通过率抵达了 33.7%。。。
在SEC-Bench Pro测试中(该测试测试重大软件的看法验证天生能力),,,,,GPT-5.6 的得分为 71.2%,,,,,而 GPT-5.5 的得分为 45.8%,,,,,并且延迟更低。。。
GPT-5.6 支持主要的防御使命,,,,,例如清静代码审查、补丁程序修补、威胁建模和蓝队演练。。。OpenAIDaybreak 的“网络清静可信会见”妄想中切合资格的个人和组织可以通过更精准的清静包管步伐,,,,,在授权情形中执行经由验证的事情,,,,,从而获得更多防御功效,,,,,包括误差分类和验证、恶意软件剖析、检测工程和补丁验证。。。
在 OpenAI 内部,,,,,研究职员将其应用于整个开发流程:诊断故障、优化训练系统、运行实验息争读效果。。。
但“绝对的清静”是不保存的,,,,,OpenAI 同样声明晰其局限。。。
GPT-5.6 模子在生物学和网络清静领域均比之前的模子更强盛,,,,,但在这两个领域均未抵达“要害”标准。。。在网络清静领域,,,,,GPT-5.6 更善于发明和修复误差,,,,,但难以可靠地对强化目的提倡自主的端到端攻击——这使得防御者有时机在误差被使用之前增强系统。。。在生物学领域,,,,,GPT-5.6 可以支持正当的研究,,,,,但并不具备建设、设计或合成高危新型威胁所需的端到端能力。。。
“一分钱一分货”
GPT-5.6 克日起在 ChatGPT、Codex 和 OpenAI API 上线,,,,,详细的使用上也附带了说明。。。这次推送将在全球规模内举行,,,,,并在未来 24 小时内逐步笼罩所有版本。。。
Chat: Plus、Pro、Business 和 Enterprise 用户可以通过中等和较高难度设置会见 GPT-5.6 Sol。。。Pro 和 Enterprise 用户还可以选择 GPT-5.6 Sol Pro,,,,,以获得重大使命的最高质量效果。。。
ChatGPT Work 和 Codex:免费版和 Go 版用户可使用 GPT-5.6 Terra 版本。。。Plus、Pro、Business 和 Enterprise 版用户可以选择 GPT-5.6 Sol、Terra 和 Luna 版本,,,,,并为每个版本设置事情量级别。。。所有在 ChatGPT Work 和 Codex 中拥有 GPT-5.6 会见权限的用户均可使用此功效,,,,,并且可以在设置中启用。。。在 ChatGPT Work 中,,,,,此功效仅对 Pro 和 Enterprise 版用户可用。。。在 Codex 中,,,,,此功效仅对 Plus 及更高级别的衣餐用户可用。。。
API:开发者可以通过 OpenAI API 会见 Sol、Terra 和 Luna。。。在响应 API 中,,,,,程序化工具挪用功效允许 GPT-5.6 在内存中编写和运行程序,,,,,以协调工具并处理中心效果,,,,,从而实现零数据保存 (ZDR) 兼容。。。多智能体功效(现在以 Beta 版形式提供)允许 GPT-5.6 运行多个子智能体,,,,,并在单个请求中综合它们的运行效果。。。
GPT-5.6 的定价基于每百万代币,,,,,分为三种模子:Sol 为 5 美元输入/30 美元输出;;;Terra 为 2.50 美元输入/15 美元输出;;;Luna 为 1 美元输入/6 美元输出。。。
与此同时,,,,,OpenAI 更是拿专业、编程、科学与康健、盘算机使用、网络清静性、自我提升、多模态、学术研究、工具使用等一系列维度的数听说明晰自己的“一分钱一分货”。。。
OpenAI 越发“接地气”了
OpenAI年中节点的这场宣布,,,,,从跑分宣传笼罩到了性能的落地应用。。。与手艺前进相比,,,,,更为主要的可能是,,,,,GPT-5.6 比以往任何时间都越发务实,,,,,更“接地气”了。。。
首先是按需分配算力,,,,,离别了古板的“一刀切”,,,,,GPT-5.6 的产品越来越矩阵化。。。已往OpenAI 的战略是“做一个最强的模子,,,,,让所有人用它”,,,,, GPT-5.6则把模子酿成了类似手机一样的产品线,,,,,让差别预算的用户都能找到合适的方案。。。
Sol旗舰版主打极致性能,,,,,Terra平衡版主打性价比,,,,,Luna轻量版主打极速和低本钱。。。
并且旗舰版 Sol 的定价,,,,,输入5美元/百万token,,,,,输出30美元,,,,,这仅仅是其竞争敌手 Anthropic 同级产品 Fable 5 的一半,,,,,但性能更优。。。
其次,,,,,GPT-5.6 也不再仅仅知足于“回覆问题更智慧”,,,,,而是最先把“明确意图、挪用工具、拆分使命”毗连成完整的事情流,,,,,推出由 Codex 驱动的 ChatGPT Work,,,,,一键天生 PPT、表格并直接导出到 Microsoft Office,,,,,让 AI 真正落地打工人的日常办公场景。。。
这既是一种手艺选择,,,,,也是一种商业战略。。。OpenAI 还通过和 Cerebras 相助定制芯片等一系列战略降本增效,,,,,改善公司的现金流。。。一些看法以为,,,,,这是OpenAI 在为自己2027年的IPO妄想做准备。。。
也就是说,,,,,OpenAI正在起劲从一个“腾贵的极客玩具”,,,,,酿成通俗人和企业“用得起、用得顺”的生产力基础设施,,,,,深入“everything”。。。
直播中,,,,,农场主Hiroki 体现身边的人都问他怎样使用AI ,,,,,而他自己感受,,,,,“那险些像是在变魔术。。。” 从中可以嗅到的信号是,,,,,天下的一些角落,,,,,正在悄悄爆发转变。。。
当蝴蝶扇动同党,,,,,在时间的催化下,,,,,可能会酿成现实的魔术。。。
本内容由作者授权宣布,,,,,看法仅代表作者自己,,,,,不代表虎嗅态度。。。如对本稿件有异议或投诉,,,,,请联系 tougao@huxiu.com。。。
本文来自虎嗅,,,,,原文链接:https://www.huxiu.com/article/4874356.html?f=wyxwapp
不过,,,,,港股通的投资者可以在投票意愿网络阻止日前,,,,,通过相关生意软件提交自己的投票意愿。。。香港结算通过中国证券挂号结算有限责任公司网络好后,,,,,会统一报送给上市公司。。。
责任编辑:蔡家惠 校对:袁致士