凯时AG

GPT-5.6全量放送,,Codex正式并入ChatGPT

作者:胡俊贤
宣布时间:2026-07-23 07:29:06
阅读量:7

GPT-5.6全量放送,,Codex正式并入ChatGPT

美国时间7月9日,,令人期待的GPT-5.6系列,,终于全量上线 。。。

同时推出的尚有ChatGPT Work,,就一句话:把Codex放到了ChatGPT里 。。。

不是之前那种加个入口,,是直接并了进去——Codex现在已经酿成了ChatGPT的一部分,,就连app图标都换成了ChatGPT(可以保存原图标) 。。。

13天前,,OpenAI在GPT-5.6 Sol限量预览的文档中,,只展示了编码、生物、网络清静等重点评测,,并体现当模子更普遍开放时,,将宣布一套扩展的评测效果 。。。现在也已经随着模子被一同放了出来 。。。

而在正式效果单到来之前,,另一种“民间评测”已经先一步最先 。。。

不少获得早期会见权限的用户,,已经在社交平台上分享了自己的使用体验 。。。相比酷寒的benchmark,,这些反馈更像是一次提前泄露的实战视察 。。。

让我用最直白、最简朴、最不绕弯子的话告诉你……

GPT-5.6 Sol在难题攻坚上打不过Fable5,,可是性价比更高、更适合日常办公 。。。

相对自制,,并且超等快(这很主要) 。。。

划重点:自制、快速、高性价比

在OpenAI 的正式宣布文档中,,开篇就把话说得很直白:GPT-5.6的目的是“每个token带来更多智能、更强的每美元性能,,以及在最难使命上按需挪用更高能力” 。。。

首先,,再次强调一下GPT-5.6系列的价钱 。。。

GPT-5.6分为Sol、Terra、Luna三个版本 。。。凭证OpenAI宣布的API价钱,,GPT-5.6按每100万token计费:Sol是输入5美元、输出30美元;;;;;;Terra是输入2.5美元、输出15美元;;;;;;Luna是输入1美元、输出6美元 。。。

相识这个价钱很是主要,,至少它会让用户原谅一些性能上的缺乏 。。。许多人会把GPT-5.6 Sol对标Claude Fable 5,,但从API单价看,,GPT-5.6 Sol比Claude Fable 5自制不少:输入价钱只有后者一半,,输出价钱低40% 。。。

并且OpenAI还提到GPT-5.6支持更可展望的prompt caching,,缓存读取有90%的折扣,,这会影响长上下文使命的现实本钱 。。。

除了价钱,,另一个特殊值得关注的地方是速率——官方特殊指出,,Sol的速率最高可达每秒750个token 。。。

用中文简陋明确,,或许是每秒500到700个汉字 。。。

这会把模子思索和天生的部分大幅压缩,,对通俗谈天来说,,将带来很是显着的秒回感 。。。

我们在之前的文章里,,已经提到了编码、生物、网络清静等重点的评测,,这次的评测更为周全,,但在主题上并没有太大差别 。。。

好比,,在Agents’ Last Exam这个测试长时间专业事情流的评估里,,GPT-5.6 Sol抵达了53.6分,,比Fable 5高13.1分;;;;;;即便只开medium reasoning,,也能以约莫四分之一的估算本钱凌驾Fable 5 。。。

OpenAI还说,,Terra和Luna可以在约莫1/16的本钱下凌驾Fable 5 。。。

只管官方benchmark并不料味着最终结论,,但它至少说明晰OpenAI这次的叙事重点:

比的不但是谁更强,,尚有谁能以更低本钱完成更多使命 。。。

官方文档之外,,在Artificial Analysis这套综合评测里,,GPT-5.6完成使命时消耗的token显着更少,,尤其是推理token少得夸张 。。。就单位token产出和运行速率而言,,效率简直高得离谱 。。。

相比起冷冰冰的benchmark,,照旧热乎乎的直播更值得关注——破晓一点,,OpenAI开了一场直播,,先容了本次更新的所有内容 。。。

在直播中,,ChatGPT Work和GPT-5.6险些被放在了同样主要的位置上,,甚至ChatGPT Work越发主要,,奥特曼直接说那是个“really big deal” 。。。

从直播来看,,某种意义上,,GPT-5.6反而像是一个专门为ChatGPT Work服务的模子底座 。。。

而ChatGPT Work自己,,说白了,,就是把Codex放进了ChatGPT 。。。

你看直播中的这个页面,,是不是很熟悉???

OpenAI在先容ChatGPT Work时直接写道:ChatGPT Work是ChatGPT里的一个Agent,,可以跨应用和文件接纳行动,,须要时陪着一个项目事情数小时,,并把一个目的酿成完制品 。。。

滑稽的是,,OpenAI也不是简朴把Codex更名为ChatGPT Work——OpenAI说,,从今天最先,,Codex app会并入新的ChatGPT desktop app;;;;;;Codex仍然是面向开发者和手艺职员的强盛编码Agent,,但也会和Chat、Work一起泛起在统一个桌面应用里 。。。

OpenAI自己此前已经在把Codex往“所有人的生产力工具”偏向讲了,,说 Codex在资助差别职业的人自动化日常事情、加速产出、镌汰知识事情的瓶颈 。。。而现在,,真正合并的时间,,它反而把Codex的能力拆成了两个部分 。。。

Codex这个入口仍然保存,,继续面向开发者和手艺职员,,认真代码、客栈、PR、diff、review、多客栈项目等工程使命 。。。

但Codex背后那套更有价值的工具——接使命、读上下文、挪用工具、分方法执行、最后交付效果的能力——被笼统了出来,,放进了ChatGPT Work 。。。

也就是说,,ChatGPT现在有三个入口:Chat认真对话,,Codex认真编码,,Work认真通用办公使命 。。。

暂时来讲,,又往超等入口迈了一步 。。。

现实体验:更适合日常使命

许多获得了GPT-5.6早期会见权限的网友分享了他们的使用体验 。。。

总的来说,,GPT-5.6 Sol精彩的地方并不在于极限攻坚(许多人提到它在性能上和Fable 5尚有一段距离),,但它在日常事情上获得了用户的信任:用户愿意天天开着它,,把大宗日常使命、细节检查、上下文判断和中心历程交给它 。。。

有网友以为,,Sol像一个有魅力、高效、有才华、让人羡慕的同事;;;;;;Fable则像一个有点拧巴的天才,,在自己执着的问题上极其精彩,,但不太适合日常相处 。。。

在他的体验里,,Fable仍然适合那些目的极其明确的使命,,好比定向调试、清静问题和性能优化 。。。由于这类使命有清晰的奖励函数,,模子可以一直往一个确定目的上猛推 。。。

但一旦回到更常见的日常事情,,Sol的优势就展现出来了:它更随手,,更会配合,,也更适合长时间协作 。。。

以是,,或许更好的方式是让Fable去出谋划策,,然后拿Sol去执行 。。。

另一位网友的评价则更靠近团队层面的行为转变 。。。他说,,自己的团队在使用模子时较量守旧,,但GPT-5.6对他的团队爆发了重大影响:他们现在消耗的token数目,,是已往的5倍 。。。

他同样以为GPT-5.6不如Fable 5智慧,,但更可靠 。。。

说到“使用的token数目是已往的5倍”,,我一最先还以为他在吐槽GPT-5.6对token消耗太快,,看了谈论区才知道并不是这样 。。。

主要是由于用得多,,以是消耗得多,,这其中的要害在于他们愿意去用 。。。

不过5倍的token消耗并不代表生产力提升了5倍,,这位网友体现,,他们并没有5倍的好点子去推动生产力 。。。

多出来的token,,大部分不是用来堆更多产出,,而是用来提高已有事情的质量,,像是重复检查每一个细小决议、处理种种边沿情形、补上一些容易被忽略的打磨环节什么的 。。。

但至少,,他的团队愿意把更多细节交给模子一起推敲 。。。

在代码能力上,,网友Tim Neutkens的评价很是详细——他是Vercel的Next.js手艺认真人,,也是Next.js的配相助者之一 。。。这是个大型开源框架,,在业内很有影响力,,并且是现代前端里很是主流的一套框架 。。。

他们已经测试了Sol两个多月(那么长),,而在Next.js项目的日常事情中,,Sol体现相当精彩 。。。他说Sol能明确架构取舍,,视察重大的Next.js项目,,在修bug时思量代码库的其他部分,,并且险些不需要太多指导,,用很短的提醒就够了 。。。

并且Sol已经加入了一些Next.js服务器的大型重构事情 。。。他们只需要指出高条理的刷新偏向,,Sol就能端到端实现 。。。

有个早期用户则给出了较量降温的评价,,他以为GPT-5.6 Sol并不像Fable那样代表一次重大的转变或全新架构,,它更像是在GPT-5.5基础上充分打磨出的升级版 。。。

思量到这次更新花了约莫三个月,,它甚至很难说有什么了不起 。。。

不过,,再思量到它的价钱(Sol和5.5同价)和能力的提升,,GPT-5.6 Sol依然是现在订阅制下能用到的最好模子 。。。

这位网友还提到了前端用户界面——不过这里指的是OpenAI自己的产品界面,,而不是Sol的前端代码能力 。。。

事实上,,Sol的前端代码能力反而是早期评价里较量亮眼的部分 。。。

不过对前端页面的审美几多有些见仁见智的意思,,详细感受可能照旧需要自己去实验 。。。

简朴地说,,GPT-5.6 Sol至少不像一次标准意义上的大代际更新,,事实也执偾版本号+0.1的水平——只是GPT-5.5之后的一个小版本 。。。

虽然,,它在撒播上确实取得了很大的胜利 。。。先是提前良久就最先吊胃口,,又遇上了美国对前沿模子增强羁系的配景 。。;;;;;I杏蠸ol、Terra、Luna这套太阳系命名,,也给它蒙上了一层很厉害的滤镜 。。。

回到现实评价里,,Sol的焦点故事反而没有那么玄乎,,只是比GPT-5.5更快、更适合日常使命,,价钱上也没什么转变 。。。

按理来讲,,这种转变着实是足够的,,但放在人家Anthropic从4到5的升级旁边,,照旧差点意思 。。。它在许多使命上不如Fable 5也算正常,,价钱和版本号差在这里 。。。

说到大代际,,有网友透露,,GPT-5.6将是5.x系列中的最后一批模子(三个模子) 。。。GPT-6可能在本月稍晚一些或者下个月宣布 。。。

OMT:花园里的两条路

只管听起来没有“前沿模子重大跃迁”那么刺激,,但对Agent来说,,性价比很是主要 。。。

通俗谈天,,用户问一句,,模子答一句,,本钱再高也有限 。。。但Agent要干活,,就不是一句两句的事了——对上下文的读取以及对现真相形的检查,,造成的token消耗险些难以计量 。。。

到了Agent时代,,问题不但是“谁最智慧”,,还包括“谁足够智慧、足够快,,并且能被大宗挪用” 。。。

GPT-5.6这次就有点像是在回覆这个问题 。。。值得关注的不但有Sol,,它一次给出了三个版本,,分工也很明确:重大使命交给Sol,,日常使命交给Terra,,高频、轻量、容易验证的使命交给Luna 。。。

若是说GPT-5.6是模子底座,,ChatGPT Work就是它真正干活的地方 。。。有了详细的使用场景,,GPT-5.6的性价比才真正有了意义 。。。

不是所有事情都要请最贵的专家来做,,许多时间,,一个足够稳固、足够自制的模子,,才是事情流真正跑起来的要害 。。。

提及来,,最近这两天的新模子宣布,,有一点“自制模子批量放送”的意思 。。。

xAI昨天宣布的Grok 4.5、Meta刚刚推出的Muse Spark 1.1,,主打的也都是自制、快速、高性价比 。。。

事实上我并不是很爱看跑分,,经常用AI的都知道,,benchmark和现实使用上的体感是两码事,,但价钱是实打实的价钱 。。。

按每100万token计费,,xAI的Grok 4.5的价钱是输入2美元、输出6美元,,xAI官方还强调它具备约2倍的token使用率;;;;;;Meta刚推出的Muse Spark 1.1更低,,输入1.25美元、输出4.25美元 。。。

这着实是一个很大的转变 。。。

已往,,前沿模子的竞争很像跑车宣布会:比谁的马力更大,,谁的极速更高,,谁能在最难的测试里跑出最好效果 。。。

但Agent时代更像商用车市场,,用户不但体贴它能不可跑得快,,还体贴它省不省油、耐不耐用 。。。

OpenAI、xAI和Meta看起来都在往这个偏向靠:把足够强的模子做得更自制、更快、更适合规;;;;;;灿 。。。

就Anthropic,,在证实晰自己的实力以后,,仍然在另一条路上继续狂奔 。。。

Anthropic虽然也在做事情流——甚至做得很是好,,只不过它的重点和OpenAI不太一样 。。。我一直以为Anthropic的工具保存一定的使用门槛,,很强调协作质量和人的判断 。。。

或者说,,它并不那么防呆 。。。以是才会有那么多的Claude使用指南,,教你怎么把“最强AI工具”用到极致 。。。

拿它破晓刚刚推出的Reflect with Claude功效举例,,它甚至专门让用户回看自己已往1、3、6、12个月怎样使用Claude,,剖析常见使命和使用模式,,并提醒用户思索哪些事情适合交给AI,,哪些仍然应该自己完成 。。。

简朴地讲,,OpenAI的事情流更强调规;;;;;;灿,,而Anthropic的事情流更强调高质量协作 。。。它们的主流模子看起来也很切合这种气质 。。。

我们很难简朴评价这两条蹊径的正误,,它们更像是花园里的两条路 。。。不过现在看来,,拥有最顶级模子的Anthropic似乎更胜一筹 。。。

一方面是估值,,市场给出了它的谜底 。。。另一方面,,Fable(Mythos)只是Anthropic的顶级模子,,它尚有Opus、Sonnet和Haiku,,在性价比上未必落了下风 。。。

不过,,看起来OpenAI今天的更新照旧给Anthropic带来了一些紧迫感 。。。

除了把Fable5的使用限制延伸到了7月12日,,它今晚还为所有用户重置了限额 。。。

果真,,有竞争才有动力啊……

(作者:袁心玥)

 

文章点评

未盘问到任何数据!

揭晓谈论

◎接待加入讨论,,请在这里揭晓您的看法、交流您的看法 。。。

最新文章

热门文章

随机推荐

【网站地图】