GPT-5.6全量放送,,Codex正式并入ChatGPT
美国时间7月9日,,令人期待的GPT-5.6系列,,终于全量上线。。。
同时推出的尚有ChatGPT Work,,就一句话:把Codex放到了ChatGPT里。。。
不是之前那种加个入口,,是直接并了进去——Codex现在已经酿成了ChatGPT的一部分,,就连app图标都换成了ChatGPT(可以保存原图标)。。。
13天前,,OpenAI在GPT-5.6 Sol限量预览的文档中,,只展示了编码、生物、网络清静等重点评测,,并体现当模子更普遍开放时,,将宣布一套扩展的评测效果。。。现在也已经随着模子被一同放了出来。。。
而在正式效果单到来之前,,另一种“民间评测”已经先一步最先。。。
不少获得早期会见权限的用户,,已经在社交平台上分享了自己的使用体验。。。相比酷寒的benchmark,,这些反馈更像是一次提前泄露的实战视察。。。
让我用最直白、最简朴、最不绕弯子的话告诉你……
GPT-5.6 Sol在难题攻坚上打不过Fable5,,可是性价比更高、更适合日常办公。。。
相对自制,,并且超等快(这很主要)。。。
划重点:自制、快速、高性价比
在OpenAI 的正式宣布文档中,,开篇就把话说得很直白:GPT-5.6的目的是“每个token带来更多智能、更强的每美元性能,,以及在最难使命上按需挪用更高能力”。。。
首先,,再次强调一下GPT-5.6系列的价钱。。。
GPT-5.6分为Sol、Terra、Luna三个版本。。。凭证OpenAI宣布的API价钱,,GPT-5.6按每100万token计费:Sol是输入5美元、输出30美元;;;;;;Terra是输入2.5美元、输出15美元;;;;;;Luna是输入1美元、输出6美元。。。
相识这个价钱很是主要,,至少它会让用户原谅一些性能上的缺乏。。。许多人会把GPT-5.6 Sol对标Claude Fable 5,,但从API单价看,,GPT-5.6 Sol比Claude Fable 5自制不少:输入价钱只有后者一半,,输出价钱低40%。。。
并且OpenAI还提到GPT-5.6支持更可展望的prompt caching,,缓存读取有90%的折扣,,这会影响长上下文使命的现实本钱。。。
除了价钱,,另一个特殊值得关注的地方是速率——官方特殊指出,,Sol的速率最高可达每秒750个token。。。
用中文简陋明确,,或许是每秒500到700个汉字。。。
这会把模子思索和天生的部分大幅压缩,,对通俗谈天来说,,将带来很是显着的秒回感。。。
我们在之前的文章里,,已经提到了编码、生物、网络清静等重点的评测,,这次的评测更为周全,,但在主题上并没有太大差别。。。
好比,,在Agents’ Last Exam这个测试长时间专业事情流的评估里,,GPT-5.6 Sol抵达了53.6分,,比Fable 5高13.1分;;;;;;即便只开medium reasoning,,也能以约莫四分之一的估算本钱凌驾Fable 5。。。
OpenAI还说,,Terra和Luna可以在约莫1/16的本钱下凌驾Fable 5。。。
只管官方benchmark并不料味着最终结论,,但它至少说明晰OpenAI这次的叙事重点:
比的不但是谁更强,,尚有谁能以更低本钱完成更多使命。。。
官方文档之外,,在Artificial Analysis这套综合评测里,,GPT-5.6完成使命时消耗的token显着更少,,尤其是推理token少得夸张。。。就单位token产出和运行速率而言,,效率简直高得离谱。。。
相比起冷冰冰的benchmark,,照旧热乎乎的直播更值得关注——破晓一点,,OpenAI开了一场直播,,先容了本次更新的所有内容。。。
在直播中,,ChatGPT Work和GPT-5.6险些被放在了同样主要的位置上,,甚至ChatGPT Work越发主要,,奥特曼直接说那是个“really big deal”。。。
从直播来看,,某种意义上,,GPT-5.6反而像是一个专门为ChatGPT Work服务的模子底座。。。
而ChatGPT Work自己,,说白了,,就是把Codex放进了ChatGPT。。。
你看直播中的这个页面,,是不是很熟悉???
OpenAI在先容ChatGPT Work时直接写道:ChatGPT Work是ChatGPT里的一个Agent,,可以跨应用和文件接纳行动,,须要时陪着一个项目事情数小时,,并把一个目的酿成完制品。。。
滑稽的是,,OpenAI也不是简朴把Codex更名为ChatGPT Work——OpenAI说,,从今天最先,,Codex app会并入新的ChatGPT desktop app;;;;;;Codex仍然是面向开发者和手艺职员的强盛编码Agent,,但也会和Chat、Work一起泛起在统一个桌面应用里。。。
OpenAI自己此前已经在把Codex往“所有人的生产力工具”偏向讲了,,说 Codex在资助差别职业的人自动化日常事情、加速产出、镌汰知识事情的瓶颈。。。而现在,,真正合并的时间,,它反而把Codex的能力拆成了两个部分。。。
Codex这个入口仍然保存,,继续面向开发者和手艺职员,,认真代码、客栈、PR、diff、review、多客栈项目等工程使命。。。
但Codex背后那套更有价值的工具——接使命、读上下文、挪用工具、分方法执行、最后交付效果的能力——被笼统了出来,,放进了ChatGPT Work。。。
也就是说,,ChatGPT现在有三个入口:Chat认真对话,,Codex认真编码,,Work认真通用办公使命。。。
暂时来讲,,又往超等入口迈了一步。。。
现实体验:更适合日常使命
许多获得了GPT-5.6早期会见权限的网友分享了他们的使用体验。。。
总的来说,,GPT-5.6 Sol精彩的地方并不在于极限攻坚(许多人提到它在性能上和Fable 5尚有一段距离),,但它在日常事情上获得了用户的信任:用户愿意天天开着它,,把大宗日常使命、细节检查、上下文判断和中心历程交给它。。。
有网友以为,,Sol像一个有魅力、高效、有才华、让人羡慕的同事;;;;;;Fable则像一个有点拧巴的天才,,在自己执着的问题上极其精彩,,但不太适合日常相处。。。
在他的体验里,,Fable仍然适合那些目的极其明确的使命,,好比定向调试、清静问题和性能优化。。。由于这类使命有清晰的奖励函数,,模子可以一直往一个确定目的上猛推。。。
但一旦回到更常见的日常事情,,Sol的优势就展现出来了:它更随手,,更会配合,,也更适合长时间协作。。。
以是,,或许更好的方式是让Fable去出谋划策,,然后拿Sol去执行。。。
另一位网友的评价则更靠近团队层面的行为转变。。。他说,,自己的团队在使用模子时较量守旧,,但GPT-5.6对他的团队爆发了重大影响:他们现在消耗的token数目,,是已往的5倍。。。
他同样以为GPT-5.6不如Fable 5智慧,,但更可靠。。。
说到“使用的token数目是已往的5倍”,,我一最先还以为他在吐槽GPT-5.6对token消耗太快,,看了谈论区才知道并不是这样。。。
主要是由于用得多,,以是消耗得多,,这其中的要害在于他们愿意去用。。。
不过5倍的token消耗并不代表生产力提升了5倍,,这位网友体现,,他们并没有5倍的好点子去推动生产力。。。
多出来的token,,大部分不是用来堆更多产出,,而是用来提高已有事情的质量,,像是重复检查每一个细小决议、处理种种边沿情形、补上一些容易被忽略的打磨环节什么的。。。
但至少,,他的团队愿意把更多细节交给模子一起推敲。。。
在代码能力上,,网友Tim Neutkens的评价很是详细——他是Vercel的Next.js手艺认真人,,也是Next.js的配相助者之一。。。这是个大型开源框架,,在业内很有影响力,,并且是现代前端里很是主流的一套框架。。。
他们已经测试了Sol两个多月(那么长),,而在Next.js项目的日常事情中,,Sol体现相当精彩。。。他说Sol能明确架构取舍,,视察重大的Next.js项目,,在修bug时思量代码库的其他部分,,并且险些不需要太多指导,,用很短的提醒就够了。。。
并且Sol已经加入了一些Next.js服务器的大型重构事情。。。他们只需要指出高条理的刷新偏向,,Sol就能端到端实现。。。
有个早期用户则给出了较量降温的评价,,他以为GPT-5.6 Sol并不像Fable那样代表一次重大的转变或全新架构,,它更像是在GPT-5.5基础上充分打磨出的升级版。。。
思量到这次更新花了约莫三个月,,它甚至很难说有什么了不起。。。
不过,,再思量到它的价钱(Sol和5.5同价)和能力的提升,,GPT-5.6 Sol依然是现在订阅制下能用到的最好模子。。。
这位网友还提到了前端用户界面——不过这里指的是OpenAI自己的产品界面,,而不是Sol的前端代码能力。。。
事实上,,Sol的前端代码能力反而是早期评价里较量亮眼的部分。。。
不过对前端页面的审美几多有些见仁见智的意思,,详细感受可能照旧需要自己去实验。。。
简朴地说,,GPT-5.6 Sol至少不像一次标准意义上的大代际更新,,事实也执偾版本号+0.1的水平——只是GPT-5.5之后的一个小版本。。。
虽然,,它在撒播上确实取得了很大的胜利。。。先是提前良久就最先吊胃口,,又遇上了美国对前沿模子增强羁系的配景。。;;;;;I杏蠸ol、Terra、Luna这套太阳系命名,,也给它蒙上了一层很厉害的滤镜。。。
回到现实评价里,,Sol的焦点故事反而没有那么玄乎,,只是比GPT-5.5更快、更适合日常使命,,价钱上也没什么转变。。。
按理来讲,,这种转变着实是足够的,,但放在人家Anthropic从4到5的升级旁边,,照旧差点意思。。。它在许多使命上不如Fable 5也算正常,,价钱和版本号差在这里。。。
说到大代际,,有网友透露,,GPT-5.6将是5.x系列中的最后一批模子(三个模子)。。。GPT-6可能在本月稍晚一些或者下个月宣布。。。
OMT:花园里的两条路
只管听起来没有“前沿模子重大跃迁”那么刺激,,但对Agent来说,,性价比很是主要。。。
通俗谈天,,用户问一句,,模子答一句,,本钱再高也有限。。。但Agent要干活,,就不是一句两句的事了——对上下文的读取以及对现真相形的检查,,造成的token消耗险些难以计量。。。
到了Agent时代,,问题不但是“谁最智慧”,,还包括“谁足够智慧、足够快,,并且能被大宗挪用”。。。
GPT-5.6这次就有点像是在回覆这个问题。。。值得关注的不但有Sol,,它一次给出了三个版本,,分工也很明确:重大使命交给Sol,,日常使命交给Terra,,高频、轻量、容易验证的使命交给Luna。。。
若是说GPT-5.6是模子底座,,ChatGPT Work就是它真正干活的地方。。。有了详细的使用场景,,GPT-5.6的性价比才真正有了意义。。。
不是所有事情都要请最贵的专家来做,,许多时间,,一个足够稳固、足够自制的模子,,才是事情流真正跑起来的要害。。。
提及来,,最近这两天的新模子宣布,,有一点“自制模子批量放送”的意思。。。
xAI昨天宣布的Grok 4.5、Meta刚刚推出的Muse Spark 1.1,,主打的也都是自制、快速、高性价比。。。
事实上我并不是很爱看跑分,,经常用AI的都知道,,benchmark和现实使用上的体感是两码事,,但价钱是实打实的价钱。。。
按每100万token计费,,xAI的Grok 4.5的价钱是输入2美元、输出6美元,,xAI官方还强调它具备约2倍的token使用率;;;;;;Meta刚推出的Muse Spark 1.1更低,,输入1.25美元、输出4.25美元。。。
这着实是一个很大的转变。。。
已往,,前沿模子的竞争很像跑车宣布会:比谁的马力更大,,谁的极速更高,,谁能在最难的测试里跑出最好效果。。。
但Agent时代更像商用车市场,,用户不但体贴它能不可跑得快,,还体贴它省不省油、耐不耐用。。。
OpenAI、xAI和Meta看起来都在往这个偏向靠:把足够强的模子做得更自制、更快、更适合规;;;;;;灿。。。
就Anthropic,,在证实晰自己的实力以后,,仍然在另一条路上继续狂奔。。。
Anthropic虽然也在做事情流——甚至做得很是好,,只不过它的重点和OpenAI不太一样。。。我一直以为Anthropic的工具保存一定的使用门槛,,很强调协作质量和人的判断。。。
或者说,,它并不那么防呆。。。以是才会有那么多的Claude使用指南,,教你怎么把“最强AI工具”用到极致。。。
拿它破晓刚刚推出的Reflect with Claude功效举例,,它甚至专门让用户回看自己已往1、3、6、12个月怎样使用Claude,,剖析常见使命和使用模式,,并提醒用户思索哪些事情适合交给AI,,哪些仍然应该自己完成。。。
简朴地讲,,OpenAI的事情流更强调规;;;;;;灿,,而Anthropic的事情流更强调高质量协作。。。它们的主流模子看起来也很切合这种气质。。。
我们很难简朴评价这两条蹊径的正误,,它们更像是花园里的两条路。。。不过现在看来,,拥有最顶级模子的Anthropic似乎更胜一筹。。。
一方面是估值,,市场给出了它的谜底。。。另一方面,,Fable(Mythos)只是Anthropic的顶级模子,,它尚有Opus、Sonnet和Haiku,,在性价比上未必落了下风。。。
不过,,看起来OpenAI今天的更新照旧给Anthropic带来了一些紧迫感。。。
除了把Fable5的使用限制延伸到了7月12日,,它今晚还为所有用户重置了限额。。。
果真,,有竞争才有动力啊……
(作者:袁心玥)
文章点评
未盘问到任何数据!
揭晓谈论
◎接待加入讨论,,请在这里揭晓您的看法、交流您的看法。。。