凯时AG

2026-07-22 09:41:27 设为首页 | 加入珍藏

GPT-5.6全量放送,,,, ,,Codex正式并入ChatGPT

2026-07-22 09:41:27 宣布 泉源:第一应用 作者:张碧志 浏览:9596次

美国时间7月9日,,,, ,,令人期待的GPT-5.6系列,,,, ,,终于全量上线。 。。。

同时推出的尚有ChatGPT Work,,,, ,,就一句话:把Codex放到了ChatGPT里。 。。。

不是之前那种加个入口,,,, ,,是直接并了进去——Codex现在已经酿成了ChatGPT的一部分,,,, ,,就连app图标都换成了ChatGPT(可以保存原图标)。 。。。

13天前,,,, ,,OpenAI在GPT-5.6 Sol限量预览的文档中,,,, ,,只展示了编码、生物、网络清静等重点评测,,,, ,,并体现当模子更普遍开放时,,,, ,,将宣布一套扩展的评测效果。 。。。现在也已经随着模子被一同放了出来。 。。。

而在正式效果单到来之前,,,, ,,另一种“民间评测”已经先一步最先。 。。。

不少获得早期会见权限的用户,,,, ,,已经在社交平台上分享了自己的使用体验。 。。。相比酷寒的benchmark,,,, ,,这些反馈更像是一次提前泄露的实战视察。 。。。

让我用最直白、最简朴、最不绕弯子的话告诉你……

GPT-5.6 Sol在难题攻坚上打不过Fable5,,,, ,,可是性价比更高、更适合日常办公。 。。。

相对自制,,,, ,,并且超等快(这很主要)。 。。。

划重点:自制、快速、高性价比

在OpenAI 的正式宣布文档中,,,, ,,开篇就把话说得很直白:GPT-5.6的目的是“每个token带来更多智能、更强的每美元性能,,,, ,,以及在最难使命上按需挪用更高能力”。 。。。

首先,,,, ,,再次强调一下GPT-5.6系列的价钱。 。。。

GPT-5.6分为Sol、Terra、Luna三个版本。 。。。凭证OpenAI宣布的API价钱,,,, ,,GPT-5.6按每100万token计费:Sol是输入5美元、输出30美元;;; ;;Terra是输入2.5美元、输出15美元;;; ;;Luna是输入1美元、输出6美元。 。。。

相识这个价钱很是主要,,,, ,,至少它会让用户原谅一些性能上的缺乏。 。。。许多人会把GPT-5.6 Sol对标Claude Fable 5,,,, ,,但从API单价看,,,, ,,GPT-5.6 Sol比Claude Fable 5自制不少:输入价钱只有后者一半,,,, ,,输出价钱低40%。 。。。

并且OpenAI还提到GPT-5.6支持更可展望的prompt caching,,,, ,,缓存读取有90%的折扣,,,, ,,这会影响长上下文使命的现实本钱。 。。。

除了价钱,,,, ,,另一个特殊值得关注的地方是速率——官方特殊指出,,,, ,,Sol的速率最高可达每秒750个token。 。。。

用中文简陋明确,,,, ,,或许是每秒500到700个汉字。 。。。

这会把模子思索和天生的部分大幅压缩,,,, ,,对通俗谈天来说,,,, ,,将带来很是显着的秒回感。 。。。

我们在之前的文章里,,,, ,,已经提到了编码、生物、网络清静等重点的评测,,,, ,,这次的评测更为周全,,,, ,,但在主题上并没有太大差别。 。。。

好比,,,, ,,在Agents’ Last Exam这个测试长时间专业事情流的评估里,,,, ,,GPT-5.6 Sol抵达了53.6分,,,, ,,比Fable 5高13.1分;;; ;;即便只开medium reasoning,,,, ,,也能以约莫四分之一的估算本钱凌驾Fable 5。 。。。

OpenAI还说,,,, ,,Terra和Luna可以在约莫1/16的本钱下凌驾Fable 5。 。。。

只管官方benchmark并不料味着最终结论,,,, ,,但它至少说明晰OpenAI这次的叙事重点:

比的不但是谁更强,,,, ,,尚有谁能以更低本钱完成更多使命。 。。。

官方文档之外,,,, ,,在Artificial Analysis这套综合评测里,,,, ,,GPT-5.6完成使命时消耗的token显着更少,,,, ,,尤其是推理token少得夸张。 。。。就单位token产出和运行速率而言,,,, ,,效率简直高得离谱。 。。。

相比起冷冰冰的benchmark,,,, ,,照旧热乎乎的直播更值得关注——破晓一点,,,, ,,OpenAI开了一场直播,,,, ,,先容了本次更新的所有内容。 。。。

在直播中,,,, ,,ChatGPT Work和GPT-5.6险些被放在了同样主要的位置上,,,, ,,甚至ChatGPT Work越发主要,,,, ,,奥特曼直接说那是个“really big deal”。 。。。

从直播来看,,,, ,,某种意义上,,,, ,,GPT-5.6反而像是一个专门为ChatGPT Work服务的模子底座。 。。。

而ChatGPT Work自己,,,, ,,说白了,,,, ,,就是把Codex放进了ChatGPT。 。。。

你看直播中的这个页面,,,, ,,是不是很熟悉??????

OpenAI在先容ChatGPT Work时直接写道:ChatGPT Work是ChatGPT里的一个Agent,,,, ,,可以跨应用和文件接纳行动,,,, ,,须要时陪着一个项目事情数小时,,,, ,,并把一个目的酿成完制品。 。。。

滑稽的是,,,, ,,OpenAI也不是简朴把Codex更名为ChatGPT Work——OpenAI说,,,, ,,从今天最先,,,, ,,Codex app会并入新的ChatGPT desktop app;;; ;;Codex仍然是面向开发者和手艺职员的强盛编码Agent,,,, ,,但也会和Chat、Work一起泛起在统一个桌面应用里。 。。。

OpenAI自己此前已经在把Codex往“所有人的生产力工具”偏向讲了,,,, ,,说 Codex在资助差别职业的人自动化日常事情、加速产出、镌汰知识事情的瓶颈。 。。。而现在,,,, ,,真正合并的时间,,,, ,,它反而把Codex的能力拆成了两个部分。 。。。

Codex这个入口仍然保存,,,, ,,继续面向开发者和手艺职员,,,, ,,认真代码、客栈、PR、diff、review、多客栈项目等工程使命。 。。。

但Codex背后那套更有价值的工具——接使命、读上下文、挪用工具、分方法执行、最后交付效果的能力——被笼统了出来,,,, ,,放进了ChatGPT Work。 。。。

也就是说,,,, ,,ChatGPT现在有三个入口:Chat认真对话,,,, ,,Codex认真编码,,,, ,,Work认真通用办公使命。 。。。

暂时来讲,,,, ,,又往超等入口迈了一步。 。。。

现实体验:更适合日常使命

许多获得了GPT-5.6早期会见权限的网友分享了他们的使用体验。 。。。

总的来说,,,, ,,GPT-5.6 Sol精彩的地方并不在于极限攻坚(许多人提到它在性能上和Fable 5尚有一段距离),,,, ,,但它在日常事情上获得了用户的信任:用户愿意天天开着它,,,, ,,把大宗日常使命、细节检查、上下文判断和中心历程交给它。 。。。

有网友以为,,,, ,,Sol像一个有魅力、高效、有才华、让人羡慕的同事;;; ;;Fable则像一个有点拧巴的天才,,,, ,,在自己执着的问题上极其精彩,,,, ,,但不太适合日常相处。 。。。

在他的体验里,,,, ,,Fable仍然适合那些目的极其明确的使命,,,, ,,好比定向调试、清静问题和性能优化。 。。。由于这类使命有清晰的奖励函数,,,, ,,模子可以一直往一个确定目的上猛推。 。。。

但一旦回到更常见的日常事情,,,, ,,Sol的优势就展现出来了:它更随手,,,, ,,更会配合,,,, ,,也更适合长时间协作。 。。。

以是,,,, ,,或许更好的方式是让Fable去出谋划策,,,, ,,然后拿Sol去执行。 。。。

另一位网友的评价则更靠近团队层面的行为转变。 。。。他说,,,, ,,自己的团队在使用模子时较量守旧,,,, ,,但GPT-5.6对他的团队爆发了重大影响:他们现在消耗的token数目,,,, ,,是已往的5倍。 。。。

他同样以为GPT-5.6不如Fable 5智慧,,,, ,,但更可靠。 。。。

说到“使用的token数目是已往的5倍”,,,, ,,我一最先还以为他在吐槽GPT-5.6对token消耗太快,,,, ,,看了谈论区才知道并不是这样。 。。。

主要是由于用得多,,,, ,,以是消耗得多,,,, ,,这其中的要害在于他们愿意去用。 。。。

不过5倍的token消耗并不代表生产力提升了5倍,,,, ,,这位网友体现,,,, ,,他们并没有5倍的好点子去推动生产力。 。。。

多出来的token,,,, ,,大部分不是用来堆更多产出,,,, ,,而是用来提高已有事情的质量,,,, ,,像是重复检查每一个细小决议、处理种种边沿情形、补上一些容易被忽略的打磨环节什么的。 。。。

但至少,,,, ,,他的团队愿意把更多细节交给模子一起推敲。 。。。

在代码能力上,,,, ,,网友Tim Neutkens的评价很是详细——他是Vercel的Next.js手艺认真人,,,, ,,也是Next.js的配相助者之一。 。。。这是个大型开源框架,,,, ,,在业内很有影响力,,,, ,,并且是现代前端里很是主流的一套框架。 。。。

他们已经测试了Sol两个多月(那么长),,,, ,,而在Next.js项目的日常事情中,,,, ,,Sol体现相当精彩。 。。。他说Sol能明确架构取舍,,,, ,,视察重大的Next.js项目,,,, ,,在修bug时思量代码库的其他部分,,,, ,,并且险些不需要太多指导,,,, ,,用很短的提醒就够了。 。。。

并且Sol已经加入了一些Next.js服务器的大型重构事情。 。。。他们只需要指出高条理的刷新偏向,,,, ,,Sol就能端到端实现。 。。。

有个早期用户则给出了较量降温的评价,,,, ,,他以为GPT-5.6 Sol并不像Fable那样代表一次重大的转变或全新架构,,,, ,,它更像是在GPT-5.5基础上充分打磨出的升级版。 。。。

思量到这次更新花了约莫三个月,,,, ,,它甚至很难说有什么了不起。 。。。

不过,,,, ,,再思量到它的价钱(Sol和5.5同价)和能力的提升,,,, ,,GPT-5.6 Sol依然是现在订阅制下能用到的最好模子。 。。。

这位网友还提到了前端用户界面——不过这里指的是OpenAI自己的产品界面,,,, ,,而不是Sol的前端代码能力。 。。。

事实上,,,, ,,Sol的前端代码能力反而是早期评价里较量亮眼的部分。 。。。

不过对前端页面的审美几多有些见仁见智的意思,,,, ,,详细感受可能照旧需要自己去实验。 。。。

简朴地说,,,, ,,GPT-5.6 Sol至少不像一次标准意义上的大代际更新,,,, ,,事实也执偾版本号+0.1的水平——只是GPT-5.5之后的一个小版本。 。。。

虽然,,,, ,,它在撒播上确实取得了很大的胜利。 。。。先是提前良久就最先吊胃口,,,, ,,又遇上了美国对前沿模子增强羁系的配景。 。。。唬; ;I杏蠸ol、Terra、Luna这套太阳系命名,,,, ,,也给它蒙上了一层很厉害的滤镜。 。。。

回到现实评价里,,,, ,,Sol的焦点故事反而没有那么玄乎,,,, ,,只是比GPT-5.5更快、更适合日常使命,,,, ,,价钱上也没什么转变。 。。。

按理来讲,,,, ,,这种转变着实是足够的,,,, ,,但放在人家Anthropic从4到5的升级旁边,,,, ,,照旧差点意思。 。。。它在许多使命上不如Fable 5也算正常,,,, ,,价钱和版本号差在这里。 。。。

说到大代际,,,, ,,有网友透露,,,, ,,GPT-5.6将是5.x系列中的最后一批模子(三个模子)。 。。。GPT-6可能在本月稍晚一些或者下个月宣布。 。。。

OMT:花园里的两条路

只管听起来没有“前沿模子重大跃迁”那么刺激,,,, ,,但对Agent来说,,,, ,,性价比很是主要。 。。。

通俗谈天,,,, ,,用户问一句,,,, ,,模子答一句,,,, ,,本钱再高也有限。 。。。但Agent要干活,,,, ,,就不是一句两句的事了——对上下文的读取以及对现真相形的检查,,,, ,,造成的token消耗险些难以计量。 。。。

到了Agent时代,,,, ,,问题不但是“谁最智慧”,,,, ,,还包括“谁足够智慧、足够快,,,, ,,并且能被大宗挪用”。 。。。

GPT-5.6这次就有点像是在回覆这个问题。 。。。值得关注的不但有Sol,,,, ,,它一次给出了三个版本,,,, ,,分工也很明确:重大使命交给Sol,,,, ,,日常使命交给Terra,,,, ,,高频、轻量、容易验证的使命交给Luna。 。。。

若是说GPT-5.6是模子底座,,,, ,,ChatGPT Work就是它真正干活的地方。 。。。有了详细的使用场景,,,, ,,GPT-5.6的性价比才真正有了意义。 。。。

不是所有事情都要请最贵的专家来做,,,, ,,许多时间,,,, ,,一个足够稳固、足够自制的模子,,,, ,,才是事情流真正跑起来的要害。 。。。

提及来,,,, ,,最近这两天的新模子宣布,,,, ,,有一点“自制模子批量放送”的意思。 。。。

xAI昨天宣布的Grok 4.5、Meta刚刚推出的Muse Spark 1.1,,,, ,,主打的也都是自制、快速、高性价比。 。。。

事实上我并不是很爱看跑分,,,, ,,经常用AI的都知道,,,, ,,benchmark和现实使用上的体感是两码事,,,, ,,但价钱是实打实的价钱。 。。。

按每100万token计费,,,, ,,xAI的Grok 4.5的价钱是输入2美元、输出6美元,,,, ,,xAI官方还强调它具备约2倍的token使用率;;; ;;Meta刚推出的Muse Spark 1.1更低,,,, ,,输入1.25美元、输出4.25美元。 。。。

这着实是一个很大的转变。 。。。

已往,,,, ,,前沿模子的竞争很像跑车宣布会:比谁的马力更大,,,, ,,谁的极速更高,,,, ,,谁能在最难的测试里跑出最好效果。 。。。

但Agent时代更像商用车市场,,,, ,,用户不但体贴它能不可跑得快,,,, ,,还体贴它省不省油、耐不耐用。 。。。

OpenAI、xAI和Meta看起来都在往这个偏向靠:把足够强的模子做得更自制、更快、更适合规模唬; ;;灿谩 。。。

就Anthropic,,,, ,,在证实晰自己的实力以后,,,, ,,仍然在另一条路上继续狂奔。 。。。

Anthropic虽然也在做事情流——甚至做得很是好,,,, ,,只不过它的重点和OpenAI不太一样。 。。。我一直以为Anthropic的工具保存一定的使用门槛,,,, ,,很强调协作质量和人的判断。 。。。

或者说,,,, ,,它并不那么防呆。 。。。以是才会有那么多的Claude使用指南,,,, ,,教你怎么把“最强AI工具”用到极致。 。。。

拿它破晓刚刚推出的Reflect with Claude功效举例,,,, ,,它甚至专门让用户回看自己已往1、3、6、12个月怎样使用Claude,,,, ,,剖析常见使命和使用模式,,,, ,,并提醒用户思索哪些事情适合交给AI,,,, ,,哪些仍然应该自己完成。 。。。

简朴地讲,,,, ,,OpenAI的事情流更强调规模唬; ;;灿,,,, ,,而Anthropic的事情流更强调高质量协作。 。。。它们的主流模子看起来也很切合这种气质。 。。。

我们很难简朴评价这两条蹊径的正误,,,, ,,它们更像是花园里的两条路。 。。。不过现在看来,,,, ,,拥有最顶级模子的Anthropic似乎更胜一筹。 。。。

一方面是估值,,,, ,,市场给出了它的谜底。 。。。另一方面,,,, ,,Fable(Mythos)只是Anthropic的顶级模子,,,, ,,它尚有Opus、Sonnet和Haiku,,,, ,,在性价比上未必落了下风。 。。。

不过,,,, ,,看起来OpenAI今天的更新照旧给Anthropic带来了一些紧迫感。 。。。

除了把Fable5的使用限制延伸到了7月12日,,,, ,,它今晚还为所有用户重置了限额。 。。。

果真,,,, ,,有竞争才有动力啊……

(作者:袁心玥)

摄影:黄敬文 谢环驰 李响 殷博古 李涛 饶爱民 翟健岚

责任编辑:吕智文    校对:沈晓雯

今日热门

  1. 战国水晶杯,,,, ,,“谜底”何时揭??????
  2. 揭秘燃气“清静线”:排查用气隐患 守护千家万户平安
  3. 南京台青希望将创意墟市“搬”到台湾:“只要心在一起、情在一起,,,, ,,未来就在一起”
  4. 联合国呼吁各方坚持榨取
  5. 多地州里剃头店被英国公司起诉
  6. 女孩伤风服药店配药后急性心衰殒命
  7. “香格里拉”花之旅启幕 邀游客共赏雪域高原万紫千红
  8. 国际人士:中国关于全球治理的白皮书回应国际社会普遍诉求
  9. 法国华侨华人会第25届主席团就职仪式在巴黎举行
  10. 2026两岸媒体高层浙江行活动在金华启动

相关推荐

【网站地图】