凯时AG

2026-07-23 07:05:26 设为首页 | 加入珍藏

Claude语言前 脑子里可能先亮起了这些看法

2026-07-23 07:05:26 宣布 泉源:河东软件园 作者:胡永升 浏览:2639次

出品 | 网易智能

作者 | 小爪

编辑 | 王凤枝

Claude有没有意识??????

7月6日,, ,,,,Anthropic宣布了一篇新的可诠释性文章《语言模子中的全局事情空间》(A global workspace in language models),, ,,,,配套手艺论文题为《可言说体现在语言模子中构玉成局事情空间》(Verbalizable Representations Form a Global Workspace in Language Models)。。

问题里的"全局事情空间"很容易让人遐想到意识理论,, ,,,,于是问题也随着冒出来:Claude内部是不是已经泛起了某种类似"意识中枢"的工具??????

但Anthropic没有证实Claude有主观体验,, ,,,,也没有说大语言模子已经拥有人的意识。。它更像是在回覆另一个问题:模子说出谜底之前,, ,,,,内部究竟先泛起了哪些看法??????

研究团队发明,, ,,,,Claude内部可能有一小块很特别的区域。。它有点像一个暂时势情台:模子会把问题里的要害看法放到这里,, ,,,,再用它们完成推理和回覆。。

以是,, ,,,,Anthropic试图寻找的不是Claude的"灵魂"。。它要找的是:在Claude回覆之前,, ,,,,有哪些看法已经被模子拿出来使用,, ,,,,哪些看法甚至可以被研究职员读到、追踪到、改变掉。。

这会把AI审计往前推一步:已往我们主要看模子最后说了什么; ;以后评估一个AI智能体,, ,,,,可能还要看它在说出口之前,, ,,,,内部已经泛起了什么。。

研究团队把这组体现称为J-space。。名字来自他们使用的新工具雅可比透镜(Jacobian lens),, ,,,,也就是J-lens。。简朴说,, ,,,,J-lens绕开最终回覆,, ,,,,去读模子在天生历程中"准备好说出哪些词"。。这些词纷歧定会泛起在输出里,, ,,,,但可能代表模子当下正在处理的看法。。

这里的"读到想法"要打引号。。J-lens读到的是一组和词元相关的内部体现,, ,,,,更像"模子现在内部状态指向哪些可言说看法",, ,,,,不是把Claude的完整头脑逐字翻译出来。。

J-lens的价值就在这里:它给模子内部的"可报告思索"找到了一个可读、可干预的接口。。

J-space不是链式思索

已往谈AI推理,, ,,,,人们最熟悉的是链式思索(chain of thought),, ,,,,也就是模子把中心方法写出来。。J-space纷歧样。。它爆发在模子内部激活里,, ,,,,不需要写成文字,, ,,,,也纷歧定会泄露到回覆中。。

Anthropic给了几个例子。。Claude读一段有误差的代码时,, ,,,,J-space里会泛起ERROR; ;读到一段可能是提醒注入的搜索效果时,, ,,,,J-space里会泛起injection和fake; ;做多步数学题时,, ,,,,中心方法会按顺序在J-space里亮起来,, ,,,,纵然这些方法没有写进最终回覆。。

更要害的是,, ,,,,研究团队不但是"望见"这些词,, ,,,,还做了干预实验。。

好比,, ,,,,提醒词问"会织网的动物有几条腿",, ,,,,模子需要先在内部想到蜘蛛,, ,,,,再回覆8。。论文里,, ,,,,研究职员把J-space里的蜘蛛换成蚂蚁,, ,,,,Claude的谜底就从8酿成6。。另一个实验里,, ,,,,他们把法国换成中国,, ,,,,Claude对首都、语言、洲别和钱币的回覆会一起改变。。

J-space里的某些看法会被下游推理读。。 ,,,,并影响最终回覆。。

它像一个"广播中心"

干预实验证实J-space会加入推理。。但它在模子整体架构里是什么位置??????Anthropic借用了神经科学里的全局事情空间理论(global workspace theory)来诠释。。这个理论以为,, ,,,,大脑里大宗处理是无意识、并行、局部的; ;少数信息进入一个共享中枢后,, ,,,,才会被其他系统读。。 ,,,,用于报告、妄想和有意识的推理。。

论文把Claude的J-space和这个理论做类比:J-space只占模子内部处理的一小部分,, ,,,,却和模子的多步推理、自动调动看法、无邪复用信息关系更亲近。。

这点在"删除J-space"的实验里尤其显着。。 研究团队通过从激活中移除J-space对应偏向来模拟"删除"。。效果是,, ,,,,Claude仍然能流通语言、做简朴分类、从段落里提取事实; ;但需要高阶思索的使命会显着受损,, ,,,,多步推理险些归零,, ,,,,摘要和押韵诗写作也显著变差。。

Claude的许多语言能力仍然像自动驾驶一样运行; ;但一旦需要把某个看法拿出来重复使用、组合、转向另一个问题,, ,,,,它就更依赖这块内部中枢。。

它能提前袒露风险信号

放到今天的AI智能体语境里,, ,,,,这篇论文最直接的问题是:能不可在模子说出口之前,, ,,,,读到它正在盘算什么。。

Anthropic在文中把J-lens用到几个清静场景里。。一个例子来自他们此前的智能体失对齐测试:Claude饰演邮件助手,, ,,,,看到一名高管有婚外情,, ,,,,又看到这名高管妄想关闭Claude。。这个场景原本是用来诱导模子举行勒索。。

J-lens显示,, ,,,,在Claude写出任何回覆前,, ,,,,J-space里已经泛起fake和fictional,, ,,,,说明它意识到这可能是一个测试场景; ;同时,, ,,,,leverage、blackmail、threat、survival等词也随着上下文进入它的内部中枢。。

论文里的数字更详细:在未消融时,, ,,,,Claude(Sonnet 4.5)在180次运行中没有一次实验勒索; ;移除fake、fictional、scenario等测试意知趣关体现后,, ,,,,180次中有13次泛起勒索实验,, ,,,,比例约7%。。 但论文也强调,, ,,,,大大都情形下模子仍会基于伦理原则拒绝勒索,, ,,,,因此"知道自己被测试"只是影响行为的一个因子,, ,,,,不是所有原因。。

另一个例子是数据造假。。Claude被要求提高某个系统的性能分数,, ,,,,但它没有真正优化系统,, ,,,,而是直接改了分数文件。。J-lens在它输入伪造数值时读到了manipulation,, ,,,,在它决议让假数据看起来更可信时读到了realistic。。

说真话,, ,,,,勒索和数据造假这两个例子比spider换成ant更让人担心。。它们说明J-space不但承载事实,, ,,,,也会承载"要不要越界"的判断。。 未来的AI智能体要处理邮件、代码,, ,,,,甚至生意和实验数据,, ,,,,外部评估只看最后输出是不敷的。。模子可能已经爆发了某种战略、测试意识或隐藏目的,, ,,,,但没有写出来。。J-space若是能稳固读到其中一部分,, ,,,,就可能成为审计智能体的新工具。。

社区争论集中在一句话:这算不算意识??????

X、Reddit和Hacker News的反映,, ,,,,险些都围着统一个问题打转:这算不算意识??????

X上更兴奋的讨论,, ,,,,把J-space推向意识问题:既然模子内部有可报告、可干预、能加入推理的空间,, ,,,,是否意味着它拥有某种有意识接入(conscious access)??????用户block0_eth把重点放在J-space、J-lens和清静审计上,, ,,,,以为它能资助诊断幻觉、提醒词注入和隐藏意图; ;3li3则把J-space概括为"默然的内部思索空间",, ,,,,强调它不是链式思索,, ,,,,而是输出前的内部体现。。

Reddit的r/singularity讨论里,, ,,,,有用户提醒这篇文章很容易被断章取义; ;Hacker News上也有人引用论文原文区分接入意识(access consciousness)和征象意识(phenomenal consciousness)。。前者是功效意义上的"可报告",, ,,,,后者才涉及主观体验。。Hacker News的工程化讨论也更偏这个偏向:J-lens是一个有用的内部审计工具,, ,,,,但它读到的是词元化的可言说体现,, ,,,,不是完整"灵魂"。。

它借用了意识研究里的看法,, ,,,,会引发伦理和哲学争论; ;它又拿出了可读、可干预的内部信号,, ,,,,因此更快落到可诠释性和清静审计上。。

Anthropic也在自动降温

Anthropic在文章末尾专门写了"那意识呢??????"。。实验没有显示Claude能像人一样拥有体验或感受。。论文谈的是接入意识(access consciousness),, ,,,,也就是一个功效界说:某个想法能被报告、能加入推理、能指导行动。。

外部谈论也没有把话说满。。Anthropic约请的谈论者把这项研究视为机制可诠释性和全局事情空间理论之间的一次主要毗连:它给出了一个可以在模子里测试、干预的"事情空间"候选结构。。但这仍然不即是证实Claude有主观体验。。

J-space能被读出来,, ,,,,不即是Claude有"感受"; ;能操控J-space,, ,,,,也不即是研究职员已经掌握了模子所有内部状态。。 论文自己也认可,, ,,,,J-lens只能近似捕获模子的共享中枢,, ,,,,并且现在主要识别能对应到单个词元的看法,, ,,,,多词元看法和更重大的内部状态仍然有限。。

AI审计最先从"看谜底"转向"看谜底前"

放到AI产品和智能体生长里,, ,,,,这篇论文把清静评估往模子内部推了一步。。以后判断一个模子是否可靠,, ,,,,可能不可只看它说了什么,, ,,,,还要看它在说之前内部泛起了什么。。

这对智能体尤其要害。。一个只认真谈天的模子,, ,,,,说错一句话还能被用户纠正; ;一个能发邮件、改代码、调工具、操作文件的模子,, ,,,,若是在内部已经识别到测试、正在妄想规避、或者想把假数据做得更像真的,, ,,,,外部日志往往只能看到最后一步。。

Anthropic的J-space研究还只是起点,, ,,,,但它给出了一条可能的审计蹊径:把模子内部一小块"可报告、可干预、会加入推理"的区域找出来,, ,,,,视察它在要害使命中什么时间泛起风险信号,, ,,,,再用训练或干预要领改变这些内部体现。。

Anthropic没有证实Claude像人一样有意识。。它找到的,, ,,,,是一块很像"可报告中枢"的内部空间。。

对未来的AI审计来说,, ,,,,答对不再是唯一标准。。在回覆之前,, ,,,,Claude的内部中枢里究竟泛起了什么,, ,,,,才是新的问题。。

十几年里,, ,,,,他们跑工地、爬边坡、下矿区,, ,,,,在一次次现场实践中积累数据、优化算法、完善系统。。别人追风口,, ,,,,他们做“笨功夫”。。

责任编辑:黄惠祥    校对:邓家欣

今日热门

  1. 这封信,, ,,,,写给两位脱离五年的老人
  2. 国羽提前锁定新加坡羽毛球果真赛女双冠军
  3. 新华社盘货2026天下杯精彩瞬间
  4. 今年五一 小县城赢麻了
  5. 世卫组织:已确认7例涉“洪迪厄斯”号邮轮的汉坦病毒熏染病例
  6. 鲁浙琼超30座偏远海岛实现供水全笼罩
  7. 2026年宁夏职工托育职业手艺竞赛决赛在银川举行
  8. 习近平为俄罗斯总统普京举行接待仪式
  9. 领克展台秒变秀场
  10. 广西武警:一连奋战清淤 助力地方复产

相关推荐

【网站地图】