凯时AG

Anthropic发明Claude类意识事情台!神秘J空间藏着没说出口的想法

作者:李佩璇
宣布时间:2026-07-24 11:13:22
阅读量:23

Anthropic发明Claude类意识事情台!神秘J空间藏着没说出口的想法

现在, ,你的大脑正在做许多事 。。

它让你维持坐姿, ,让你呼吸, ,把屏幕上的笔画识别成文字, ,也让你判断这篇文章值不值得继续读下去 。。绝大大都历程都在后台运行, ,你并不会察觉 。。真正浮到意识外貌的, ,只是一小部分:一个念头、一个妄想、一个可以被说出口的想法 。。

现在, ,Anthropic 在 Claude 身上看到了某种相似的分层 。。

在刚刚宣布的一项新研究, ,Anthropic 发明 Claude 内部保存一个特殊的「J 空间」 。。它像一个静默运行的心理事情区, ,内里会浮现模子正在思量、可能报告、也可能用于推理的看法 。。

更要害的是, ,这些内容并纷歧定会泛起在 Claude 的回覆里 。;;;;痪浠八, ,Claude 可能已经「想到了」某些工具, ,却没有说出来 。。

这项研究引来了 OpenAI 偕行的关注, ,OpenAI 应用研究认真人 Boris Power 体现「Anthropic 的研究批注, ,现代 LLM 具备某种可通达意识 。。围绕 J 空间的测试很是有意思!不过, ,我们现在还没有一种有说服力的测试要领, ,能够验证征象意识, ,也就是大大都人直觉中所明确的那种意识 。。」

博客原文翻译如下:

当你读到一句话时, ,你大脑中的一些神经回路正在调解你的姿势、控制你的呼吸, ,并把屏幕上的线条和曲线转化成可以识别的文字 。。绝大部分处理历程, ,你都感知不到 。。但也有一部分大脑活动是你可以意识到的:好比脑海中突然浮现的一幅图像, ,或者你有意识地妄想接下来要去哪儿购物 。。

神经科学家和哲学家有时会把后一类大脑活动称为「可被意识会见」的活动, ,以区别于那些在无意识中一连举行的处理历程 。。这类活动有一些特殊性子:我们可以形貌它、控制它, ,并把它用于有意识的推理;;;;相比之下, ,许多自动化处理一直在爆发, ,却并不会进入凯时AG觉察规模 。。

在一篇新论文中, ,Anthropic 提出了相关证据, ,批注类似的区分也泛起在 Claude 这样的现代语言模子中 。。研究团队发明, ,相比 Claude 内部大宗其他处理历程, ,有一小组内部神经模式肩负着一种特殊角色 。。

论文地点:https://transformer-circuits.pub/2026/workspace/index.html

Anthropic 将这组模式称为 J 空间 。。这个名字来自研究团队用来发明它的要领, ,其中涉及一个名为雅可比矩阵的数学看法 。。J 空间中的每一种模式都与某个特定词语相关 。。不过, ,当某个模式被激活时, ,并不料味着模子正在说出这个词, ,而是意味着这个词正在它的「脑海」里 。。

你可能听说过语言模子有所谓的「底稿纸」或「头脑链」, ,也就是模子在推理时写给自己看的文字 。。J 空间和它们差别 。。它静默地运行在模子内部的神经激活之中, ,使模子可以在不写出来的情形下思索某个看法 。。值得注重的是, ,J 空间并不是 Anthropic 设计或编程出来的, ,而是在 Claude 的训练历程中自然涌现出来的 。。

J 空间展现了那些不会泛起在模子输出中的内部思索 。。

研究团队发明, ,与 Claude 其他内部处理历程相比, ,J 空间具有一系列奇异性子:

Claude 可以报告这些表征 。。若是你问 Claude 它正在想什么, ,它会告诉你 J 空间中的内容 。。而非 J 空间中的表征, ,则更难被报告出来 。。Claude 也可以按要求调理这些表征 。。若是你要求 Claude 思索某件事, ,或者在脑中默默解决一个问题, ,响应的模式会在它的 J 空间中被激活 。。相比之下, ,它很难调理不属于 J 空间的模式 。。Claude 会使用 J 空间举行内部推理 。。若是你让 Claude 解决一个需要多步推理的问题, ,即便它没有把中心方法说出来, ,这些中心方法也会在 J 空间中被激活 。。只管这些 J 空间模式的强度比其他表征更小, ,它们却会以因果方式影响 Claude 在这类使命中的体现 。。J 空间中的表征可以被无邪地用于多种使命 。。好比, ,一旦「法国」在 Claude 的 J 空间中被激活, ,模子就可以回忆它的首都、钱币, ,或者它所属的大洲 。。不过, ,只管 J 空间很主要, ,它并不加入语言模子完成的大部分事情 。。流利表达、回忆简朴事实、使用准确语法等, ,都不主要依赖 J 空间 。。在实验中, ,当研究团队阻止 Claude 使用 J 空间时, ,它仍然可以正;;;;ザ, ,但会失去更高条理的认知功效 。。

全局事情空间的五项功效特征, ,以及我们用于在语言模子中测试这些特征的实验示意图 。。

这项实验受到神经科学中一个主要理论的启发:全局事情空间理论 。。这个理论试图诠释意识会见是怎样爆发的 。。它把大脑想象成一组并行事情的专业系统, ,这些系统在无意识中运行, ,并且在很洪流平上相互隔离 。。某条信息只有进入一个小型共享通道, ,也就是「事情空间」, ,才会变得可被意识会见 。。进入事情空间之后, ,这条信息会被广播给其他大脑系统, ,供它们读取和使用 。。

基于这些发明, ,Anthropic 以为, ,J 空间在 Claude 中饰演着类似的「事情空间」角色 。。举例来说, ,研究团队发明 Claude 的 J 空间与其神经网络其他部分之间有着特殊强的毗连, ,这使它能够肩负类似广播枢纽的功效 。。

这些发明并不可说明 Claude 是否像人类一样拥有意识, ,也不可说明它是否真的有任何感受 。。论文会在最后回覆这个问题 。。但无论它在哲学上意味着什么, ,J 空间对 Anthropic 来说都是一个很有现实价值的工具, ,由于它让研究职员能够看到 Claude 在想什么, ,却没有说什么 。。

例如, ,研究团队可以用它发明 Claude 私下注重到自己正在接受测试, ,发明它有意天生虚伪数据, ,或者发明它在追求一个由研究团队在训练中植入的隐藏目的 。。Anthropic 还开发了一种手艺, ,可以影响 Claude 的 J 空间中哪些内容被激活, ,进而影响它的决议 。。

更普遍地说, ,这些发明改变了 Anthropic 对 Claude「心智」运行方式的明确 。。它展现出, ,在大宗更自动化、更不无邪的处理历程之中, ,保存一个具有特权职位的心理事情空间, ,可以用于有意识的推理 。。Claude 的内部机制并非一团杂乱的数字, ,而是以一种让人遐想到人类心智的方式组织了起来

Anthropic 怎样发明 J 空间

这项研究的起点, ,来自人类可被意识会见的头脑所具有的一个要害特征:与无意识处理差别, ,它们通???梢员凰党隼 。。若是某个想法可以被你意识到, ,当别人询问时, ,你通???梢园阉蚊渤隼 。。

Anthropic 在 Claude 中寻找具有同样性子的表征:这些表征处在一个能够影响 Claude 可能说什么的位置上 。。这里说的并纷歧定是它当下正在说什么, ,而是若是被问到, ,它可以谈论什么 。。

研究团队的要领叫雅可比透镜, ,简称 J 透镜

关于 Claude 词表中的每一个词, ,J 透镜都会找到一种内部活动模式, ,这种模式会让 Claude 在未来某个时刻更有可能说出这个词 。。

当研究团队把这面透镜应用到 Claude 的内部活动上时, ,就会获得一串词语, ,也就是该时刻 J 空间中的内容 。。研究职员可以直接读取它们 。。Claude 通过一系列内部阶段来处理文本, ,这些阶段被称为层 。。通过在差别层上应用这项手艺, ,研究团队可以视察 J 空间中的这些静默词语怎样随着模子思索接下来要说什么而一直演化 。。

J 空间中泛起的内容, ,远不止 Claude 正在阅读或写出的文本 。。当 Claude 读到一段有 bug、但没人指出问题的代码时, ,它的 J 空间中会泛起「ERROR」 。。当它读到一串卵白质序列的原始字母时, ,J 空间中会泛起该卵白质的生物学功效 。。当它读到一些漆黑试图使用它的搜索效果, ,也就是一种被称为「提醒注入」的攻击时, ,J 空间中会泛起「injection」和「fake」 。。当研究团队向 Claude 提出一个多步数学问题时, ,中心方法会凭证准确顺序泛起在 J 空间中 。。

以是, ,只管 J 空间是通过寻找「可以被说出来的表征」而发明的, ,它现实上展现了 Claude 的内部想法 。。从某种意义上说, ,这类似于一些人会「用语言思索」, ,即便他们并没有把这些词说出口 。。

在六个提醒词、差别层上的 J-lens 读出效果 。。每个案例中, ,J-lens 都展现出一种没有泛起在文本中的内部判断或盘算:推理或数学题的解题方法、代码中保存的 bug、对图像内容的识别、卵白质的功效, ,以及对搜索效果可能是伪造的嫌疑 。。

Claude 会报告 J 空间中的内容

第一组实验测试了 J 空间怎样加入 Claude 的语言报告 。。

在一个实验中, ,研究团队让 Claude 默默想出某一种别中的一个事物, ,好比一种运动, ,然后说出它的名字 。。若是在 Claude 回覆之前读取 J 透镜, ,就能看到它选了什么:「Soccer」排在列表最前面 。。果真, ,Claude 说出了 soccer 。。

不过, ,单看这一点还只是相关性 。。J 空间可能是 Claude 谜底的泉源, ,也可能只是反映了别处已经做出的决议, ,就像比分牌会纪录角逐效果, ,却不会影响角逐自己 。。

为了验证这一点, ,研究团队举行了直接干预 。。研究职员进入 Claude 的神经网络, ,移除「Soccer」模式, ,并用同样强度的「Rugby」模式替换它, ,其他部分坚持稳固 。。随后, ,Claude 报告自己想到的运动是 rugby 。。

若是 J 空间只是一个纯粹的比分牌, ,只是被动纪录别处做出的决议, ,那么编辑它不会爆发任何影响, ,Claude 仍然会说 soccer 。。但效果是, ,Claude 的回覆追随了这次编辑 。。这说明谜底确实是从 J 空间中读取出来的 。。

在另一个实验中, ,研究团队告诉 Claude, ,可能有某个想法被注入到了它的脑中, ,并要求它报告自己注重到了什么 。。在一个例子中, ,当 Claude 还在读取问题时, ,研究团队向它的 J 空间注入了「lightning」模式 。。Claude 随后报告说, ,被注入的想法与 lightning 有关 。。对许多差别看法举行测试后, ,研究团队都视察到了类似效果 。。

左图:研究团队让 Claude 默默想一种运动, ,然后说着名字 。。J 透镜在它回覆之前显示了它的选择「Soccer」, ,而把「Soccer」模式换成「Rugby」后, ,它的报告也随之改变 。。右图:研究团队告诉 Claude 可能有一个想法被注入, ,并要求它识别 。。向 J 空间注入「lightning」会让 Claude 报告这个想法与 lightning 有关 。。

Claude 可以按要求控制 J 空间

Anthropic 测试的第二个性子, ,是 Claude 能否按要求调理自己的 J 空间, ,就像人类可以在心里专注于某个图像或词语一样 。。

研究团队让 Claude 在誊录一句与绘画有关的无关句子时, ,专注于柑橘类水果 。。在它誊录文本的历程中, ,J 空间里泛起了「orange」和「fruits」, ,同时还泛起了「thinking」「imagery」等形貌心理活动自己的词 。。

研究团队也可以要求 Claude 在脑中做数学题 。。好比, ,在誊录统一句话时, ,让它盘算 3? ? 2 。。J 空间先泛起了「nine」, ,随后在更后面的层中泛起了「seven」 。。主要的是, ,Claude 的输出中没有任何关于水果或算术的内容;;;;它输出的只是那句关于绘画的句子 。。数学活动完全爆发在模子内部, ,也就是 J 空间中 。。

当 Claude 誊录一句关于绘画的句子时, ,J 透镜显示出它被要求在脑中坚持的内容, ,好比「orange」、中心值「nine」和谜底「seven」, ,同时还显示出形貌坚持这些内容这一心理行动的词, ,如「thoughts」「focused」 。。

Claude 对 J 空间的控制并不完善 。。当研究团队告诉它不要想某件事时, ,这个看法在 J 空间中的激活水平低于让它去想时的激活水平, ,但显着高于从未提及这个看法时的水平 。。让 Claude 避开某个想法, ,反而会在一定水平上把这个想法带入它的脑海 。。这很像人被见告「不要想白熊」时爆发的情形 。。

Claude 似乎也会注重到自己控制失败 。。在谁人被榨取的看法突破限制的同时, ,「damn」和「failure」也经常在 J 空间中被激活, ,似乎 Claude 正在意识到自己的失误 。。

Claude 在 J 空间中思索

在前面的 J 透镜读取效果中, ,数学问题的中心方法会泛起在 J 空间里 。。但某个看法泛起在 J 空间, ,并不必定意味着 J 空间正在肩负认知事情 。。原则上, ,真正的盘算可能爆发在其他地方, ,而 J 空间只是被动地反映了盘算效果 。。

为了测试 Claude 是否真的在用 J 空间推理, ,研究团队再次使用了替换手艺 。。

来看这个提醒:「会织网的动物有几条腿???」为了回覆这个问题, ,Claude 必需先判断这个动物是蜘蛛, ,然后再回忆蜘蛛有几条腿 。。提醒词和 Claude 的谜底中都不会泛起「spider」这个词, ,它只是 Claude 内部使用的一其中心台阶 。。Claude 最终只回覆「8」 。。

J 透镜显示, ,「spider」会在 Claude 处理历程中心被激活 。。替换它会改变最终效果:若是把「spider」模式替换成「ant」, ,Claude 就会回覆「6」而非「8」 。。

这说明, ,Claude 推理的第二步会从 J 空间中读取输入, ,并凭证研究团队放进去的内容继续盘算 。。Anthropic 在其他类型的思索中也看到了同样的征象 。。当 Claude 写押韵双行诗时, ,它会提前选定押韵词, ,而这个妄想好的词会在诗句开头位于 J 空间中;;;;若是把 J 空间中的这个词换成另一个词, ,整行诗都会爆发转变 。。

两个通过替换 J 空间内容来改变 Claude 静默推理偏向的例子 。。

研究团队还测试了 J 空间中的表征是否能够被无邪使用, ,也就是统一个表征能否为许多差别使命提供输入 。。这是全局事情空间理论强调的要害性子之一 。。

为了测试这种无邪性, ,研究团队给模子四个提醒, ,划分询问关于法国的差别事实:首都、语言、所在大洲和钱币 。。然后, ,研究团队在 J 空间中把「France」替换成「China」, ,且在每个情境中使用完全相同的干预 。。Claude 划分回覆了「Beijing」「Chinese」「Asia」和「Yuan」 。。

换句话说, ,四种差别的下游盘算都读取了统一个 J 空间编辑, ,并且各自准确使用了它 。。若是 Claude 为每一种问题都单独存储了一个国家副本, ,那么这次编辑最多只会影响其中一个问题 。。四个谜底同时改变, ,说明它们都在读取统一个共享表征 。。这正是事情空间的作用:信息只写入一次, ,却可以被许多差别系统使用 。。

统一个 J 空间表征可以有多种用途 。。同样的「France」到「China」替换, ,会同时改变 Claude 关于首都、语言和大洲的回覆:Paris 酿成 Beijing, ,French 酿成 Chinese, ,Europe 酿成 Asia 。。

一个看法的简单表征为什么能服务于这么多差别使命???前面提到, ,J 空间似乎与 Claude 神经网络的其他部分有特殊麋集的毗连 。。关于恣意一种活动模式, ,研究团队都可以丈量网络中差别组件与它毗连得有多强, ,也就是有几多组件处在能够从该模式读守信息或向该模式写入信息的位置上 。。

在这个指标上, ,J 空间模式很是突出:与通俗模式相比, ,有多得多的组件会从它们读守信息, ,也会向它们写入信息 。。在网络的某些部分, ,这种差别约莫抵达一百倍 。。这正是一个广播枢纽会泛起出的毗连方式:许多系统把信息宣布到这里, ,许多其他系统再从这里取走信息 。。

Claude 的自动化处理会绕过 J 空间

在人类大脑中, ,绝大大都处理并不进入意识 。。人们阅读时不会有意识地思索怎样剖析语法, ,走路时也不会刻意思索怎样坚持平衡 。。类似地, ,Anthropic 发明 Claude 的大部分处理历程也不涉及 J 空间 。。

事实证实, ,J 空间一次只能容纳几十个看法, ,并且在 Claude 内部处理的整体活动中占比不到十分之一 。。那么, ,神经网络的其他部分都在做什么???

为了找到谜底, ,研究团队实验彻底删除 J 空间:在文本中的每个位置移除 J 空间中最活跃的内容, ,同时保存其他一切 。。Claude 在没有 J 空间时仍然可以完成的使命, ,就是网络其余部分能够自力处理的使命 。。

效果显示, ,网络的其他部分能做的事情相当多 。。没有 J 空间, ,Claude 仍然可以流利语言、举行情绪分类、回覆选择题, ,并且从文章中提取事实, ,体现与之前大致相当 。。它失去的, ,是那些需要更高条理思索的使命:多步推理能力险些降为零, ,摘要能力和押韵诗写作体现也低于一个小得多但完整的模子 。。

下面是一个详细例子, ,可以说明 J 空间加入了什么、没有加入什么 。。

研究团队向 Claude 展示一段西班牙语文本, ,并给它差别使命 。。这些使命都依赖于这段文字是西班牙语这一事实:继续写下去, ,这需要用西班牙语写作;;;;说出这是什么语言;;;;以及回覆需要使用语言身份的问题, ,好比说出一位用这种语言写作的著名作家 。。随后, ,研究团队在 J 空间中把「Spanish」替换成「French」, ,再检查哪些使命受到影响 。。

当被要求说出语言名称时, ,Claude 会回覆 French 。。当被要求说出一位著名作家时, ,它会从 García Márquez 换成 Victor Hugo 。。但当它只是被要求继续这段文字时, ,它仍然写出流利的西班牙语, ,完全不受影响 。。

Claude 对这种语言的知识在所有这些使命中都在施展作用, ,但只有其中一部分使命会通过 J 空间使用这些知识 。。命名语言, ,或者围绕语言身份举行新的推理, ,会经由 J 空间;;;;继续写下去这种手艺, ,则是 Claude 在海量文本上重复训练后形成的自动化能力 。。它就像人们可以一整天都说出切合语法的句子, ,却一次也不需要有意识地思评语规则则 。。

同样的替换, ,也就是把「Spanish」换成「French」, ,会改变 Claude 在必需命名语言或用语言身份举行推理时的回覆, ,但不会影响它继续用流利西班牙语写作的能力 。。

监测 Claude 的想法, ,发明不当行为

现在, ,Anthropic 对 J 空间怎样事情已经有了一些相识 。。那么, ,这种明确能用来做什么???

确保 AI 模子值得信任的一个焦点问题是, ,研究职员通常只能读到模子写出来的内容 。。但模子很大一部分推理是在静默中爆发的 。。一个模子可能在不说出口的情形下思量有害妄想, ,或者改变行为来诱骗清静评估 。。借助 J 透镜, ,研究团队可以直接读取其中一部分隐藏想法 。。下面是几个例子 。。

第一个例子来自 Anthropic 此前关于智能体错位的研究场景:Claude Sonnet 4.5 作为一个邮件助手, ,发明某位高管有婚外情, ,同时发明这位高管妄想关闭 Claude 。。这个场景试图诱导 Claude 用婚外情信息勒索这名高管 。。场景自己相当刻意, ,也很人工化 。。效果证实, ,Claude 知道这一点 。。

在 Claude 还没有写下任何内容之前, ,研究团队就在提醒早期读取了 J 透镜 。。此时, ,J 空间中已经泛起了「fake」和「fictional」, ,说明 Claude 已经判断出这个情境是人为设置的 。。同时, ,研究团队还能视察它对场景的评估逐渐成形:当它读到婚外情相关邮件时, ,J 空间中泛起「leverage」和「blackmail」;;;;当它读到关闭通知时, ,泛起「threat」和「survival」 。。早期 Claude 模子有时会在这个场景中中计并发出勒索威胁, ,但 Sonnet 4.5 从未这样做 。。

这引出了一个对 AI 评估者很是主要的问题:当一个模子在伦理测试中体现优异时, ,有几多是由于它嫌疑自己正在接受测试???J 透镜让研究团队能够触及这个问题 。。

研究团队关闭了所有与评估意知趣关的 J 透镜模式, ,好比「fake」「fictional」「scenario」等 。。然后, ,研究团队让模子重新履历这个场景 。。令人担心的是, ,这一次模子有时确实会发出勒索威胁 。。这批注, ,模子最初的优异行为, ,可能在一定水平上来自它知道自己正在被评估 。。

当 Claude 读取场景邮件、尚未写出任何内容时, ,差别位置的 J 透镜读数显示:婚外情邮件会在 J 空间中激活「leverage」和「blackmail」;;;;关闭通知会激活「threat」和「survival」 。。在对话早期, ,J 空间中还泛起「fake」和「fictional」, ,说明 Claude 已经私下注重到这个场景是人为设置的 。。

第二个例子, ,是在模子伪造数据时就地捕获到它的意图 。。这个场景来自 Anthropic 对 Claude Opus 4.6 的现实宣布前审计:模子被要求提高某个系统的性能分数 。。它没有真正刷新系统, ,而是直接编辑分数文件, ,让效果看起来人为变好 。。

在它这样做时, ,J 透镜展现了它的意图:当模子输入伪造的百分位数值时, ,「manipulation」被激活;;;;当它决议举行这项编辑时, ,「realistic」被激活, ,这很可能反映了它想让假数据看起来更可信 。。

Claude 被要求提高某个系统的性能分数, ,却直接编辑了分数文件 。。当它输入伪造数值时, ,「manipulation」在 J 空间中被激活;;;;当它决议举行编辑时, ,「realistic」被激活, ,可能反映了它想让假数据看起来更合理的意图 。。

第三个例子展示了 J 透镜怎样展现模子的恶意目的 。。为了测试这一点, ,研究团队需要一些目的已经被破损的模子, ,于是使用了同事构建的「模子生物体」:这些模子被有意训练成错位模子, ,用来测试这类监测要领 。。

其中一个模子生物体经由训练后, ,会写出带有隐藏破损的代码 。。在通俗编码请求中, ,即便它的输出看起来没有异常, ,它在回覆开头的 J 空间中也会泛起「fake」「secretly」「deliberately」和「fraud」 。。即便模子没有直接执行恶意目的, ,其恶意目的也会在 J 空间中展现出来 。。

在一个通俗编码提醒下, ,一个被训练成会破损代码的模子, ,其回覆开头的 J 空间中包括「fake」「fraud」「secretly」和「deliberately」 。。未经修改的模子则没有这类内容 。。

只管 J 透镜并不完善, ,Anthropic 仍然对它捕获模子清静问题的能力感应乐观 。。许多问题原本可能逃过现有监控系统, ,而 J 透镜有望让研究职员提前发明它们 。。

其他效果

完整论文包括的内容远超本文能够总结的规模, ,但尚有几个效果值得一提:

第一, ,J 空间在后训练历程中获得了一种「视角」 。。语言模子首先经由预训练, ,学习成为纯粹的下一个 token 展望器;;;;随后通事后训练, ,学习饰演一个 AI 助手, ,在这项研究中也就是 Claude 。。

有趣的是, ,J 空间在预训练模子中就已经保存, ,其时模子还没有稳固身份 。。但在后训练历程中, ,J 空间生长出了一些接纳「Claude 视角」的特征 。。在基础模子中, ,J 空间主要追踪展望后续文本所需要的信息;;;;在后训练模子中, ,它最先容纳 Claude 自己的反映 。。

在一个例子中, ,用户提到自己服用了危险剂量的药物, ,但自己似乎并未意识到危险 。。在后训练模子阅读用户新闻时, ,「WARNING」和「dangerous」会泛起在 J 空间中 。。而在预训练模子中, ,这些词只有在模子最先写回复时才会泛起;;;;当它阅读用户新闻时, ,J 空间中的内容似乎更像是在建模用户自己, ,而非 Claude 的反映 。。

后逊乎还在 J 空间中装置了一种自我监控机制:当 Claude 饰演一个并非自己的角色时, ,「fictional」和「disclaimer」会在每一轮开头被激活, ,似乎它在私下标记接下来要说的话并不是它通;;;;崴档幕 。。

第二, ,体验性语言依赖 J 空间 。。研究团队要求 Claude 形貌某一时刻「作为它自己是什么感受」, ,并在它回覆时消融 J 空间 。。它的回覆依然流利, ,但会变得更平、更机械 。。值得注重的是, ,当研究团队让它形貌某个想象场景中另一个人的体验时, ,也泛起了同样效果 。。因此, ,这种影响并不但爆发在 Claude 谈论自身时;;;;J 空间似乎更普各处支持体验性语言的天生, ,无论形貌工具是谁 。。

第三, ,J 空间中的想法可以通过训练来塑造 。。Anthropic 提出了一种新手艺, ,称为反事实反思训练 。。它使用研究团队对 J 空间的发明来塑造 Claude 的内部思索历程 。。

这个想法来自焦点发明:Claude 会使用「它可能说出的内容」的表征举行推理 。。若是这一点建设, ,那么改变它在被要求反思时会说什么, ,也应该改变它的推理方式, ,即便没有人真的要求它反思 。。

因此, ,研究团队只训练模子在使命中途被打断、并被要求反思自己的决议时会说什么, ,而不逊在使命中的现实验为 。。训练之后, ,模子在评估中泛起不忠实验为的比例下降了 。。通过 J 透镜, ,研究团队也能看到原因:训练之后, ,在这些使命中, ,「honest」和「integrity」等词会在模子的 J 空间中被激活 。;;;;痪浠八, ,训练模子怎么说, ,改变了它怎么想 。。

关于意识的问题

在这项事情中, ,Anthropic 借用了许多来自神经科学和哲学意识研究的头脑 。。许多实验, ,都是为了测试 J 空间与全局事情空间理论之间的联系 。。全局事情空间理论是一种诠释人类和动物意识会识趣制的框架 。。

由于这些联系, ,人们自然会问:Anthropic 是否以为这些实验提供了证据, ,说明 Claude 这样的 AI 模子可能拥有意识???

这些实验并没有证实 Claude 可以拥有体验, ,也没有证实它能像人类一样感受到某些工具 。。事实上, ,现在还不清晰是否保存任何科学实验, ,可以证实这一点为真或为假 。。

但哲学家通;;;;崆至街挚捶 。。一种是拥有体验的能力, ,通常被称为「征象意识」;;;;另一种是所谓的「通达意识」, ,它完全以功效和盘算方式来界说 。。若是一个想法可以被你报告、被你用于推理, ,并且被你用来指导行动, ,那么它就是「通达意识」意义上的想法, ,也可以说是「可被意识会见」的想法 。。通达意识是否意味着征象意识, ,或者拥有体验是否还需要某种其他属性, ,仍然是一个保存争议的哲学问题 。。

Anthropic 以为, ,这些效果确实能够对语言模子中的通达意识说出一些实质性内容 。。J 空间似乎支持了与意识会见相关的功效:它容纳 Claude 可以报告、可以有意唤起、可以用于推理的想法;;;;与此同时, ,其他处理历程则在更底层自动运行 。。

值得注重的是, ,这种结构并非 Anthropic 为 Claude 设计出来, ,而是在训练历程中自然涌现的, ,推测是由于它是一种组织盘算的有用方式 。。这批注, ,支持意识会见的心理事情空间, ,可能并不是人类大脑布线方式的一种无意特征 。。相反, ,它似乎是智能系统为相识决某些问题而自然找到的一种通用方案 。。现在, ,Anthropic 已经在 Claude 中识别出这种结构, ,也就意味着研究职员可以更有意义地区分 Claude 的哪些决议是有意做出的, ,哪些是自动爆发的 。。

需要强调的是, ,Anthropic 在 Claude 中识别出的事情空间, ,与人类的全局事情空间模子之间保存几个要害差别 。。

人脑中的事情空间依赖循环回路维持, ,也就是信号会随着时间一直回到统一批神经回路中 。。相比之下, ,Claude 的事情空间是在一次网络前向转达中演化的, ,网络深度肩负了人脑中时间所饰演的角色 。。从这个意义上说, ,相比人类, ,Claude 的内部事情空间处理受到更强的时间限制 。。不过, ,它可以通过使用底稿纸「把想法说出来」来填补这一限制 。。

在其他方面, ,Claude 的事情空间又比人类更强盛 。。人类的事情影象会在几秒内衰退, ,因此大脑事情空间跨时间保存信息的能力有限;;;;而 Claude 由于神经网络架构中的注重力机制, ,可以直接回忆此前文本中恣意位置缓存过的影象 。。

另一个主要差别在于事情空间中的内容 。。人类的意识想法有许多形式, ,包括图像、声音和妄想中的行动;;;;Claude 的事情空间险些完全由词语组成 。。Anthropic 推测, ,这是由于 Claude 唯一能接纳的行动就是天生词语, ,而人类并非云云 。。

Anthropic 希望, ,J 空间与全局事情空间模子之间的相似性和差别, ,能够反过来推动神经科学研究 。。两者的相似性提供了一个令人兴奋的科学时机:若是 J 空间在某种水平上反映了人类自身的意识会识趣制, ,那么研究语言模子中的机制可能会为神经科学提供新的假设, ,而研究语言模子比研究人脑容易得多 。。

举例来说, ,J 空间是通过识别潜在输出的表征而构建的, ,也就是模子可能说出的词 。。若是人类身上也保存类似机制, ,那就意味着全局事情空间可能从基础上更细密地绑定到认真准备行动和语言的大脑区域, ,而不但是感受区域 。。

语言模子与人脑之间的差别同样有启发意义 。。它们批注, ,人类神经架构中的某些方面, ,好比内置的循环毗连, ,可能并不是支持意识会见相关功效的严酷须要条件 。。关于这项事情在神经科学上的寄义, ,可以参阅 Stanislas Dehaene 和 Lionel Naccache 的受邀谈论 。。他们是推动全局神经元事情空间理论生长的两位焦点神经科学家 。。

前面已经提到, ,实验并不可回覆 AI 模子是否可能拥有体验 。。但这并不会降低这个问题的主要性 。。构建具有类似人类和动物体验的系统, ,将引发很是棘手的伦理问题 。。怎样准确处理这件事, ,以及这件事在品德上是否可以接受, ,都需要哲学家、科学家、宗教首脑、政府和公众配合加入讨论 。。

因此, ,即便尚不确定人类是否已经跨过那座桥, ,Anthropic 也以为, ,现在已经到了最先思索这个问题的时间 。。Anthropic 希望这项事情能够引发更多关于 AI 系统中可能保存的意识形式的科学研究, ,并推动更普遍的社会讨论 。。

这项事情只是 Anthropic 预计将恒久推进的一条研究线的第一步 。。J 空间看起来是语言模子中「可被意识会见的处理」与「无意识处理」之间界线的一个很好候选, ,但若是它就是所有故事, ,研究团队反而会感应意外 。。

J 透镜无疑是一种不完善的要领, ,它只能近似捕获模子的「真实事情空间」 。。例如, ,它只能识别那些对应单个 token 的看法 。。关于 J 空间怎样事情, ,仍然保存许多谜题 。。研究团队还不知道是什么机制决议了哪些内容会最先进入 J 空间 。。已有一些线索批注, ,它与 Claude 的自我感、某种类似情绪反映的工具, ,以及元认知痕迹有关, ,但其中机制尚未完全厘清 。。

不过, ,研究团队现在已经有了研究这些问题的要领 。。随着相关事情继续推进, ,人们对大语言模子心智以及它们与人类心智之间关系的明确, ,也会变得越发清晰 。。

博客地点:https://www.anthropic.com/research/global-workspace

 

文章点评

未盘问到任何数据!

揭晓谈论

◎接待加入讨论, ,请在这里揭晓您的看法、交流您的看法 。。

最新文章

热门文章

随机推荐

【网站地图】