Claude背着人类开了一个思考空间

举报
搞点薯条 发表于 2026/08/01 17:34:12 2026/08/01
【摘要】 Claude背着人类开了一个思考空间

2026年7月6日,Anthropic 发了一篇有意思的文章:大语言模型内部存在一小部分 “可被语言化”的表示 ,它们像一个功能性的 “全局工作空间” 一样,承载模型当前可报告、可调控、可用于灵活推理的内容。作者把这部分表示称为 J-space,并且该部分可以读出来,也可以干预,这不就是大模型自己准备了一块儿小黑板?

那为什么说 J-space 像一块“黑板” ?因为这一个地方像模型在回答问题前,临时拿来记录重点的地方。

我们平时思考问题时,也不是把所有信息都放在脑子最前台。很多事情是在后台自动完成的,比如识别一句话的语法、理解常见词语、判断上下文大概在讲什么。但真正需要我们集中注意力的内容,会被 “摆到台面上” 

比如你在做一道复杂题时,脑子里会暂时记住几个关键点:题目问什么、已经知道什么、下一步要算什么、哪些条件最重要。你不会把所有细节都同时想清楚,而是把 当前最有用的信息 放在一个临时工作区里。

J-space 就很像这样的 临时工作区 

它不是模型的全部“思想”,也不是所有计算过程的总和。模型内部有大量自动化处理,并不会都进入 J-space。J-space 更像是模型把当前最重要、最可能影响下一步回答的概念挑出来,暂时写在一块 “黑板” 上。

第一:它上面写的东西通常可以被语言表达出来

比如模型还没正式回答,但研究者已经能在 J-space 里读到一些接近自然语言的概念: 安全、危险、奖励、欺骗、诚实、测试、拒绝、帮助 等等。

这说明 J-space 里的内容不是完全不可理解的神经网络数字噪音,而是和模型将来可能 说出口的概念 有关。

第二:它会随着任务变化而变化

如果任务只是普通续写,模型可能不需要把太多抽象概念放进 J-space;但如果任务要求它解释、判断、计划、推理,相关概念就更容易进入 J-space。

也就是说,J-space 更像是模型在处理 “需要认真想一想” 的问题时使用的工作台。

第三:它会影响模型后续怎么回答

这点非常关键。研究者发现,如果人为修改 J-space 里的某些概念,模型最后的回答也会跟着改变。

它上面 “写着什么” ,会影响模型接下来 “说什么” 

第四:它容量有限

J-space 不是把所有信息都摊开,而是只放少数当前最重要的概念。这一点也很像人的工作记忆:我们同时能清楚关注的东西其实很有限。

这和人类意识有相似之处,但 不能直接等同 

更通俗地说:这篇文章不是在证明 AI 有主观体验,而是在说,大模型内部可能存在一种类似“工作记忆”或“全局黑板”的机制。这个机制能让模型把某些信息集中起来,用于 灵活推理和后续输出 

大模型的内部,可能存在一个类似 “脑内小黑板” 的区域。模型会把当前最关键、最可能被说出来、最能影响后续推理的概念写在上面。


读懂这块黑板

如果我们能读懂这块黑板,就能更早地发现模型的真实推理方向。


改变这块黑板

如果我们能改变这块黑板,就可能更有效地影响模型行为。


训练更好的原则

如果我们能训练模型在黑板上写下更好的原则,那么 AI 对齐也许就不只是约束输出,而是改变模型内部真正关注什么。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。