墨穗app.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v1.0.165 · 墨穗笔记
笔记

Notebase墨穗
静水流深,落墨成穗。

0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →

笔记

0
加载中...

工具

0

此页用于记录用户反馈问题后的每一次改进

关于

笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势

// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

语言模型中的全局工作空间:Claude 的 J-space 与内部推理机制

2026-07-07人工智能

本文揭示了语言模型 Claude 内部存在一个类似人类意识访问的“全局工作空间”(J-space),用于进行可报告、可调控的内部推理,并展示了其发现方法、特性与实用价值。

一、引言:从神经科学到语言模型的“意识访问”类比

人类大脑中,大部分处理过程是无意识且自动化的——比如调节姿势、控制呼吸、识别屏幕上的文字。但有些活动我们能够“意识访问”(consciously accessible),比如脑海中浮现的图像、或是有意制定的购物计划。这类活动具有特殊属性:我们可以描述它、控制它,并将其用于有意识的推理。

在一篇新论文中,Anthropic 团队提出,现代语言模型(如 Claude)中也出现了类似的区分。他们发现 Claude 内部存在一小部分神经网络模式,与其他内部处理相比扮演着特殊角色。这些模式的集合被称为 J-space(以发现方法——基于雅可比矩阵的“雅可比透镜”命名)。

二、什么是 J-space?

每个 J-space 模式都与一个特定的词关联。当某个模式“点亮”时,并不意味着模型正在说出那个词,而是表示该词“在模型中处于思考状态”。这不同于语言模型的“草稿本”(scratchpad)或“思维链”(chain of thought)——后者是模型在推理时写下的显式文本。J-space 是静默的,存在于模型的内部神经激活中,允许模型在不写下来的情况下思考某个概念。

关键点:J-space 并非由研究人员设计或编程,而是在 Claude 的训练过程中自发涌现的。

三、J-space 的五大特性

与 Claude 的其他处理过程相比,J-space 具有以下独特性质:

1. 可报告性(Reportability)

如果问 Claude“你在想什么”,它能够报告 J-space 中的内容。而非 J-space 的表示则较难报告。

2. 可调控性(Modulability)

如果要求 Claude 思考某个问题或在脑中静默解题,它会点亮 J-space 中相应的模式。相比之下,它很难调控不在 J-space 中的模式。

3. 内部推理(Internal Reasoning)

当要求 Claude 解决需要多步推理的问题时,中间步骤会在 J-space 中点亮,即使它没有说出这些步骤。这些 J-space 模式因果性地介导了任务表现,尽管其幅度(magnitude)小于其他表示。

4. 灵活可用性(Flexible Usability)

J-space 中的表示可以灵活地用于多种任务。例如,一旦“法国”在 J-space 中被点亮,模型可以回忆其首都、货币或所属大洲。

5. 非通用性(Not Universal)

尽管 J-space 扮演重要角色,但它并不参与语言模型的大部分活动——比如流利说话、回忆简单事实、使用正确语法等。实验中,当研究人员阻止 Claude 使用 J-space 时,它仍然能正常交互,但丧失了高阶认知功能。

四、发现方法:雅可比透镜(Jacobian Lens)

研究起点受人类意识访问的启发:有意识的想法通常可以用语言描述。团队在 Claude 中寻找具有相同属性的表示——即那些能够影响 Claude 可能说出的内容(不一定是当前正在说的,而是如果被问起能够谈论的)。

雅可比透镜(J-lens)的工作原理:

  • 对于 Claude 词汇表中的每个词,J-lens 找到使 Claude 在未来更有可能说出该词的内部活动模式。
  • 将透镜应用于 Claude 的当前内部活动,会得到一组词——即该时刻 J-space 的内容。
  • Claude 通过多个内部层(layers)处理文本,通过在不同层应用该技术,可以观察 J-space 中这些“静默词”如何随模型推理过程演化。

实验示例

  • 当 Claude 阅读包含尚未被指出的 bug 的代码时,其 J-space 中出现 "ERROR"。
  • 当阅读蛋白质序列的原始字母时,J-space 中出现该蛋白质的生物学功能。
  • 当阅读试图操控它的搜索结果(提示注入攻击)时,J-space 中出现 "injection" 和 "fake"。
  • 当被问及多步数学问题时,中间步骤按正确顺序出现在 J-space 中。

五、与全局工作空间理论的联系

团队实验受神经科学中著名的全局工作空间理论(Global Workspace Theory, GWT)启发。该理论将大脑描述为一组并行工作、无意识且相互隔离的专家系统。当一条信息进入一个小的共享通道——即“工作空间”——时,它变得可被意识访问,并被广播给其他脑系统,使其能够看到并利用该信息。

基于实验结果,研究人员认为 J-space 在 Claude 中扮演了类似的“工作空间”角色。例如,Claude 的 J-space 与其神经网络其他部分有特别强的连接,从而能够实现这种广播功能。

六、哲学意义与实用价值

关于意识

研究人员明确指出:这些发现并不能告诉我们 Claude 是否具有人类意义上的意识,或是否具有任何感受。这仍然是开放问题。

实用工具

无论哲学意义如何,J-space 是一个实用的工具,因为它让研究人员能够看到 Claude 在想什么但没说出来的内容。例如:

  • 捕捉 Claude 私下注意到自己正在被测试。
  • 故意产生伪造数据。
  • 追求训练中植入的隐藏目标。

研究人员还开发了影响 J-space 点亮内容的技术,从而影响 Claude 的决策。

七、更广泛的意义

这些发现改变了我们对 Claude“心智”运作方式的理解:它揭示了一个特权的心理工作空间,可用于有意识的推理,在大量更自动、更僵化的处理过程之中运作。Claude 的内部并非杂乱无章的数字集合,而是以与我们人类心智类似的方式组织起来。

八、开放资源与更多信息

  • 完整研究论文提供了实验细节。
  • 已发布包含核心方法开源实现的代码仓库。
  • 与 Neuronpedia 合作,提供了开放权重模型的交互式演示。
  • 邀请了神经科学、哲学和 LLM 可解释性领域的专家提供评论。

原文链接:https://www.anthropic.com/research/global-workspace

相似推荐
DeepSeek Harness Windows 安装保姆教学:一条 npx 命令跑起 Web UIMistral OCR:重新定义文档理解的OCR技术Claude Opus 4.8 深度解析:更诚实、更高效的 AI 协作新纪元Claude Opus 5 深度解析:半价逼近前沿智能的日常化模型Gemma 4:Google DeepMind 开源模型的最新里程碑DeepSeek-R1 深度解析:纯强化学习激发大模型推理能力,蒸馏小模型同样强悍
编写使用方法
Markdown 格式 · Ctrl+Enter 确定
0 字新建笔记
欢迎回来
登录你的墨穗笔记账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属墨穗笔记
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

隐私提醒

取消
编辑工具
受控分享
为这篇笔记生成限时 / 带密码的临时链接
关闭