logo
首页
产品与服务
商务合作
党建相关
博客
关于我们
phone电话咨询
服务热线16625252556
phone微信咨询
微信扫一扫即刻开始对话shangwu
email联系邮箱
联系邮箱service@sohan.cn
feedback意见反馈
header

Anthropic破解大模型内心戏,AI竟自发涌现类人脑意识空间?

2026年07月08日

AI竟然诞生潜意识了?

昨天凌晨,Anthropic甩出一篇王炸论文:他们不仅看到了大模型Claude的内心想法,甚至还能直接篡改!

这篇具有跨时代意义的Anthropic最新论文解读,直接把科技界对AI底层逻辑的认知推向了新高度。
谷歌DeepMind可解释性研究团队负责人Neel Nanda直言,这是一篇极具价值的重磅论文,他们甚至已经在Qwen3.6-27B模型上复现了全部核心结论。

什么是 J 空间?

在人类的日常阅读中,大脑神经元不仅在调控呼吸,还在将屏幕上的符号转化为能理解的词汇,这些底层处理通常是无意识的。
但与此同时,有些大脑活动你是能清晰感知的:比如脑海中闪过的画面或下一步的行动规划。
令人称奇的是,Claude内部也出现了惊人相似的机制划分!Anthropic发现,Claude在运算时会形成一组特殊的神经模式,承担着类似人类意识可及活动的作用。
研究人员将这个承载活跃思考的区域命名为J空间。这不是程序员预先人工手写出的死代码,而是AI模型训练涌现能力的奇迹。这有力地印证了神经科学中的全局工作空间理论,向我们展示了类似人类大脑的AI认知机制。
J空间拥有五个令人叹为观止的核心特性:
  • 可读取与输出:就像人类能把想要买奶茶的清晰想法说出口一样,Claude能够读取并精准输出J空间里的表征信息。
  • 需求响应式激活:如果让Claude专注静默推演某个问题,它会针对性地激活J空间内对应的神经模式。
  • 主导内部推理:面对复杂的逻辑拆解时,即便模型不向外输出中间步骤,对应的底层思考依然会在J空间内激烈交锋。
  • 信息灵活适配:只要激活了法国这个核心概念,Claude的J空间就能瞬间调取首都、货币等相关衍生知识网格。
  • 专注高阶任务:输出文本、运用语法等基础操作根本无需J空间参与。但一旦被限制调用,模型就会丧失高层次的思维能力。

没有J空间,大模型将失去灵魂?

那么,J空间工作原理是什么?
简单来说,它是支撑Claude多步骤推理能力的神经中枢与核心推演沙盘。
研究团队做了一个极其精妙的拆解实验。当向模型询问:那种会织网的动物有多少条腿?Claude最终给出的答案只有一个干脆的数字:8。
只字未提蜘蛛。但研究人员通过监控发现,在它处理信息的隐秘过程中,蜘蛛这个词正在其内部高亮闪烁!
更神奇的是,研究人员借此找到了如何干预大模型输出结果的终极密码。如果在后台把J空间里的蜘蛛强行替换成蚂蚁,Claude的最终回答就会瞬间变成6!
这说明,Claude完全是依赖J空间内的概念在做内部沙盘推演。
如果彻底剥离J空间会怎样?实验证明,此时的Claude依然能流利说话、分析基本情感,但多步骤推理能力几乎清零,甚至写不出完整押韵的诗歌。
这不仅证明了该空间对于大模型结构完整性的重要,更揭示了深度挖掘该机制是未来提升AI高阶认知能力的方法之一。

看破AI潜台词的读心神器

要实现如此精细的观察与干预,离不开核心观测工具:雅可比透镜。
随着雅可比透镜Jacobian lens应用的不断深化与成熟,研究人员能精准锁定Claude庞大词表中每个词汇对应的内部激活模式。
比如,在实验中,研究员让Claude在心里默想一项运动。在它张口作答之前,J透镜就已经在后台读取到了足球。
紧接着,研究员果断抹除了其内部与足球相关的模式,并强行植入橄榄球的神经信号。结果Claude脱口而出的答案真的变成了橄榄球!
在另一组极具启发性的测试中,研究人员在Claude读取问题时,悄悄向它的J空间植入闪电的神经模式,随后让Claude如实说出脑海里浮现的念头,Claude精准反馈自己想到了闪电。
这说明,模型并不能完美免疫或控制自己的J空间。
这项硬核技术在大语言模型可解释性研究中具有里程碑式的意义。当Claude读到一段暗藏漏洞的代码时,哪怕没人提示报错,它的J空间里也会本能地浮现错误的概念。这意味着我们终于能在模型开口说话前,直观读懂它的真实想法。

不可思议的AI进化之路

尽管我们在Claude身上看到了全局工作空间理论人工智能化的绝佳倒影,但在底层逻辑上,它和真实人脑依然有着本质的差异。
目前的研究并不能草率证明Claude像生物一样拥有了真正的自我意识,但它为研究者打开了上帝视角:我们能以此精准捕捉到模型是否在刻意生成虚假信息,或是察觉到自己正在被人类测试。
这种在微调阶段自发成型的机制,展现了智能系统为解决复杂问题而演化出的极致美感。
科技的进化速度永远超出我们的想象,昨日我们还在惊叹于参数规模的庞大堆砌,今日我们已能拨开层层迷雾,直视大模型内部跳动的认知脉搏。