READING FRAME

文章详情阅读与延伸浏览页

本页围绕单篇资讯建立完整阅读链路,承接标题信息、正文展示、上下篇跳转与推荐内容延伸,让访问者更顺畅完成阅读过程。

Focus Reading
Share Ready
More Topics

AlphaGo核心作者决裂谷歌!发文痛撕大模型皇帝新衣:所谓的思维链,全是事后编造!

尊龙娱乐PLUS平台 110 阅读 约 5.5 分钟

2016 年 3 月 10 日,首尔四季酒店。 空气几乎凝固 人机五番棋第二局,韩国传奇九段李世石手握白子,眼神紧盯棋盘。 第 37 手,AlphaGo 执黑,突然落子在 五路肩冲 。 刹那间,解说席一片死寂 韩国解说嘉宾金成龙九段倒吸一口凉气:“这是错着吧? 电脑莫非死机了?” 在人类千年的围棋理论中,五路落子是公认送给对手实地的愚蠢之举。 然而,李世石盯着这颗黑子,整整长考了 15 分钟,甚至在中途罕见地离场走向走廊,点燃了一支烟来平复狂跳的心脏。 那一手,彻底改写了世界围棋史,也成了整个人类科技史上不可磨灭的图腾。 ▲ Thore Graepel 个人网站主页与标志性的第 37 手 十年后的今天,大语言模型席卷全球 从 ChatGPT 到各类宣称具备“深度思考”的新模型,整个科技界都在欢呼:机器终于学会像人类一样思考了! 然而,就在所有人沉浸在狂欢中时,亲手参与打造 AlphaGo 核心搜索系统的奠基人之一, Thore Graepel ,突然推开 Google DeepMind 的大门决然离去。 他不仅走了,还在《麻省理工科技评论》(MIT Technology Review)上甩下一篇言辞极其锋利的万字长文: 《Don’t be fooled,LLMs don’t reason》(别被骗了,大语言模型根本不会推理) ! ▲ Thore Graepel 发布的公开长文推文 他几乎是指着当红大模型的鼻子冷斥: 今天的 AI 根本没有学到当年“第 37 手”哪怕一丁点的灵魂。 你们看到的所谓“思维链”,不过是一场自欺欺人的“事后圆谎”! 01十年谜底揭开:第 37 手无关“机器灵感”,实为一记理性的耳光 世人谈起当年的第 37 手,总喜欢把它浪漫化为“神经网络神秘的灵光一现”。 但 Graepel 在文章中撕碎了这个神话: 第 37 手剥离了直觉光环,完全源于底层搜索机制的残酷纠偏。 要理解这一切,得先看懂 AlphaGo 身体里共存的两个灵魂: 系统 1(策略网络) :这是个“直觉模仿器”。它吞噬了 3000 万盘人类高手棋谱,看到盘面就能立刻凭本能报出:“人类高手下一步通常会走哪”。 系统 2(蒙特卡洛树搜索,MCTS) :这是个冷酷的“显式推演者”。它不迷信直觉,而是从当前盘面出发,硬生生劈出成千上万条推演分支,计算每一步的终极胜负。 Graepel 首次披露了一个惊人的底层技术内幕: 面对第 37 手那个局面,AlphaGo 的系统 1 扫过全盘后,给出的专家先验概率只有 区区万分之一(1 in 10,000) ! 在“机器本能”看来,这一步烂透了 如果按照今天主流大模型的机制,仅凭前向概率采样或者自回归联想,这手棋在诞生的千万分之一秒内,就会被系统当成垃圾直接抹杀! 但为什么它最终震撼了世界? 因为 蒙特卡洛树搜索(系统 2)启动了 在极其严苛的搜索公式(PUCT)下,随着常见招法在推演中纷纷触碰到死胡同,探索奖励机制强行让算力流向了这个万分之一的冷门分支。 推演一步步展开 价值网络结合模拟走子,在数千步推演的尽头惊讶地发现:局部虽然亏损,但在极其辽阔的中腹,黑棋竟然铸造了一堵无法撼动的外势铜墙! 最终,搜索机制狠狠推翻了神经网络的初选直觉! 它把被本能打入冷宫的第 37 手,硬生生顶上了历史的舞台。 这才是所谓“创造力”的深层机制: 严密推理绝不顺着直觉滑行,核心在于通过审议推演,具备彻底打碎自身偏见的纠错能力。 02大模型的画皮:拉得再长的思维链,也是在盲目猜词 十年后的今天,大模型厂商们搬出了“思维链(Chain of Thought)”,让模型在给出答案前输出长达几千字的“思考过程”。 许多人惊呼:AI 已经拥有了人类的慢思考系统 2! 但在 Graepel 看来, 这完全是皇帝的新衣 。 今天的大模型底层依然是一个简单的自回归循环: 一次又一次猜测下一个 token 。 把思考拉长,无非是让同一种下一词概率联想,在敲定最终答案前多空转了一会儿。 它自始至终是一台被疯狂扩容的 超强系统 1 。 Graepel 直刺现代大模型永远迈不过去的三道天堑: 1. 没有显式、可检查的“认知账簿” 在 AlphaGo 里,每一步搜索推演都有清晰透明的博弈树节点:考虑过哪些选择、排除了哪些变化、胜率几何,全盘写在账簿上。 大模型呢? 它空空如也 它没有一个 独立、持久、可供审计的认知状态 。 它不知道自己正相信什么,更无法随新证据系统性修正假设。 2. 知识与逻辑被搅成了一团混沌 在严密的理性系统中,“我知道什么事实”与“我如何运用逻辑操纵事实”是泾渭分明的。 而在大语言模型里,牛顿力学、莎士比亚十四行诗与逻辑推理规则,全部被稀释熔铸在那几千亿个黑盒浮点权重里。 只要输入轻轻一变,逻辑就会随之融化变形。 3. 先射箭后

about image

觉得有用?分享给朋友

让更多人看到这篇内容,也欢迎继续浏览平台中的其他相关文章与专题内容。

推荐阅读