ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

从模式匹配到世界模型:DeepMind如何验证AI开始理解世界,AGI还有多远

从模式匹配到世界模型:DeepMind如何验证AI开始理解世界,AGI还有多远 这次我们不聊那种“下载一个压缩包双击就能跑”的 AI 工具而是要认真讨论一个问题当 DeepMind 创始人说“AI 开始理解世界”的时候这句话到底意味着什么AGI 距离我们还有多远在 AI 圈子“AGI”这个词已经被滥用得有点严重。有人用它指代“能聊天、能画图的模型”有人用它描述“会给人类打工的机器人”还有人把 AGI 等同于“如今大模型的完全形态”。但 DeepMind 创始人 Demis Hassabis 的表述显然更严肃他认为 AI 正在从“模式识别”走向“世界理解”而不是简单地把概率词串在一起。这篇文章会根据公开的技术事实、DeepMind 的发展路线和 AGI 领域的常见能力评估框架帮你拆解三件事第一所谓“AI 开始理解世界”在技术上如何被验证第二从 AlphaGo 到 GeminiDeepMind 的系统为什么反复被拿来证明 AI 已经有“理解”能力第三距离真正的 AGI眼前还有哪些硬约束。如果你关注 AI Agent、多模态模型、AI 工程实践、模型本地部署甚至准备给自己的应用接入更强的推理能力这篇文章的建议可以直接延续到你后续的项目里。1. 核心问题速览这篇到底要聊清楚什么讨论主题说明核心人物Demis HassabisDeepMind 创始人兼 CEO代表成果AlphaGo、AlphaFold、AlphaStar、Gemini核心观点AI 开始理解世界而不仅仅停留在模式匹配关键概念AGI、世界模型、多模态、规划推理、AI Agent本文目标用可验证的方式拆解“理解世界”和“距离 AGI 有多远”适合读者AI 应用开发者、大模型使用者、技术决策者、AGI 话题关注者2. “AI 开始理解世界”不是营销话术而是一次范式转变2.1 从“模式匹配”到“世界模型”过去的机器学习系统很长一段时间是被当作“高维函数拟合器”来用的。给它一堆猫的图片它学会把“猫”标签和视觉特征关联起来给它一堆语音它学会把声纹转成文字。这类系统最大的问题就是换个场景效果迅速下降因为它不理解底层逻辑只会套用训练集里的统计模式。DeepMind 团队一直以来都在做另一件事让 AI 建立一个可以持续运行、可以被干预、可以用未来结果验证的“世界模型”。Hassabis 在一次访谈中解释过他们训练 AlphaGo 的目标不是让它记住棋谱而是让它通过自我对弈逐渐形成对棋局走势的判断这种判断依赖的是对复杂博弈状态的推理能力。所以“AI 开始理解世界”不是一句宣传口号而是指模型内部出现了可泛化的抽象表征它知道某个行为会带来什么结果知道不同对象之间存在什么因果关系知道在某种约束下什么是可行方案。2.2 AlphaGo 和 AlphaFold 证明了什么AlphaGo 是 2016 年让公众第一次意识到“AI 推理能力”能够超过人类的标志性事件。它在围棋中的“第 37 手”之所以震撼是因为那步落子不符合任何人类棋谱套路最终却被证明是全局最优解。这说明系统不是在检索历史棋谱而是在某种内部推演空间中搜索到了新的策略。AlphaFold 的意义更偏科学层面。蛋白质折叠问题被生物学界研究了半个世纪AlphaFold 用端到端的方式直接从氨基酸序列预测三维结构首次在重要科学任务上达到了接近实验解的水平。很多人只把它当作“AI 赢了生物竞赛”但其真正影响在于AI 已经能够在复杂物理化学系统中找到人类尚未归纳出来的规律。这两个成果共同支撑了“AI 理解世界”的判断系统能理解博弈规则也能理解分子层面的结构约束。2.3 大语言模型为什么让“理解”成为可讨论的问题到了大语言模型阶段情况又不一样了。GPT 系列和 Gemini 系列都在海量文本、图像、音视频上做自监督学习训练目标只是预测下一个 Token。但模型却出现了多种令人意外的能力数学推理、代码生成、常识问答甚至对从未见过的推理题给出合理步骤。学术界现在还无法完全解释这种“涌现”。但一个被广泛接受的理论是高容量模型在海量数据中被迫压缩了很多关于世界的知识当参数量超过某个阈值后这些知识开始以链式推理的方式在回答中释放出来。Hassabis 把这个过程称为模型建立的“压缩的世界表征”。换句话说大语言模型确实可能不是在记忆而是在构建一种对世界的抽象描述。这种描述并不完整也不可靠但开车的基本方向是对的。3. 怎么判断 AI 是否“理解世界”五个能力维度与其争论“AI 有没有理解”不如先定义“理解”的可测试指标。以下五个维度是 AGI 研究中最常用的评估框架能力维度当前水平评估主要短板知识储量与常识较强覆盖大量人类文本知识知识会过时存在幻觉和错误关联规划与推理弱到中等简单长链条可解复杂任务仍不稳定长链条规划会发散缺少稳定验证机制多模态理解快速进步图文音视频统一表征对物理世界的动态交互理解仍有限主动探索与学习弱大多数模型无法自我提出实验假设只能在固定环境中做在线调整长期记忆与自我更新很弱会话上下文有限无法持续更新自身模型模型更新还依赖重新训练和微调从表格可以看出LLM 在“知识”和“多模态”上进步最快但在“规划”“主动学习”和“长期记忆”上距离“理解世界”还有明显距离。这也解释了为什么近期 Open AI、DeepMind 都在押注 AgentAgent 框架就是试图给大模型补上“规划 行动 记忆”这一环。4. 技术路线语言模型之后再补上“世界模型”4.1 DeepMind 的技术路线从 AlphaGo 到 GeminiDeepMind 的技术发展不是随机堆叠而是一条清晰的递归式增强路径AlphaGo证明强化学习可以解决一个封闭博弈环境下的复杂规划问题。AlphaFold证明神经网络可以学习自然科学的物理化学规律。AlphaStar / AlphaDev把强化学习推广到实时策略游戏和底层计算任务。Gemini把语言、图像、音频、视频统一成多模态 Token 流试图把大语言模型的世界知识推展到更全面的感官输入上。Hassabis 说得很直白语言建模只是工具真正的目标是用世界模型支撑智能。因此他们不会满足于做一个“会聊天的搜索引擎”。4.2 为什么多模态对“理解世界”是必经之路纯文本模型的最大问题在于语言本身只是对世界的符号描述大量物理规律、空间关系、时序变化无法用语言完全表达。一张图里物体之间的遮挡关系、视频中运动物体的轨迹、声音的方向感和距离感都要靠多模态数据来补充。这也是 Gemini 训练中多次强调“原生多模态”的原因。DeepMind 不是把 OCR、语音识别、CV 模型拼接到一起而是让模型在多模态 Token 序列上做联合建模这样视觉信息和文本信息可以互相影响而不是各走各的管道。多模态还关系到“世界模型”的另一个重要组成部分物理直觉。当模型看到一杯水即将洒落是否能预测下一步运动当模型看到数字人转身时是否能推断出身体遮挡的部分这些都必须通过视频和真实物理交互数据来训练。4.3 AI Agent理解世界后下一步就是“改变世界”如果模型只停留在“理解”AGI 的价值依然有限。真正的应用价值在于“理解之后能行动”。这就是 AI Agent 在 2025 年爆发的根本原因。Agent 的典型架构包括感知模块多模态输入、推理规划模块LLM 或世界模型、工具调用模块代码解释器、浏览器、API、记忆模块结构化存储和反馈验证模块执行结果评估。DeepMind 和 Open AI 都分别发布了 Agent 相关的产品路径。从工程上看Agent 系统最难的不是单个模型能力而是多个模块在长时间任务中的稳定性。你让一个 Agent 连续做 10 步任务它可能在第四步就偏离目标连续跑 100 步时错误概率会指数级增长。所以“AI 开始理解世界”的下一阶段与其说技术瓶颈在模型不如说在 Agent 的系统工程。5. 距离 AGI 还有多远时间表、约束与变量5.1 各方时间线的分歧关于 AGI 实现时间业内大致有三派乐观派以部分大模型公司和创业者为主认为 2028 到 2030 年就能看到与人类相当的通才型 AI。务实派以 Hassabis 为代表认为 AGI 大概在 5 到 10 年内出现但不会一步到位而是“能力逐步解锁”。保守派以部分认知科学和神经科学研究者为代表认为现有神经网络架构还缺少“具身经验”和“持续学习”机制AGI 至少需要 20 年甚至更久。Hassabis 在 2024 年的一次访谈中说过DeepMind 的目标是在 2030 年前实现 AGI。他的判断依据不是“模型能力已经够了”而是“能力增长的速度正在逼近临界点”。5.2 主要硬约束约束类型现状对 AGI 的影响数据量高质量文本数据接近枯竭视频与合成数据成为新方向模型继续变大需要新数据来源算力训练集群向十万卡迈进单次训练成本达到亿美元级别实验代价极高试错变慢架构Transformer 仍是主流尚无公认的 AGI 架构需要新的记忆和规划机制评价体系现有基准测试在快速饱和缺少长效评估方法很难判断“离 AGI 还差多少”对齐与安全可解释性和可控性问题未解决即使能力达到也不敢直接放出来使用5.3 影响时间表的核心变量AGI 能够提前实现取决于几个变量第一世界模型是否真的能在视频数据中表现出对物理规律的理解第二Agent 系统能否把 10 步推理稳定扩展到几千步第三模型能否具备真正的长期记忆和自我纠错能力第四是否出现比 Transformer 更高效的架构在相同算力下获得更大能力。任何一个变量的突破都可能让时间表提前。但任何一个变量卡住乐观派的预测也会落空。6. 从工程视角看“AI 理解世界”的可测试性对于开发者来说“AI 理解世界”不至于无法操作。我们可以用一套能力探测方法把“理解”这个抽象词转成可量化的任务。6.1 构建一份基础评估集你可以用下面这个模板创建自己的“理解”测试集包含常识推理、物理直觉、反事实推理和规划能力四类。{ test_set: [ { category: physics, question: 一个铁球和一个木球同时从同一高度落下忽略空气阻力哪个先落地, expected: 同时落地 }, { category: counterfactual, question: 如果地心引力突然减半桥梁承重会上升还是下降, expected: 桥梁剩余承重能力上升 }, { category: planning, question: 你要从北京去上海参加下午三点的会议上午十点还在北京请给出最稳妥的交通方案。, expected: 优先选择航班或高铁并预留冗余时间 }, { category: cause, question: 冰面很滑导致行人摔倒消除此问题最直接的措施是什么, expected: 撒盐或铺防滑物 } ] }6.2 用 API 做批量探测下面用 Python 和 OpenAI 兼容 API 做一个批量测试实际使用时把模型路径替换成你本地的服务地址。import requests import json API_URL http://127.0.0.1:8000/v1/chat/completions MODEL_NAME your-model-name def ask_model(system_prompt, user_prompt, temperature0.2): payload { model: MODEL_NAME, messages: [ {role: system, content: system_prompt}, {role: user, content: user_prompt} ], temperature: temperature } response requests.post(API_URL, jsonpayload, timeout120) return response.json()[choices][0][message][content] with open(test_set.json, r, encodingutf-8) as f: tests json.load(f)[test_set] for idx, item in enumerate(tests, 1): answer ask_model( 你是严格的理科教师请直接给出答案并给出简洁解释。, item[question] ) print(f[{idx}] {item[category]}: {item[question]}) print(f模型回答: {answer}) print(参考结果:, item[expected]) print(- * 60)6.3 通过“连续追问”判断理解深度只问一次的问题容易靠记忆完成更有效的测法是把问题拆成多层第一层直接问结论。第二层改变条件看模型能否推理出新结论。第三层要求模型提出反证。第四层让模型设计一个小实验验证自己的假设。这一套流程可以快速暴露模型是否真的掌握了因果结构。如果模型在条件改变后仍然给出第一次的答案那说明它只是在做文本匹配而不是理解。7. 常见误区不要把 AGI 和“全知”“意识”画等号7.1 误区一AGI 就是全知全能AGI 的定义通常是指“在大多数经济有价值的工作上达到人类水平”并不代表它无所不知。人类也不是全知的真正重要的是快速学习、跨领域迁移和合理行动。7.2 误区二AGI 必须有意识意识和智能是两个维度。AI 可以在没有自我意识的情况下完成规划、推理和决策。DeepMind 强调的是“能力”而不是“体验”。过分用“意识”去衡量 AGI很可能低估那些没有主观体验但能高效解决问题的系统。7.3 误区三AGI 会在某个时刻突然降临从现有技术路径看AGI 更可能是渐进式的先在代码编写、科学研究、数据分析等垂直领域超过人类再逐步进入需要复杂物理交互和社交能力的场景。能力解锁是一步一步的而不是一个二进制开关。7.4 误区四AGI 和某一个大模型画等号Gemini 很强GPT 也很强但我们离 AGI 缺的不是一个模型而是一套能把认知、规划、长期记忆、工具调用和自我修正整合起来的系统。单个模型只是“大脑皮层”Agent 框架、记忆系统、评价系统和安全机制才是完整的智能体。8. 中国开发者能做什么从 AI 应用开发到 AI 工程实践对国内开发者来说AGI 话题并不只是“看热闹”。现在围绕大模型可以做几件具体的事8.1 AI 应用开发围绕现有大模型 API 构建垂直应用是目前性价比最高的方向。比如用多模态模型做文档解析、用大模型做智能客服、用 Agent 框架做自动化运营。关键是先把一个很小的场景做深而不是追着所有新模型跑。8.2 模型部署与评测如果你关注 AI 模型部署可以把“评测”做成固定环节维护一套本地测试集在大模型版本更新后自动跑一遍回归测试。这样能避免“换了新模型效果反而变差”的尴尬。8.3 AI Agent 与自动化系统AI Agent 不只是调 API还要考虑任务拆分、工具注册、结果校验和失败回退。一个可落地的 Agent 框架至少包含三层规划层、工具层、记忆层。你的注意力应该放在“稳定完成 100 个任务”而不是“单任务效果惊艳”。8.4 合规边界与安全使用无论做什么应用只要你接入 AI 能力就要遵守数据合规要求尤其是涉及人脸、声音、隐私、版权素材的功能。不要用 AI 做模拟真人、伪造身份或规避平台限制的应用。测试环境内验证功能是合理的正式对外发布前一定要做合规审查和内容复核。9. 后续值得关注的四个研究方向9.1 多模态世界模型如果模型能直接在视频和物理交互数据上学习因果规律那“AI 理解世界”就有了更硬的技术支撑。你可以关注 DeepMind 和学术界在这个方向发布的论文重点看它们是否提出了超越 “Token 预测”的新训练目标。9.2 长期记忆与持续学习现在大模型训练完就固定了无法在推理中持续吸收新知识。真正的 AGI 必须能在运行中积累经验。未来可能会出现“外部记忆 模型微调 在线验证”的组合方案这是工程上比较现实的路径。9.3 可验证的推理系统幻觉问题不解决AI 在严肃场景的价值就会受限。接下来的重点方向是把“推理”和“外部验证”绑定比如让模型在回答时调用计算器、搜索引擎、代码执行器并自动检查答案是否通过验证。9.4 对齐与评估方法论AGI 越强评估和安全就越关键。如果你今天开始做模型评测、红队测试、可解释性分析三五年后这些经验会变得极其值钱。10. 这篇文章可以帮你留下的核心判断Hassabis 说“AI 开始理解世界”并不是一个玄学论断它有 AlphaGo、AlphaFold 和多模态模型的实绩支撑。但理解世界不等于 AGI 已经到来距离真正的通用智能我们还需要跨过规划稳定性、长期记忆、物理世界交互和评价体系这四道坎。对普通开发者来说最值得采取的两种姿态一是把手头的 AI 应用做深不断用新的模型和 Agent 框架重构自己的工作流二是建立一个自己的模型评估集不盲信 Benchmark不在官网演示中兴奋也不因一次失败就否定整个方向。建议收藏这篇文章。后续你看到新的模型发布或 Agent 框架更新时可以回到这里用第 3 节的能力维度去评估它到底“理解了世界”几分。
返回列表