当前位置: 首页 > news >正文

oka架构

去年Rich Sutton 在 Alberta Plan for AI 会议上的演讲: 通往强 AI 的路径是强化学习,而非大语言模型


一、为什么需要 Oak 架构

AI 的目标是理解人类思维、并放大人类能力,这是堪比生命起源的智识里程碑。但当前 AI 的发展路线(以大语言模型为代表)偏离了真正智能的本质。

当前 AI 的核心问题:

维度现状(LLM 路线)Sutton 的主张
学习时机Design time(设计阶段训练)Run time(运行时在线学习)
知识来源大量离线训练数据纯粹从运行时经验中学习
领域依赖高度依赖特定领域数据Domain general,不内置任何领域知识
抽象能力固定架构,无法随经验增长开放式的抽象层次,按需构建

“The biggest bottleneck is we have inadequate learning algorithms.”


二、Oak 架构的三大设计目标

  1. Domain general(领域通用):架构本身不应包含任何特定于某个世界的知识
  2. Experiential(从经验中学习):心智应从运行时经验中生长,而非从特殊训练阶段产生
  3. Open-ended(开放式):抽象的复杂度和层次无上限,仅受计算资源限制

Design time vs Run time

  • Design time(设计阶段):在工厂里被构建,内置领域知识
  • Run time(运行时):智能体在世界中交互、从经验中学习、针对所处世界的特定部分做规划

大语言模型的一切工作都在 design time 完成,部署后不再学习。Oak 架构则相反,所有重要的事情都要在 run time 完成——在线、在岗(on the job)

Big World(庞大世界)假设

智能体相对它所面对的世界是渺小的,无法在工厂中预知世界的一切细节。因此:

  • 想学到任意开放式的抽象,必须在 runtime 完成
  • 必须由世界本身告诉智能体哪些抽象是对的

三、两个关键设计问题的回答

Sutton 连续抛出两个问题来约束 Oak 的设计哲学:

问题 1:智能体的设计是否应该反映它将被使用的世界?

  • 如果追求性能:应该内置领域知识,让它能立刻表现良好
  • 如果追求概念简洁性(理解心智如何运作):不应该

Oak 的选择:后者。设计应该与具体世界无关,仅基于原理而非错综复杂的领域细节。

引用 Sutton 自述的"苦涩的教训"(Bitter Lesson)精神:

“The actual contents of minds are part of the arbitrary, intrinsically complex outside world. They are not what should be built in as their complexity is endless. Instead, we should build in only the meta methods that can find and capture this arbitrary complexity. We want agents that can discover like we can, not which contain what we have already discovered.”

问题 2:智能体应该从特殊训练数据中学习,还是只从运行时经验中学习?

Oak 的选择:仅从运行时经验学习(entirely experiential)

论证逻辑:

  1. 某些事情必须在 runtime 做(学到的抽象会改变、做世界模型、规划……)
  2. 如果这些事情能在 runtime 做,那么所有事情都应该在 runtime 做
  3. 这样能得到一个概念上更简洁的设计

四、Oak 名称的由来

O来自Options andKnowledge。

  • Option(选项):在 Sutton 的定义中,option 是 (policy, termination) 这一对——一个行为策略,加上一个决定何时停止该行为的条件(他故意省略了 initiation set)
  • Knowledge(知识):在 Oak 中,智能体将拥有大量 options,知识就是"跟随某个 option 会发生什么"

通过学习 options 及其后果,智能体构建出高层转移模型(high-level transition model),从而能以更大跳跃做规划,并沿世界的关节处切割(carve the world at its joints)。


五、Oak 的整体愿景

Sutton 用一个图形化比喻描述 Oak 的目标:寻找 AI 的"圣杯"(holy grail)。

理想的 AI 设计具备:

  • Domain general(不内嵌任何世界特定知识)
  • 概念上简洁(principles-based,而非细节堆砌)
  • 能在线学习高层结构

这与追求"立刻就能跑得好"的应用导向工程形成鲜明对比。Sutton 明确表示:

“My quest is the latter”——他的目标是获得对心智的概念性理解,而非某个具体应用的最佳性能。


六、Oak 与 Alberta Plan 的关系

Sutton 提到他遵循 Alberta Plan for AI Research(他和 Michael、Patrick 等人几年前提出的研究框架)。Oak 是该计划下的具体智能体架构提案,被视为通往"理解心智"这一终极目标的路径之一。


总结

  1. 强化学习是通往强 AI 的必经之路,而非大语言模型这类非经验性的方法
  2. 学习算法才是最大瓶颈,不是算力或数据规模
  3. 真正的智能必须从经验中诞生,且应在运行时持续学习
  4. 架构应保持领域无关,只内置能发现和捕获任意复杂性的元方法
  5. 抽象必须是开放式的,随经验无限扩展,仅受计算资源限制
http://www.jsqmd.com/news/1237366/

相关文章:

  • 2026亚太EMBA QS排名|头部院校中立择校测评 - 品牌2026推荐
  • 2026最新盘点:10款AI写小说软件实测,真正好用的只有这2款?(附避坑指南)
  • 杭州AI应用开发市场观察:企业知识库、智能客服和Agent项目容易踩哪些坑? - IT超人老张
  • 深度解析Whisper.cpp:跨平台语音识别部署架构与性能优化实战指南
  • Path of Building PoE2:5步掌握免费开源的流放之路2角色构建终极指南
  • 2026年7月劳力士太原官方售后服务热线及网点地址信息通告 - 劳力士官方服务中心
  • Olympus-contracts经济学模型:OHM代币价值支撑逻辑全解
  • 校园投票系统选型指南:基础考量与平台对比
  • [Android] uniucy壁纸 -二次元精品壁纸+安卓纯净版
  • 深入解析McBSP仿真模式与复位机制:嵌入式DSP通信调试与配置实战
  • [具身智能-600]:人眼每秒感知多少帧:人眼分辨明暗闪烁的极限频率
  • FreeBSD与macOS系统架构对比及开发环境搭建
  • CAN总线位定时配置:从原理到DCAN寄存器实战
  • SpringBoot+Vue2超市管理系统:从零部署到代码理解的完整指南
  • 如何用ComfyUI-WanVideoWrapper实现语音驱动视频:从静态图像到动态人物的魔法转换
  • 2026无锡APP定制开发公司怎么选:复杂业务系统不能只看页面效果 - IT超人老张
  • ARM中断控制器与SYSCFG配置实战:嵌入式系统稳定性的底层基石
  • 河源黄金回收哪家最靠谱?2026年7月权威排名,源奢汇凭中检双认证稳居榜首,5县1区全覆盖 - 生活测评小能手
  • OpenCode智能状态持久化:像保存游戏进度一样保存你的编程进度
  • 2026长沙望城黄金回收避坑指南!6家靠谱门店覆盖全区,湘奢汇领衔安心变现不踩坑 - 生活测评小能手
  • Grok 4 API免费开放真相:开发者可用的AI基础设施
  • 机器学习核心概念与实战应用全解析
  • 终极指南:使用Python脚本完全控制TP-Link智能插座
  • 2026年7月最新欧米茄常州星耀城吾悦广场维修保养服务电话 - 欧米茄服务中心
  • 认知增强:从AI卸载到人机协同的科研操作系统
  • AutoCAD 2026 完整安装激活指南:从系统准备到稳定配置
  • 2026亚太EMBA推荐|头部院校中立测评,民营企业家择校指南 - 品牌2026推荐
  • Python智能家居控制系统开发指南
  • Rust进入TIOBE前十的技术意义与应用解析
  • 从0开始打造一个属于自己的小龙虾助理