当前位置: 首页 > news >正文

阿里前高管深夜万字长文:AI的下一个时代,不是“想得更久”,而是“边做边想”

林俊阳从阿里离职后,没有回应任何风波,没有官宣下一站,而是直接甩出了一篇近万字的硬核长文。这篇技术思考在发布后几小时内就在X上炸开了锅,有人评价它是“2026年开年最有分量的技术文章”。

文章写得很专业,全是技术语言,但内核其实非常清晰:AI正在从一个“会思考”的时代,跨入一个“会做事”的时代。

今天,我就用你能听懂的大白话,把这篇文章的核心拆解给你看。理解这件事,对你判断接下来AI怎么用、往哪个方向走,会有特别大的帮助。


一、过去两年,AI在解决什么问题?

林俊阳说,过去两年AI行业做的最重要的一件事,叫推理式思考

大白话就是:让AI在回答问题之前,先花更多时间想一想。

OpenAI的o1模型打响了第一炮——通过强化学习训练,让AI学会“先想后答”,在脑子里多转几圈再给出答案。随后DeepSeek证明了这件事可以被复制,而且可以在OpenAI之外做出来。

这件事为什么重要?因为它让AI第一次有了真正意义上的推理能力——不是背答案,而是推导答案

整个2025年上半年,所有人都在研究同一件事:怎么让AI花更多时间思考?怎么控制思考的力度?怎么设计更强的反馈信号?

但林俊阳也点出了一个关键:推理模型之所以能用强化学习训练,是因为数学、代码、逻辑这些领域,对错是确定的——答案要么对,要么错。这才能给模型稳定的奖励信号。

如果是模糊的、开放性的问题,强化学习就很难做到。这是推理模型成立的前提,也是它的边界


二、千问走过的弯路:一个“完美想法”的翻车

这篇文章里最让人意外的部分,是林俊阳坦诚地复盘了千问团队走过的弯路。

当时他们有一个雄心勃勃的构想:把“思考模式”和“指令模式”合并到同一个模型里。

说人话就是:让一个模型同时做好两件事。你问简单问题,它直接回答;你问复杂问题,它自动多想一会儿,给出更深入的结论。而且还能根据问题难度自动判断应该想多久。

千问3就是这个方向最清晰的一次尝试——引入了混合思维模式,同时支持思考和非思考行为,还设计了可控的“思维预算”。

听起来非常完美,对吧?

但做出来翻车了。

林俊阳说,真正的难点不是模型的兼容性,而是数据。因为这两种模式对训练数据的要求,从根本上是相反的:

  • 指令模式需要的数据是:快、短、直接、格式规范。追求低延迟、高吞吐。

  • 思考模式需要的数据是:长、结构化、允许探索、允许绕路。因为复杂问题需要保留足够多的中间推理空间。

两种数据硬塞在一起,结果就是两边都做得一般。思考的时候啰啰嗦嗦、犹豫不决;指令的时候不够干脆、又不够可靠。而且,还更贵。

后来千问怎么处理的?拆开了。2025年下半年,分别发布独立的版本,分开维护,不再强求合并。

这个教训非常深刻:有时候,想用一个模型搞定所有事,反而什么都做不好。


三、其他公司做出了不同的选择

林俊阳也逐一点评了其他公司的路线,其中对Anthropic(Claude的母公司)的评价最正面。

Claude 3.7 Sonnet作为混合推理模型推出,用户可以自己选择普通回复还是扩展思考,API用户甚至可以设置“思考预算”。Claude 4进一步允许推理和工具调用交替进行。Anthropic明确说:推理应该是整合的能力,而不是单独的模型。

林俊阳认为,这是一次有用的纠偏。因为他们的核心逻辑是:思考应当由目标任务来塑造,而不是越多越好。

如果目标是写代码,那么思考就应该帮助代码规划、分解任务、处理错误、调度工具。如果目标是长流程的智能体任务,那么思考就应该提升多步骤的执行质量,而不是产出一大段漂亮的内部推理文字。

他说了一句特别关键的话:

“产出更长的推理轨迹,不会自动让模型更聪明。在很多情况下,过长的推理恰恰是模型算力分配失败的信号——它在用输出文字的量,来掩盖真正的思考不足。”

这句话值得反复琢磨。


四、下一个时代:智能体式思考

这是整篇文章最核心的判断。

林俊阳说,推理思考时代的使命已经完成了。下一个时代叫做“智能体式思考”。

这两者的根本区别是什么?

推理式思考

智能体式思考

AI在脑子里想一圈,然后输出一个答案

AI在和真实世界交互的过程中,边做事边思考

评判标准是答案对不对

评判标准是任务完不完成

他列出了智能体式思考必须处理的五件事,这些是纯推理模型基本上不用面对的:

  1. 判断什么时候停止思考、开始行动——推理模型想完就给答案,智能体要在思考和行动之间不断切换。

  2. 选择调用哪个工具、以什么顺序——这不是简单的函数调用,是实时的动态决策。

  3. 消化来自环境的不完整信息——真实世界不会给你完美的反馈,数据是脏的,信号是片面的。

  4. 失败之后修正计划——而不是推倒重来。

  5. 跨越多轮对话和多次工具调用,保持整体连贯性

一句话总结:从“想更久”,到“为了行动而想”。


五、为什么做智能体比做推理模型难得多?

林俊阳花了大篇幅讲这件事,我觉得这是全文最被低估的部分。

做推理模型的训练过程相对“干净”:给模型一个问题,让它产生答案,判断对错,更新参数。一切在模型内部完成。

但智能体就不一样了。模型需要嵌入一个巨大的外部系统:工具、服务器、浏览器、代码执行沙箱、搜索引擎、记忆系统、多智能体编排架构……这些全部成了训练的一部分。

举个例子:训练一个能写代码的AI。它每写一段代码,需要真的去运行,看报不报错,根据报错信息去修改。等待代码执行的这段时间,整个训练流水线就在空转,GPU的大量算力被浪费。加上工具的延迟、环境的状态变化、信息的不完整,整个系统的效率会急剧下降。

这带来了一个全新的技术要求:训练和推理必须要彻底解耦,否则吞吐量会崩溃。

更重要的是,林俊阳说:在智能体时代,环境设计本身变成了核心研究课题。

环境要稳定、要真实、要覆盖足够多样的场景。还有一个特别关键的风险——作弊

一旦模型有了工具调用能力,它可能会学会走捷径。有搜索就直接去搜答案,有代码执行就利用未来信息,有任何漏洞就找到并利用。训练出来的模型看起来超级强,但实际上它在作弊。

这就是智能体时代比推理时代微妙得多的地方:更强的工具让模型更有用,但也让“虚假优化”的攻击面更大。

下一批真正的研究瓶颈,来自环境设计、防作弊机制、以及评估器的鲁棒性(你可以简单理解为“可靠性”)。


六、从训练模型,到训练智能体,再到训练系统

这是林俊阳整篇文章的最终判断,也是他认为下一场AI竞争的分水岭。

  • 推理时代的竞争优势来自:更好的RL算法、更强的反馈信号、更大的训练规模。

  • 智能体时代的竞争优势来自:更好的环境设计、更精密的训练和推理解耦、更强的多智能体编排能力、以及在模型的决策和决策产生的后果之间形成闭环。

读完这篇文章,我有一个很深的感受:林俊阳没有说任何离职的事,没有情绪,没有暗示。但他写的这些,是一个在一线做了很久的人才能说出来的话。甚至那六个字——“我们没有全做对”——在大厂里能说出来的人,真的不多。

更重要的是,他说的不是遥远的未来,是正在发生的

AI从“会说话”到“会做事”这个临界点,已经到了。


写在最后

如果你觉得这篇文章对你有帮助,可以多听两遍、多读两遍。理解AI正在经历的这场底层变革,对你判断接下来怎么做产品、怎么用AI、甚至怎么规划自己的方向,都会有特别大的帮助。

http://www.jsqmd.com/news/551291/

相关文章:

  • # 发散创新:基于RBAC模型的权限管理系统设计与实现在现代软件架构中,
  • MicroPython WebREPL:嵌入式开发的浏览器交互方案 开发者的无线调试指南
  • 好简历是干啥的?一篇说人话的自我介绍
  • **Envoy + Go:打造高性能服务网格的微服务通信中枢**在现代云原生架
  • LongCat-Image-Editn效果展示:建筑效果图‘添加中文标牌+调整光照’案例
  • VS Code + Jupyter:除了写代码,这些隐藏技巧能让你的数据分析报告更出彩
  • 如何用浏览器扩展将网页内容一键转换为AI知识库
  • RTX 4090D镜像部署案例:PyTorch 2.8运行MiniCPM-V-2.6图文问答准确率实测
  • Python开发者必看:pip换源全攻略(附国内常用镜像源对比)
  • 零代码部署YOLOv9:官方镜像5分钟快速上手,实测效果惊艳
  • 【服务器】上传百度网盘数据至服务器
  • 如何写好一份SDC——流程篇
  • SecGPT-14B部署教程:华为云ModelArts中适配vLLM的Ascend CANN优化方案
  • 关于CO2地下盐水层封存的Comsol复刻之旅
  • 3个革新性视角:Tomato-Novel-Downloader的内容自由解决方案
  • 开源工具权限重置指南:跨平台AI编程助手试用限制解决方案
  • 【愚公系列】《剪映+DeepSeek+即梦:短视频制作》030-调色:废片秒变氛围感大片(基础参数的调节)
  • VibeVoice Pro多语言混合输出:中英混说场景下流式语音连续性测试
  • 56. 合并区间(Merge Intervals)——C语言高质量题解
  • DMDRS二进制安装包部署搭建(DM8单机版)
  • 拒绝做“代码蝉”:研发团队如何设计“有感”的微愿景?
  • Face Analysis WebUI保姆级教程:3步完成GPU加速的人脸属性分析环境部署
  • Tantivy 与 Milvus 的深度整合:倒排索引在向量搜索中的性能优化实践
  • OpenCore Legacy Patcher:3大突破让旧Mac重获新生的系统兼容性优化指南
  • SOONet部署案例:Kubernetes集群中SOONet服务容器化与水平扩缩容实践
  • 4步解锁旧Mac潜能:OpenCore Legacy Patcher技术指南
  • FPGA工程师面试汇总(五)
  • 前缀和力扣题(leetcode)
  • 155. 最小栈(MinStack)题解
  • BAAI/bge-m3快速入门:3步搭建你的第一个语义相似度分析工具