当前位置: 首页 > news >正文

35B模型碾压万亿大模型 AI新一轮内卷彻底变天

文章目录

      • 前言
      • 1 以前的增长密码,现在不好使了
        • 1.1 规模法则,也有边际效应
        • 1.2 最缺的不是数据,是“好题”
      • 2 BigBang的思路:让AI自己给自己出题
        • 2.1 内层循环:出题的和挑错的对着干
        • 2.2 外层循环:杜绝自嗨,用真本事校准
      • 3 35B参数干赢万亿大模型,赢在哪
        • 3.1 评测成绩,确实离谱
        • 3.2 赢的不是记忆力,是解题思路
      • 4 这事真正的影响,比“小胜大”更深远


P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/H1727548

前言

最近AI圈有俩事儿凑一块了,越品越有意思。

一个是在谷歌待了27年的技术元老Jeff Dean,直接带着三个老搭档离职创业,公司就干一件事:让AI自己搞定从提实验到出结果的全流程。

另一个是上交大联合深势科技的团队,放了个叫BigBang‑V1的科研大模型,35B的参数,愣是在好几个高难度任务上干赢了万亿参数的大模型。

俩事儿看着不搭边,内核其实是同一个:AI光靠人类喂数据的日子,快到头了。

1 以前的增长密码,现在不好使了

1.1 规模法则,也有边际效应

搞AI的以前都信规模法则,参数翻一倍,数据翻一倍,能力就跟着涨。

这逻辑就像开奶茶店靠大杯引流,杯子越大越有面儿,买的人就多。

可杯子总不能无限大吧?真搞成水桶那么大,没人拿得动,也喝不完。

AI也一样,预训练数据就那么多,高质量的早就被扒得差不多了。再堆100倍规模,也很难出本质变化。

行业兜兜转转,又得回头拼研究了。

1.2 最缺的不是数据,是“好题”

很多人说互联网数据还多着呢,愁什么?

这就像题库里题是不少,但学霸都刷过三遍了,再做也涨不了分。

真正值钱的题,得是模型刚好不会、做了能涨本事、做完还能准确判分的。

太简单的题,练了白练;太难的题,连对错都没法判,也给不了有效训练信号。

这种题以前都靠人类专家出。可GPU24小时连轴转,人类专家一天三杯咖啡都顶不住。

你让他熬夜出卷子,他头发掉得比模型收敛速度还快,根本供不上算力的胃口。

2 BigBang的思路:让AI自己给自己出题

2.1 内层循环:出题的和挑错的对着干

这套系统核心是俩Agent,一个负责出题解题,一个负责挑刺审查。

说直白点,就是一个当出题老师,一个当审题纪委,俩人天天对线。

生成的题过不了审查,就打回去改;审查出的问题,还能反过来调整下一轮的出题方向。

而且这个出题的Agent不是死脑筋按模板出,它能自己改代码、调策略,连出题的程序都能自己优化。

相当于老师不仅出卷子,还能自己改出卷规则,越出越懂怎么考学生。

2.2 外层循环:杜绝自嗨,用真本事校准

光俩Agent自己玩,很容易陷入自嗨。

就像俩老师关起门来出题,互相夸这题出得有水平,结果一到高考,学生全考砸。

所以BigBang加了一层外层循环:拿真实的科研任务当最终考场。

用不同版本的出题系统造数据,训练完模型直接去跑真实任务,看看到底有没有长进。

要是出题系统觉得题很好,训练完模型没进步,那就连出题带审核的标准一块改。

彻底杜绝“我觉得我很强”的幻觉,一切拿真实效果说话。

3 35B参数干赢万亿大模型,赢在哪

3.1 评测成绩,确实离谱

说出来很多人不信,35B的小模型,在好几个高难度任务上,把1.6T参数的模型给超了。

这就相当于35人的小团队,干赢了1600人的大厂部门,你说夸张不夸张。

不管是前沿科研任务、生物难题,还是代码开发、长程检索,十项评测里拿了十个第一。

以前大家挂嘴边的“参数即正义”,现在看来,也不是绝对真理。

3.2 赢的不是记忆力,是解题思路

很多人说,不就是刷题库刷多了,背答案呗?

还真不是。要是光背科学知识,那长进只能在科研任务里体现。

可它连代码、网页搜索这类通用任务也跟着变强了,说明学的是方法论。

就像学生时代的学霸,不是背了多少题,是学会了怎么拆解问题、找证据、试错、调整。

比如做病毒识别任务,别的模型跑三次出三个答案,它次次都能收敛到同一个结果。

算复杂数学积分,别的模型直接调用函数出结果,它能一步步把推导过程写全,每一步都能验证。

说白了,以前的模型是“答案搬运工”,这个模型,是真的有了点“做研究”的样子。

4 这事真正的影响,比“小胜大”更深远

很多人一看标题就说,又是小模型挑战大模型的爽文。

格局小了。

这件事最核心的,不是又出了个厉害的模型,是改了数据生产的逻辑。

以前是人类定方向、出题目、写答案,AI负责学。AI再强,也跳不出人类给画的圈。

现在是AI自己参与定方向、造题目、验结果,还能根据效果迭代下一轮的学习内容。

相当于从填鸭式教育,变成了自主学习型学霸,自己给自己安排学习计划,还能自己调整难度。

以前大家拼的是谁GPU多、谁数据多。

以后拼的,是谁的“造题机器”进化得更快,谁能持续找出下一道能让AI涨本事的题。

毕竟,能一直出好题的,才能一直赢下去。

P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/H1727548

http://www.jsqmd.com/news/1356398/

相关文章:

  • 都匀网站建设公司揭秘:如何在本地数字化浪潮中打造真正有竞争力的企业官网
  • RAG文本分块:从语义分割到评估调优的工程实践
  • 基于Faker与SQLAlchemy构建高效测试数据生成系统
  • 2026 年至今,庆阳专业的单双三管高压旋喷桩施工队推荐,花大几十万打桩反而烂尾?原来这类工程选错了工具才吃大亏 - 企业推荐管【认证】
  • 2026 年至今,天门靠谱的6米中空锚杆供应商怎么联系,这款岩土支护里的关键配件,为啥能让工地效率翻番还少花成本?-万尊金属 - 领域鉴赏官
  • 如何在5分钟内零配置实现SQL数据可视化:sqliteviz快速入门指南
  • 2026 年新消息:舞钢专业的PHS管桩400源头厂家哪家可靠,用它做地基居然比常规款省三成成本?难怪工程队都悄悄在买 - 鉴选官
  • 抖店一件代发退货地址怎么填?退货流程详解 - 抖大侠
  • 【2027最新】基于SpringBoot+Vue的在线家具商城设计与实现管理系统源码+MyBatis+MySQL
  • 数据库疑难解答三
  • WebSocket技术解析:实现高效全双工通信
  • OpenFace 2.2.0:5分钟构建专业级面部行为分析系统
  • 经典C34PLUS机箱改造:2024顶配硬件装机实战
  • KMS激活神器:Windows和Office永久激活的终极免费方案
  • 抖店一件代发售后怎么处理?常见售后问题解决方案 - 抖大侠
  • SD WebUI内存释放扩展终极指南:彻底根治GPU显存泄露的完整解决方案
  • 2026年挑选靠谱HDMI矩阵厂家,看准这三点就够了
  • 基于词袋模型的肺腺癌病理图像生长模式识别与空间映射实践
  • 北京诉讼离婚律师推荐:如何选择合适的律师 - 品牌排行榜
  • 3步搞定视频离线观看:VBrowser-Android让你随时随地畅享高清影视
  • 如何让Ender-3 3D打印机告别断电烦恼:从固件配置到完美打印的完整指南
  • 【愚公系列】《WorkBuddy从上手到变现》017-用AI Agent实现公众号自动化运营(从1个号到矩阵:规模化的可能和边界)
  • 从AI编程助手到意图驱动开发:Cursor如何重塑软件开发范式
  • 地瓜机器人「地心引力DemoDay」收官,欧拉万象、巡领科技、眺月科技斩获前三
  • 基于NLP与规则引擎的趣味文本解析实战:从“摸摸花咲川大金毛”到结构化标签
  • 3个颠覆性技巧:让electerm终端界面提升300%可读性的终极配置指南
  • 网盘直链下载助手:免费解锁九大网盘下载速度的终极指南
  • 游戏技能系统设计:基于状态机与时间轴实现多段技能框架
  • HarmonyOS 7.0 / API 26 悬浮页签适配实战:折叠屏展开后焦点、滚动和选中态如何保持
  • 龙膜全球臻选店:**授权品质保障 - 品牌排行榜