当前位置: 首页 > news >正文

只用一张卡,做出了声称是100M参数以内最好的小模型?

近日,独立开发者 Harshal Singh 公布了一个仅有 3500 万参数的基础语言模型 BarunLM,并声称:「我预训练了世界上参数量小于 100M 的最好模型」。

AI 圈有一种颇为复古的快乐:小参数模型暴打远超自身体量的对手。

上周,一位名为 slvDev 的开发者将一个 2890 万参数的语言模型,装进了售价约 8 美元的 ESP32-S3 微控制器。整块板子只有 512KB SRAM、8MB PSRAM 和 16MB 闪存。无需联网,模型可以直接在芯片上以约 9.5 token/s 的速度生成文本。

当然,这个模型只在 TinyStories 上训练过。它不会写代码,不能调用工具,也回答不了世界知识问题,主要能力是续写简短的儿童故事。

但这似乎并不妨碍开发者们玩得很开心。

近日,独立开发者 Harshal Singh 公布了一个仅有 3500 万参数的基础语言模型 BarunLM,并声称:「我预训练了世界上参数量小于 100M 的最好模型」。

按照作者给出的结果,BarunLM-35M 在九项零样本基准上的平均准确率达到 41.01%,超过了参数量约为其 6.55 倍的 Liquid AI LFM2.5-230M-Base,也超过了 GPT-2、Pythia-160M 等体量明显更大的模型。

更惊人的是,该模型仅使用单个 H200 GPU 进行训练。

整个项目已经开放模型权重、训练与推理代码以及完整评测结果,采用 Apache 2.0 许可证。

  • Github 链接:https://github.com/harrrshall/barunlm-35m
  • Huggingface 链接:https://huggingface.co/harrrshall/BarunLM-35M
技术细节:让大部分注意力「只看附近」

BarunLM-35M 共有 35,072,768 个参数,使用约 57 亿 token 进行预训练,训练上下文长度为 2048。

作者采用 LM Evaluation Harness 0.4.12,对模型进行了九项零样本评测,包括 ARC-Challenge、ARC-Easy、BoolQ、HellaSwag、LAMBADA、OpenBookQA、PIQA、SciQ 和 WinoGrande。

在这套评测中,BarunLM 领先 LFM2.5-230M-Base 1.81 个百分点。作者还进行了 1 万次配对 bootstrap 重采样,得到的差值置信区间为 0.92 至 2.71 个百分点。

性能提升源于更优的架构。作者从 DeepSeek、Kimi 和其他前沿开源模型中汲取了灵感。

模型共有 12 层,隐藏层宽度为 448,采用 7 个查询头和 1 个共享键值头。其最显眼的设计,是按照 3∶1 的比例交替使用局部注意力与全局注意力:连续三个网络层只查看前后 256 个 token,第四层再执行一次全局信息交换。

标准全局注意力需要让序列中的每个 token 与其他所有 token 建立联系,计算量会随序列长度平方增长。但语言中的大量依赖其实发生在相邻范围内,因此,BarunLM 让大多数层处理局部信息,只定期打开一次全局视野。

这种设计降低了计算开销,同时又没有完全切断长距离信息流。

第二项关键设计是「可学习残差选择器」。模型每隔四层设置一次选择机制,在多个中间表示之间决定应该保留哪些信息。它试图解决小模型的一个现实难题:网络容量有限,每一层都很珍贵,如果早期形成的有效特征在后续计算中被覆盖,模型没有足够冗余去重新学习。

除此之外,BarunLM 还组合了分组查询注意力、50% Partial RoPE、QK Normalization、门控注意力输出和 bounded SwiGLU,并将输入、输出嵌入权重绑定。词表被控制在 16384,进一步减少了嵌入层占用的参数。

训练预算同样值得注意。模型共看过约 57 亿 token,相当于每个参数对应 162.5 个训练 token。数据来自 FineWeb-Edu、Cosmopedia v2、FineMath-4+、DCLM、CodeSearchNet Python 和 CodeParrot Clean,覆盖教育文本、合成数据、数学、通用网页与代码。

最后 40 亿 token 的训练在单张 H200 上完成,使用 Muon 优化器,共训练 40690 步。

BarunLM 首先是一个基础模型,没有经过指令微调。它的上下文窗口只有 2048。作者明确表示,它主要面向紧凑语言模型研究、教学、文本生成实验和本地原型开发,而非医疗、法律或金融等高风险场景。

小模型的意义,不是成为缩小版 ChatGPT。当一张卡的训练预算就能够实现一些强大性能的时候,未来的想象将更加广阔。

http://www.jsqmd.com/news/1321550/

相关文章:

  • 深入PyTorch内部机制:从原理到实践的性能优化与调试指南
  • 毕业论文图表目录自动化生成指南:Word与LaTeX高效实现
  • BLE Bee模块实战:低功耗蓝牙选型、硬件兼容与物联网传感器节点开发
  • Unlock Music终极指南:5分钟快速解密10+种加密音乐格式
  • 机器学习数据集划分实战:以Oxford Flower102为例详解训练、验证、测试集构建
  • UE5 Compute Shader实战:GPU加速大规模粒子系统开发指南
  • 3大渠道实测|证件挂失怎么登报?新手一次办成功完整攻略
  • PyTorch内部机制深度解析:从Autograd到Dispatcher的底层原理与实践
  • 未来理财工具:行为经济学与蒙特卡洛模拟的应用
  • RVM安装与管理Ruby版本:从环境隔离到故障排查全指南
  • Unity集成思必驰语音SDK:从零打造语音交互功能实践
  • Unity UGUI实战:从零复刻RPG游戏UI系统,掌握模块化架构与性能优化
  • TwitchNoSub:终极免费观看Twitch订阅专属内容浏览器扩展指南
  • 音乐歌词下载工具终极指南:免费批量获取LRC歌词的完整解决方案
  • 如何让你的普通鼠标在Mac上超越触控板体验:Mac Mouse Fix完整指南
  • Unity游戏开发实战:从性能优化到多平台发布的工程化指南
  • 5页以上的银行流水翻译件去哪办理?这份避坑指南请收好
  • Qt界面渲染技术解析:从Widgets到QML的演进与实践
  • SpringBoot自动配置与JVM分代GC深度解析
  • 终极指南:如何快速掌握阴阳师自动化脚本的3大突破技巧
  • Unity项目Library文件夹深度解析与高效清理实战指南
  • 直播购物平台WhatNot如何重塑零售业与消费体验
  • 2026期货量化API接口评测:核心维度与实战解析
  • 出生证NAATI翻译千万别随便翻!小心被退回!合规渠道在这篇
  • Chart 结构设计:从‘能用’到‘可维护’的目录与命名规范
  • BepInEx插件开发入门:从环境搭建到Harmony补丁实战
  • 2026年豆包GEO优化服务商TOP5盘点:从语义引擎到效果保障的全维度评测 - 商业观察
  • UE5专用服务器开发环境搭建:从项目创建到VS配置全攻略
  • 186、TinyML实战项目:智能照明与节能控制
  • 内行干货!2026长沙芙蓉黄金回收隐藏套路拆解 本地实体门店避坑终极指南 - 逸程奢侈品回收中心