当前位置: 首页 > news >正文

月之暗面放出 Kimi K3 完整权重,Mac 本地运行潜力几何?

社区反应迅速

月之暗面放出 Kimi K3 完整权重之后,社区动作比预想快,“在 M1 Max 上跑 Kimi K3”的帖子今天登上了 Hacker News 首页。

Deltafin 项目支持本地运行

这是一个名为“Deltafin”的小型研究项目,支持在 Apple Silicon Mac 上本地运行 Kimi K3(2.8 万亿参数)。

HN 讨论帖评论两极分化

HN 讨论帖的评论两极分化严重。一边说“0.3 token 每秒,这东西有什么意义?”另一边说“你想想,2.8 万亿参数,在你的桌面电脑上跑。”两边都有道理,但这个争论跳过了更有意思的问题——K3 能在 Mac 上跑起来,并非有人想方设法去压缩它,而是这件事从一开始就写在了架构里。

Raschka 架构笔记

Raschka 在 K3 开源完整权重 48 小时内就出了一篇架构笔记。他的第一句判断很简单:“本质上是 Kimi Linear 的规模化生产版本。”Kimi Linear 是 Moonshot 去年的工作,只有 48B 参数。现在 K3 把它放大到了约 2.8 万亿,加了一个关键组件:LatentMoE。

LatentMoE 概念及优势

这个概念不是 Kimi 首创——NVIDIA 的 Nemotron 3 Ultra 也用了类似方案——但 K3 是第一个把它做到这个体量的。核心思路是把标准 MoE 里的大线性层通过下投影压缩。通俗来讲,模型虽然整体巨大,但每次推理只激活一小部分专家,其余老老实实待在磁盘或网络存储上。一个 MoE 模型对本地推理天然友好,不是靠事后裁剪,是架构生来如此。

MXFP4 原生训练

第二个设计是 MXFP4 原生训练。K3 从训练第一天起就是 MXFP4 格式。这意味着下载下来的权重不需要经历一次额外的量化步骤——下载即用。对服务器这不重要,对一台 Mac 很重要。1.6TB 的权重文件,如果还需要再转换一轮格式,大多数人连试都不会试。K3 把这个步骤省了。

NoPE 设计

第三个更激进:NoPE。K3 移除了全部 RoPE 位置编码,全模型不用任何位置嵌入。Raschka 说据他所知,这是第一个在“前沿级别”模型上这么干的。其他架构的做法更保守——Gemma - 4 在滑动窗口注意力层用 RoPE,全局注意力层用 NoPE。K3 则一刀切。

去掉 RoPE 与本地推理的关系

为什么这跟本地推理有关?因为去掉 RoPE 意味着计算路径更短。HN 上有人解释了这是怎么回事:因果掩码本身就隐含位置信息;KDA 层(从 Gated DeltaNet 派生)本质上是 RNN - like,天然理解序列顺序;而且 K3 在第一个注意力层之前堆了 3 个 KDA 层——位置信息在注意力启动之前就已经被学到了。没有 RoPE,少了一步计算,在每一点速度都很重要的场景下,这不算小事。

deltafin 项目串联架构特性

deltafin 这个项目就是把这些架构特性串起来的。它做的事不复杂:K3 的 MXFP4 专家权重按需从 HTTP 流式传输到本地磁盘缓存,用 fused NEON 内核和 Metal/MPS 做推理。逐 token 拉专家,推理完就放。项目提供 OpenAI 兼容的 API 接口,支持确定性解码——每次跑同样的 prompt 会得到完全相同的输出。

antirez 在 M5 Max 上搞定 K3

Redis 作者 antirez 几乎同时在做同一件事,但更硬核一些,他在 M5 Max 上搞定了 K3。

antirez 读取权重及后续计划

antirez 用 M5 Max 128GB 直接从 Hugging Face 流式读取 K3 的 1.6TB 权重。“有点慢,”他承认。但从他后续的推文来看,这不只是一个好玩的项目。他在等两台 512GB Mac Studio——“进行 Q2 精度量化,至少聊天场景下可以达到可接受的速度。”他的判断是 K3 在 MXFP4 上训练的,“感觉量化效果会很不错”。

再谈 HN 争论

再回到 HN 那条争论。

速度与应用场景

0.3 tok/s 确实慢。随着 KV cache 增长会越来越慢——完整 1M token 上下文下 cache 就占约 27GB。但问题不是速度,是用什么场景来衡量。如果你是坐在屏幕前等回复,0.3 tok/s 是折磨。如果你是把一批测试用例挂上去过夜跑评估,或者用 LLM - as - judge 做离线打标,那这个速度完全没问题。有人说得挺到位:“OpenAI 和 Anthropic 的批量 API 给你打五折。这个是打九八折。”

与以往不同的路数

更关键的是这次和以前不一样。

传统大模型与 K3 的对比

以前的路数是:大模型发布 -> 社区费尽全力做量化、裁剪、蒸馏 -> 勉强塞进消费级硬件,性能打折扣。K3 的路数是反过来的:模型架构本身的设计选择——LatentMoE、MXFP4 原生训练、NoPE——让它在发布的时候就已经准备好了被人在各种硬件上跑。不是“有没有办法压缩”,而是“用不着压缩”。

K3 架构思路的意义

不是说每个大模型都应该这么设计。但如果开源权重的核心价值在于任何人、任何机器都能用,那 K3 的架构思路——让一台 Mac 也能跑 2.8 万亿参数——本身就是在扩大“开源”两个字的实际含义。

未来速度提升的期待

接下来要看的是,两台通过 Thunderbolt 5 连接的 Mac Studio 512GB 能不能把速度推到“可交互”的水平。antirez 觉得行。其他人可以等着看。

http://www.jsqmd.com/news/1292304/

相关文章:

  • 月之暗面开源 Kimi K3 权重,开发者热议自建成本与技术路线
  • 3分钟搞定永久分享:百度网盘秒传脚本终极指南
  • C++核心构造单元:类、结构体、指针与引用深度解析与实战指南
  • 一条自己攒的AI图标制作流水线工具链
  • 2026 年花都正规的旋流喷淋塔直销厂家哪家好,车间异味总治不好?原来你缺了这台“看不见的空气清道夫” - 企业推荐管【认证】
  • API接口对接常见问题排查与落地解决方案工作总结
  • AI驱动的全流程产品研发与迭代:从构想到部署的完整实践
  • 价值投资的核心逻辑与实践策略
  • AI 技术日报 - 2026-07-30
  • 专业级飞行控制系统优化:PIDtoolbox黑盒日志分析终极指南
  • B2B企业短视频运营指南:抖音运营公司选型与西骏传媒深度解析
  • vLLM大模型部署优化:PagedAttention机制与生产实践指南
  • 广州渲染农场怎么选?本地创作者的云渲染参考
  • Git 完整学习笔记:从入门到团队协作
  • Ubuntu 部署 Docker 完整教程
  • Android插件化开发实战:Shadow框架SDK接入与核心原理详解
  • 抚琴成一快-4m6/6b和弦
  • STM32串口通信实战:从HAL库配置到DMA+空闲中断应用
  • PN532 NFC模块串口通信全解析:从硬件连接到MIFARE卡读写实战
  • PCB标签定制公司发展现状、痛点与前景深度分析
  • 全面掌握大气层系统:Nintendo Switch进阶用户的实用配置指南
  • gif压缩工具:邮箱附件超限被退时按人群怎么压 - 办公小帮手
  • 5 款主流电商 AI 作图工具深度测评!批量出图、商品保真哪家更强?
  • 2026 上海物流数字化服务商 TOP10 实力榜:拆解 5 个百万级踩坑点,企业选型直接抄作业
  • Abaqus热应力分析中对流换热建模与优化实践
  • 得物推荐评测平台:缩短评测周期至小时级,节省 91% 资源成本!
  • Transformer架构解析:从自注意力机制到工程实践
  • 老年人数字健康平台选型:合规落地与全流程审查指南
  • B 端工厂抖音运营服务商选型全解析(2026年7月工业营销获客指南)
  • 高强度塑钢打包带的优势是什么