2.8万亿!全球参数量最大的开源模型Kimi K3,究竟能力如何?
文章目录
- 速览
- 排名对比
- LiveBench 排名
- LMArena 排名
- Artificial Analysis 排名
- 实测
- Kimi Code Plan
- 思考
速览
月之暗面(Moonshot AI)于7月17日(X上的发布时间)发布Kimi K3。
昨天我用了一下,感觉还不错,故写文分享一下。我做的事情是优化OBS(开源录屏软件):
- 实现随意框选区域进行录屏,无需多余操作;
- 增加桌面悬浮窗,实现快速录屏和停止、快速录制选区。
这两天稍微处理一下就发布。
回到 Kimi K3,它是目前全球参数规模最大的开源大模型,参数量达到了 2.8 万亿级别。 1M 上下文窗口 + low / high / max 三档思考深度,擅长复杂工程任务与长程推理,原生多模态。
目前国内的几个顶级模型都表现不错:Deespseek、GLM、Qwen、Kimi…,而且都是开源。
简单对比一下:
| 模型 | 厂商 | 发布时间 | 总参数量 | 专家架构 | 上下文窗口 | 模态 | 开源状态 |
|---|---|---|---|---|---|---|---|
| Kimi K3 | 月之暗面 | 07-17 | 2.8T | MoE (激活约50B) | 1M | 多模态:文本、图像、视频输入,文本输出 | 计划开源,完整权重预计 2026 年 7 月 27 日前放出 |
| DeepSeek V4 Pro-Preview | 深度求索 | 预览版:04-24 正式版即将发布 | 1.6T | MoE (激活约49B) | 1M | 纯文本(无多模态) | 已开源,MIT 协议 |
| GLM-5.2 | 智谱AI | 06-13 | 753B | MoE (激活约40B) | 1M | 纯文本(无视觉能力) | 已开源,MIT 协议 |
| Qwen3.8-Max-Preview | 阿里云 | 07-19 | 2.4T | MoE (激活参数未公开) | 1M | 多模态:文本、图像、视频、文档 | 预览版闭源,正式版计划开源(时间未定) |
| MiniMax-M3 | 稀宇科技 | 06-01 | 428B | MoE (激活约23B) | 1M | 原生多模态:文本、图像、视频 | 开源权重 |
价格对比:
说明:国产模型以**人民币(元/百万Token)计价,海外模型以美元(USD/百万Token)**计价;价格均为厂商公开的标准零售价格,不含企业定制、批量折扣。具体的各个模型的价格计算可能比下图/表列举的复杂一点,这里就不展开了,大致比较一下。
| 模型 | 标准输入价 | 标准输出价 | 缓存命中输入价 | 定价规则与备注 |
|---|---|---|---|---|
| Kimi K3 | 20 元 | 100 元 | 2 元 | 全上下文窗口统一费率,支持1M token上下文 |
| DeepSeek V4 Pro | 3 元 | 6 元 | 0.025 元 | 默认开启思考模式无额外加价,1M token上下文统一价 |
| GLM-5.2 | 8 元 | 28 元 | 2 元 | 全上下文窗口统一费率,支持1M token上下文 |
| Qwen3.8-Max-Preview | 约 12 元* | 约 36 元* | 约 1.2 元* | *参考上一代Qwen3.7-Max官方标准价推算;当前为预览阶段,无公开按量付费单价,仅通过订阅Credits计费,预览期享标准价1折优惠 |
| MiniMax-M3 | ≤512K:2.1 元 >512K:4.2 元 | ≤512K:8.4 元 >512K:16.8 元 | ≤512K:0.42 元 >512K:0.84 元 | 官方永久五折后价格,按输入Token长度阶梯计费 |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | GPT-5.6系列旗舰版本;同系列还有均衡版Terra($2.5/$15)、轻量版Luna($1/$6)两个档位 |
| Claude Fable 5 | $10.00 | $50.00 | - | Anthropic当前旗舰模型,1M token上下文;官方支持上下文缓存(约90%折扣),具体费率未单独公示 |
可以看到,Kimi K3在国产开源模型中,参数量最大,价格也最高,比此前我觉得贵的GLM-5.2还要贵,不过比GPT和Claude这2个顶级闭源模型便宜。
排名对比
我这几天看到的 Kimi K3 评价都是比较好的,这里再看一下跑分排名吧,这里的排名有专业评测和真人主观评价等不同模式。
Kimi K3、DeepSeek V4 Pro-Preview、GLM-5.2、MiniMax-M3
LiveBench 排名
核心特点:每月更新测试题目,所有问题都有客观标准答案,彻底避免 AI 模型训练数据污染问题
评估维度:数学推理、代码生成、知识问答等多个领域,强调模型的真实学习与问题解决能力
适用场景:适合评估模型的客观能力边界,而非主观用户偏好
官网:https://livebench.ai/
综合排名:Kimi K3来到了第6名。
更多排名情况(数值为得分,得分下面是排名):基本全是最强的
LMArena 排名
核心机构:加州大学伯克利分校 LMSYS 组织开发维护
核心机制:匿名盲测对战,用户在不知模型身份的情况下对两个 AI 回答投票,采用国际象棋 ELO 评分系统
覆盖范围:全球 190 + 主流大模型,涵盖文本对话、数学推理、编程、图像生成等多个竞技场
特点:
- 月活用户 500 万 +,覆盖 150 + 国家,每月 6000 万 + 模型对话
- 细分多语言榜单(中文、英文等),数据公开且每日更新
- 被称为 AI 领域的 “奥运会”,结果反映真实用户体验偏好
官网:https://arena.ai/zh/leaderboard
排名对比(数值为最高排名):
| 模型 | Text | Agent | WebDev |
|---|---|---|---|
| Kimi K3 | 8 | 4 | 1 |
| DeepSeek V4 Pro | 43 | 22 | 33 |
| GLM-5.2 (Max) | 29 | 11 | 4 |
| MiniMax-M3 | 60 | 24 | 21 |
在前端网页开发这一项排到了全球第一!
Artificial Analysis 排名
核心特点:综合 10 项评估维度,从 “AI 智商” 角度全面衡量模型能力,包含逻辑推理、抽象思维、学习能力等
评估方法:结合客观测试与专家评审,结果具有较高参考价值
最新版本:Intelligence Index v3.0,覆盖主流闭源与开源模型
官网:https://artificialanalysis.ai/
排名对比:
| 评测项目 | Kimi K3 | GLM-5.2 | MiniMax-M3 | DeepSeek V4 Pro |
|---|---|---|---|---|
| 总体综合指数 | 3 | 9 | 15 | 15 |
| 智能体真实工作任务 | 3 | 9 | 11 | 14 |
| 智能体工具使用 | 1 | 8 | 21 | 11 |
| 代码与终端能力 | 3 | 11 | 16 | 18 |
| 纯代码能力 | 2 | 14 | 19 | 14 |
| 复杂推理与知识 | 6 | 10 | 14 | 16 |
| 科学推理 | 1 | 16 | 5 | 16 |
| 物理推理 | 6 | 7 | 21 | 14 |
| 知识准确率 | 8 | 18 | 26 | 10 |
| 长上下文推理 | 1 | 9 | 2 | 19 |
| 长周期知识工作 | 2 | 7 | 9 | 10 |
和更多模型比较:
从前面的一些排名中可以看到,Kimi K3 整体差不多达到了全球第三的水平,某些领域则达到了第一。
可喜可贺。
但,其实还是有较大差距的。
再来看一下LMArena 排行里面的前10名模型:可以看到这8项排名里面大多数都是GPT和Claude,国产只有12.5%。
对国产模型的崛起,我即为之喜,又为之贺,但不可盲目自信。
实测
如开头所说,我昨天对OBS做了功能优化:
- 实现随意框选区域进行录屏,无需多余操作;
- 增加桌面悬浮窗,实现快速录屏和停止、快速录制选区。
- 绘制区域进行录制时,自动添加默认音频,做到框选后就可以直接录制目标区域音视频。
更多细节后续发布。
最开始是使用GLM-5.2做的,但它一直无法处理自动设置画布分辨率的问题。之后使用 Kimi K3 得以实现。
最终效果如下图:
我是obs深度用户,这项功能的增加,我认为非常使用。
还有几个小功能需要增加,预计这几天就会构建安装包并开源并给官网提交PR。
Kimi Code Plan
不出意外的话,和智谱一样的,套餐售罄:
DeepSeek虽然最便宜,不过高峰期(白天),价格也是翻倍的。
我昨天使用的是opencode的Go套餐里面的,具体介绍我之前文章写的详细:https://mp.weixin.qq.com/s/4_cZOStFYJ-0qF8GOrv-cQ
如果你要尝试Go套餐,可以使用我的要求链接:https://opencode.ai/go?ref=VH6HNYB1GE
你和我都能获得5美元的Go额度。
现在Go套餐里面的K3模型是显示2倍用量,但我的用量依旧消耗的很快,还用了好几个赠送额度。
同时我也订购了火山方舟的Agent Plan,里面也可以选择K3:前面的文章也分享了这个,不重复了
思考
AI发展真的很快,我今年手写的代码很少,大多数都是AI完成的。
一些行业,用时间成本换取薪水的模式或许正在走向终结。
之前看到过一张图:
有点搞笑,但又不无道理。
当我们的技能变成一个个Skill 时,我们还剩下什么呢?
还剩下: 你的判断力、 你的信誉、 你的责任感、 你的随机应变能力…
这些或许才是最后无法被蒸馏的东西。
坦率地说,没有什么是绝对安全的。
AI 的发展速度已经超越了我们预测的精度。
但与其在焦虑中等待被替代,不如把 AI 当作一场倒逼我们进化的海啸。
这场海啸会冲刷掉所有平庸的、机械的技能,迫使我们去面对一个最核心的问题:
当机器可以做得比我们更好时,生而为人的独特意义到底是什么?
这是一个没有标准答案的问题。
未来已来,你认为人类最后一道不可替代的防线,到底在哪里?
我的回答:人类最后不可替代的防线,或许在于“意义的赋予”与“真实的联结”。
