当前位置: 首页 > news >正文

Kimi K3 实测:2.8T 参数、100 万上下文,我让它做了网页、PPT 和 3D 游戏

Kimi K3 实测:2.8T 参数、100 万上下文,我让它做了网页、PPT 和 3D 游戏

大家好,我是王不二。

最近事情实在是太多,没有第一时间发布K3的实测,请各位粉丝海涵。

晚是晚了点,但好处是排队的人……并没有变少。反正已经迟到几天了,索性把测试做得更扎实些。

写在前面:为了测它,我充了 199

先说一件有点肉疼的事。K3 上线后实在太火,好几次想白嫖测试,K3都很客气的把我拒绝了。

于是我一咬牙,充了 199 的会员。某种意义上,我的钱包比我更先体验了 K3。为了给大家做这期测试,也算是下了血本,看完觉得有用记得给个三连啦。

真金白银换来的第一手上手体验,基本可以浓缩成四个字:大、慢、强、贵

大,是真的大:我其实有点不理解Kimi,之前大家都说不卷参数不卷参数,结果Kimi回回把模型越做越大。上一次也是Kimi率先把模型参数从B级别,带到了T级别。这次更狠,直接奔着3T去了。照这个膨胀速度,以后本地部署党可以彻底死心了,甚至很多企业端想要本地部署,也可以死心了。也挺好,我的显卡释放出来,全心全意为我的游戏服务。

慢,是真的慢:这个不单单是我的体验,基本用过的都会吐槽。倒不是因为显卡、算力什么的不够,导致的回复慢。而是模型想太多,一个简单任务也要思考半天,还要再校验,校验完自己还要再润色。但客观来讲,面对复杂问题的时候,这种做法还是不错的。所以你能明显感觉到,模型在处理复杂任务上很强。

强,是真的强:复杂问题上的思考深度确实换来了质量。这里先不展开了,下文有实测

贵,也是真的贵:API 输出价 $15/百万 token,比上一代 K2.6($4/百万 token)贵了近 4 倍;第三方 Artificial Analysis 跑一轮完整评测,烧了 1.3 亿输出 token,成本约 2690 美元,收获中肯评价“聪明但贵且慢”。连 C 端会员都得分档,199 这档才算真正用上完整版——是的,就是我充的那档。

一、K3 基本情况

项目内容
发布时间2026 年 7 月 16 日深夜上线,17 日官宣(WAIC 2026 前夕)
模型定位旗舰模型,面向长程编程、知识工作、推理三类前沿场景
参数规模2.8 万亿总参数,MoE 架构,896 个专家、每 token 激活 16 个
上下文长度100 万 token,最高输出 1048576 token
模态原生多模态输入(图/视频/文本),输出为文本
开源承诺完整权重 2026 年 7 月 27 日前发布,技术报告随权重一同公布
API 价格缓存命中输入 $0.30 / 未命中 $3.00 / 输出 $15.00(每百万 token)

技术方面

完整的技术报告要后续随权重一起发,目前能看的只有官方技术博客。

  • KDA 混合线性注意力:传统注意力生成每个字,都要回头"看"一遍前面所有的内容——前面有 100 个字看 100 个,有 100 万个字看 100 万个。所以很多模型的"百万上下文"是塞得下、用不起。KDA 这套 Kimi 自研的新机制,让"回头看"的成本不再随长度膨胀,不管前面是 1 千字还是 100 万字,生成下一个字的成本基本恒定。第三方实测百万 token 下,生成速度最高快 6.3 倍(具体怎么测的,要等 7 月 27 日技术报告确认)。

  • 极致稀疏 MoE:共 896 个专家,但每次 token 只激活 16 个,极致的稀疏比例。官方称扩展效率比 K2 提升约 2.5 倍,相当于同样的算力,K3 能"学"到 K2 两倍半的东西。

  • 长程 Agentic Coding:官方给了三个案例——从零写出 MiniTriton 编译器、单次自主运行 48 小时设计一颗芯片、官方宣传片自己剪。共同点就一个:任务链条长到人都会累,它几十小时连续决策不跑偏。

  • 官方自曝三大局限:这一点,Kimi做的还是挺坦诚的。①对思考历史敏感(一个任务中最好不要切换模型)、②"过度主动"(遇到模糊意图会替你做没让它做的决定)、③体验与 Fable 5 / GPT 5.6 Sol 仍有差距。

性能跑分

接下来看看官方发布的基准对比表,K3 和 Claude Fable 5、GPT 5.6 Sol、Opus 4.8 这些第一梯队模型正面刚。

Coding 编程

六个编程基准,K3 拿下两个第一,Program Bench(77.8)和 SWE Marathon(42.0)。输掉的几项里,其实落后的差距也并不大。Terminal Bench 2.1(终端命令行操作)只差 0.5 分。真正差距明显的是 DeepSWE 和 FrontierSWE(都是高难度软件工程任务),榜首还是 GPT-5.6 Sol 和 Fable 5。

General Agents 通用智能体

BrowseComp 深度搜索 91.2 第一、Automation Bench 自动化办公 30.8 第一、SpreadsheetBench 表格处理 34.8 险胜拿下第一。输的主要是两个综合 Elo 评分(GDPval-AA 和 AA-Briefcase),考的是模拟真实岗位的白领知识工作(写报告、做分析、处理文档这类)。

Visual Agents 视觉智能体

两个带工具的视觉推理基准,K3 都是第二:CharXiv 91.3、Zerobench 41.0,榜首都是 Fable 5。但是也算稳稳站在第一梯队。

二、实测:图形、网页、PPT、3D 游戏

先交代测试思路。K3 本身只能输出文本(输入支持图像、视频、文本),但在线使用时我发现K3有图片生成工具,所以我先测了两个图片案例热身;再把精力放在 K3 最被看好的代码和生成能力上——网页、PPT、3D 游戏各两个案例。prompt 全部原文照录,大家可以直观体会一下。

2.1 图形测试

案例 1: 生成美女直播卖农具的图片。卖的是金锄头,标价388。

直播元素全齐了,左上角"直播"标 + 5.8 万观看、环形补光灯、手机支架、背景"助农惠农 乡村振兴"横幅、左下角弹幕滚动,右下角红色价格牌"金锄头 ¥388"。

案例 2:生成一张试卷,有题目,有解答,有老师的判分。满分100,得分98 因为有错误。保证题目和做对的题都是真实正确的。

填空、判断全部正确。最后一道应用题,计算正确但漏写单位"厘米",老师扣 2 分,98 分的构成完全合理。美中不足是应该是手写部分的字体看着像打印的,太工整了。

2.2 网页测试

前端代码是 K3 第三方盲投登顶的领域,两个案例验证含金量。

案例 1: 生成一个"黑客帝国"风格的数字雨动画:黑色背景上,绿色字符(日文片假名+数字+字母)从顶部随机位置下落。在这个上面再加一些正常网页有的内容,比如把这个网页改造成一个博客。

结果很不错,数字雨实时渲染,画面流畅不卡顿。内容也是有鼻子有眼,比较充实。

案例 2:生成一个销售数据仪表盘页面,包含:折线图展示近12个月销售额趋势、饼图展示产品类别占比、柱状图对比各区域业绩。使用 ECharts 或 Chart.js 库,数据用模拟数据,支持图表联动(点击饼图区域,折线图只显示该区域趋势)

KPI 卡片、折线图、饼图、柱状图,要素齐全。要说不足的话,就是这个页面还是太简单了,够用,但是没有让我感受到惊艳的感觉,当然这个也怪prompt太简单了。

2.3 PPT 测试

PPT 最能暴露"内容策划"底细——代码可以搜、版式可以套,"这几页讲什么"全靠模型自己组织。

案例 1: 生成一个PPT,讲讲最近特别火的幻兽啪鲁这个游戏,大概5页就好。哈哈哈,请原谅我最近玩帕鲁有点上头

像素可爱风,PPT结构也很清楚:封面(“4000 万玩家上头”)→ 有多火(四张数据卡)→ 玩法(宝可梦×方舟×打工人模拟器)→ 1.0 正式版时间轴 → 后续(任天堂官司和玩梗)。

案例 2:帮我做一个专业的,有深度的,商务场景用的,AI讲解PPT,10页

这个效果,完全可以到直接使用的程度,我初步看了下,格式几乎不用改。下次在讲课,就直接用K3生成了。

2.4 3D 游戏测试

最后的重头戏。官方叙事里有"一句话生成可玩 Minecraft 克隆"——这话听得我心痒,我用两个案例来测测它的效果。

案例 1:帮我用html 生成一个太阳系模型,3D的,要求可以放大缩小,选中对应的星体,还可以仔细查看,包括旋转,放大什么的

这个太赞了,效果很好,包括各个星球的样式也很完美。地球我认真看了,很真实、没毛病,其他的星球没仔细比对,但应该也不差。

案例 2:做一个H5的,我的世界,游戏内容主要是向上攀登。主角有发射蜘蛛丝的能力,可以荡蜘蛛丝,可以顺着蜘蛛丝拉过去,比如一些比较高的地方,可以利用蜘蛛丝攀登,左键发射,右键拉扯。要求场景优美。

MC 风浮空岛场景,草地方块、树叶、水池、像素云和太阳、一应俱全。机制上也确实实现了使用蜘蛛丝的功能。美中不足是有一些地方设计的不合理,并不是每一个平台都能跳上去,有一些地方必须使用蛛丝。(我认真通关了,还挺好玩的)

http://www.jsqmd.com/news/1250558/

相关文章:

  • 阿里云服务器配置 LLM 推理服务教程
  • 具身智能重构高墙透明治理:视频孪生+无感空间感知,打造司法监所全域穿透防线
  • 汽车四轮称重系统十大品牌前十榜单揭晓,浙江润鑫质量稳定品质靠谱厂家值得信赖 - 品牌速递
  • 2026防腐压力传感器前十榜单公示,广东犸力登上权威行业排行榜 - 品牌速递
  • Node.js三方库鸿蒙 PC 移植:鸿蒙PC开发者面对面 · 线下课件PPT分享
  • OpenHarmony 小鸿 AI 开发实战 02:从板级源码读懂 WS63、CI1302、ST7789 与外部 Flash
  • HarmonyOS7 嵌套滚动:Scroll + List 嵌套滚动的正确姿势
  • 因算力紧缺,月之暗面Kimi宣布暂停C端新用户订阅;ASML回应向全球员工发2万欧元股权激励;Qwen3.8-Max预览版上线 | 极客头条
  • 2026深圳盐田搬家公司深度测评全攻略|资质合规口碑靠谱+街坊实测口碑过硬+避坑指南 - 厚道搬家
  • 边贸黄金“避坑战”实勘:2026凭祥正规回收老牌三强全维度深度拆解 - 华金汇黄金回收
  • Unlayer:可嵌入产品的内容创作平台,数天上线赋能多场景创作!
  • 七大算法完整总结:冒泡 / 插入 / 选择 / 快排 / 归并 / 堆排 + 二分查找
  • 2026年北京周边宠物训练学校权威排行揭晓
  • 豆包视频去水印方法怎么用?2026个人收藏向实用教程 - 免费软件工具方法教程
  • 【关注可白嫖源码】--课程设计--毕业设计--springboot体育馆运营管理平台[编号:project75681](案件分析)
  • LaCo: Large Language Model Pruning via Layer Collapse 解读
  • Kimi K3横空出世!中国AI模型仅用几周便反超美国,市场震动,闭源模型岌岌可危!
  • 2026图片去水印用什么工具?手机与电脑免费去水印方法合集 - 免费软件工具方法教程
  • 不要像写Java一样写Go
  • 谁还在硬啃组态屏?我直接喂饭
  • 合肥专业的餐饮点餐小程序技术强的是哪家?
  • 海康摄像头RTSP转换前端浏览器实时播放
  • AI 分析 JVM JIT
  • 什么是渐进增强和优雅降级?
  • PCB绘制两层板升级到四层板
  • 合上技术文章后,你的脑子里还剩下什么?
  • AI辅助数学建模全流程实战:从读题到代码生成
  • 大模型如何重构呼叫中心架构:神鹤双擎+暴风引擎解析
  • 从自动驾驶到具身智能:车企如何用“造车”逻辑降维打击机器人圈?
  • 深入浅出图片压缩技术:从底层原理到现代 Web 最佳实践