当前位置: 首页 > news >正文

2.8 万亿参数 Kimi K3 技术报告:MoE 架构、KDA 注意力与百万 Token 上下文全解析

文章目录

    • 概述
    • 核心结果
      • 编码能力
      • 通用与视觉智能体
    • 1 引言
    • 2 模型架构
      • 2.1 混合注意力机制
        • 2.1.1 Kimi Delta注意力(KDA)
        • 2.1.2 门控MLA
      • 2.2 注意力残差(AttnRes)
      • 2.3 稳定潜空间混合专家(Stable LatentMoE)
        • 2.3.1 归一化潜空间MoE
        • 2.3.2 Sigmoid Tanh单元GLU(SiTU-GLU)
        • 2.3.3 分位数均衡(QB)
      • 2.4 原生视觉能力
      • 2.5 逐头Muon优化器
    • 3 预训练
      • 3.1 预训练数据
      • 3.2 缩放法则
      • 3.3 训练方案
      • 3.4 长上下文扩展
    • 4 训练后流程
      • 4.1 方法
        • 4.1.1 监督微调(SFT)
        • 4.1.2 强化学习
        • 4.1.3 多教师同策略蒸馏(MOPD)
        • 4.1.4 部署感知的训练后流程
      • 4.2 RL任务合成与智能体环境
        • 4.2.1 统一白盒RL环境
        • 4.2.2 知识图谱引导的任务合成
        • 4.2.3 智能体环境中的可验证问题
        • 4.2.4 内核优化任务
        • 4.2.5 个人助手任务
        • 4.2.6 自主执行任务
        • 4.2.7 网页开发任务
    • 5 基础设施
      • 5.1 KDA的算法-系统协同设计
        • 5.1.1 多场景KDA内核
        • 5.1.2 KDA上下文并行(KCP)
      • 5.2 3万亿级预训练基础设施
        • 5.2.1 完美均衡的专家并行MoE训练
        • 5.2.2 内存高效训练
        • 5.2.3 多模态编码器优化
      • 5.3 百万token智能体RL基础设施
        • 5.3.1 长上下文RL基础设施
        • 5.3.2 沙箱基础设施
      • 5.4 推理与在线服务
        • 5.4.1 KDA感知的前缀缓存管理
        • 5.4.2 高性能内核
        • 5.4.3 集群级调度
    • 6 评测
      • 6.1 核心结果
        • 6.1.1 基准测试集
        • 6.1.2 基线模型
        • 6.1.3 评测配置
        • 6.1.4 结果
      • 6.2 内部评测
        • 6.2.1 能力评测
        • 6.2.2 网络安全评测

概述

Kimi K3——一款总参数2.8万亿的混合专家(MoE)模型,单token激活参数为1040亿,具备原生视觉能力,支持100万token上下文窗口。Kimi K3 基于 Kimi Delta 注意力机制(KDA)[64]与注意力残差(AttnRes)[58]构建,优化了序列长度与模型深度维度的信息流动。结合稳定潜空间混合专家(Stable LatentMoE,每个token可从896个路由专家中有效激活16个),以及经过优化的训练与数据方案,这些技术进步让 Kimi K3 的整体缩放效率较 Kimi K2 [59]提升约2.5倍。

训练后阶段的亮点在于通用、智能体与编码三大领域的强化学习,以及多档位推理算力支持,实现了组合泛化能力与稳定长时序执行能力。在2.8万亿参数规模下,Kimi K3 依托多领域基础设施突破落地:KDA的算法-系统协同设计、实现完美负载均衡的专家并行训练与高效内存管理、支持持久化推演与沙箱状态的百万token智能体强化学习,以及多项部署侧创新。

全面评测显示,Kimi K3 在长时序编码、智能体、知识、推理与视觉任务上均达到前沿水平。尽管整体性能仍略逊于最强闭源模型 Claude Fable 5 与 GPT-5.6 Sol,但在kimi团队的评测体系中,Kimi K3 持续优于其他所有开源与闭源模型。kimi团队已开放 Kimi K3 的完整模型权重,以推动后续研究,加速前沿智能技术的更广泛部署与应用。

核心结果

所有结果均采用最高推理算力档位:max 或 xhigh

编码能力

http://www.jsqmd.com/news/1301441/

相关文章:

  • Obsidian插件汉化终极指南:3分钟让英文界面秒变中文
  • PowerToys中文版完全指南:免费解锁Windows效率神器的终极教程 [特殊字符]
  • 2026年中国优质半导体博览会推荐,兼顾商贸洽谈与技术展示 - 2027品牌AI展
  • 2026迅之洁健康养车|江南区无损拔胎技术口碑实测 - 百航
  • 安徽省文武学校综合实力参考及毕业生去向统计及收费标准详情参考 - 圣龙武术朱老师
  • HarmonyOS应用开发实战:猫猫大作战-Math.pow 与指数运算【apple_product_name】
  • 垂直AI Agent在高语境社交场景中的实践与优化
  • 2026年南京市栖霞区防水补漏选维小达|可不拆除补漏、室内防水、屋面防水、外墙防水、飘窗防水、地下室防水补漏、厨卫漏水一站式修缮服务 - 一点传媒
  • 诚信企业商户、诚信模范标兵代言人评选活动发起指南|2026免费投票制作平台功能实测 - 投票制作小程序
  • Adobe-GenP:3分钟快速解锁Adobe全系列软件的完整指南
  • 2026乌鲁木齐沙依巴克区管道疏通防坑指南 真实测评推荐 - 余生黄金回收
  • C++质数判断:从试除法到米勒-拉宾测试的算法优化与工程实践
  • 本地自然拼读供应商选择合规要点解读及高综合实力机构推荐 - 招财兔数字员工
  • 别乱花钱!郑州登报挂失哪个报社便宜?认准有效报刊不踩坑 - 慧办好
  • 2026年家电维修平台哪个最靠谱不坑?实测美团“安心修”服务全流程 - 资讯报道
  • 面试官问:“两句毫不相干的话,embedding 相似度是 0 吗?“
  • 大模型在认知边界问题中的表现与改进策略
  • 网络安全体系化学习:从基础理论到实战应用
  • Linux系统源码编译安装Python 3.10:从依赖解析到多版本管理实践
  • 【2026-07】收藏旧书收购靠谱商家选哪个?古代旧书收购、油画旧书收购优选——京翰斋 - 多才菠萝
  • 3大场景深度解析:BilibiliDown如何重塑你的B站内容工作流
  • 宁波市象山县宾馆哪家性价比高 象山爵溪永江宾馆 13586806105  59122218 - 米諾
  • 如何高效管理你的数字记忆:WeChatMsg微信聊天记录导出与数据分析终极指南
  • codeX 免费中转站 注册即送 每日签到 亲测可用
  • C++ vector::emplace() 详解:从原理到实战的性能优化指南
  • 大数据运营专业有前景吗?AIGC 全媒体大数据专业 - 湖北找学校
  • 计算机毕业设计之基于SpringBoot+Vue的计算机论坛
  • 哈尔滨道里瑟琳、圣罗兰、迪奥包包回收,多笔真实成交报价参考,拒绝虚高钓鱼价 - 逸程奢侈品回收中心
  • 聚焦国标合规与智能制样: 2026定质量缩分机优质生产企业测评 - 深度智识库
  • 自举电路原理与设计:从电容电荷泵到高端MOSFET驱动