当前位置: 首页 > news >正文

K3 vs Qwen3.8

截至2026年7月21日,月之暗面(Moonshot AI)与阿里通义千问相继发布了各自的万亿级MoE(混合专家)旗舰模型Kimi K3(2.8T)与Qwen3.8(2.4T)。这两款模型标志着国产开源/开放权重大模型正式迈入“3T级”规模竞争时代,且在架构创新与落地场景上呈现出不同的技术侧重。

以下是关于两者的最新进展与深度技术分析:

一、 核心规格与进展概览

维度

Kimi K3​ (Moonshot AI)

Qwen3.8​ (Alibaba)

发布时间

2026年7月16日

2026年7月19日(Preview)

总参数量

2.8 万亿​ (2.8T)

2.4 万亿​ (2.4T)

架构类型

Stable LatentMoE + KDA

动态稀疏自适应门控 MoE

上下文窗口

1 Million Tokens

256K~1M Tokens(兼容双模式)

多模态能力

原生视觉(图文、截图理解)

原生统一多模态(文/图/视频/文档)

开源/开放状态

计划于7月27日开源权重

预览版已上线,承诺近期开放权重

核心定位

长程推理、前端开发、Agentic工作流

政企办公、全栈工程、多Agent协作


二、 Kimi K3 技术深度解析(侧重架构效率与长上下文)

Kimi K3 是目前全球公开的最大规模开源模型(2.8T),其核心突破在于解决了超大规模MoE模型在训练稳定性与长上下文推理成本上的痛点。

1. 架构创新:Kimi Delta Attention (KDA) & Attention Residuals

  • KDA (Kimi Delta Attention):一种混合线性注意力机制,旨在优化信息在超长序列(100万token)中的流动效率,官方称其解码速度较传统Full Attention有显著提升(约6.3倍加速潜力),并降低了对KV Cache的依赖。

  • Attention Residuals (AttnRes):在深度维度上引入残差连接的选择性检索,缓解深层网络中的信息稀释问题,使模型在极深网络中仍能保持梯度稳定与表征复用。

  • Stable LatentMoE:总参数量2.8T,包含896个专家,但每次仅激活16个(稀疏度约98.3%)。引入了Quantile Balancing(分位数均衡)替代传统辅助损失,消除了对敏感超参数的依赖,解决了大规模专家并行的负载不均问题。

2. 训练与推理优化

  • 量化感知训练:从SFT阶段引入MXFP4权重 + MXFP8激活,兼顾低精度硬件兼容性与大模型表达能力。

  • Per-Head Muon优化器:对注意力头进行独立优化,适应超大规模参数下的异质学习动态。

  • 部署建议:官方推荐在64张以上加速卡的超节点(Supernode)部署,以利用高带宽域(HBD)掩盖专家并行的通信开销。

3. 性能表现

  • Frontend Code Arena​ 得分约1679,登顶全球第一,超越Claude Fable 5;BrowseComp达91.2%。

  • Artificial Analysis Intelligence Index 得分57,接近Claude Opus 4.8(56)。


三、 Qwen3.8 技术深度解析(侧重多模态融合与工程落地)

Qwen3.8 是通义千问系列首款突破万亿参数的原生多模态模型,强调在企业级复杂场景中的实用性与多模态统一处理。

1. MoE 路由与稀疏优化

  • 动态稀疏自适应门控:优化了专家路由分配逻辑,针对代码、多模态、长文档三类重度任务自动分配专属专家模块,降低普通文本推理的算力空耗。

  • 激活参数:公开资料显示激活参数约为288B,在总参数2.4T下保持了较高的激活比例以换取多任务泛化能力,与Kimi的极高稀疏度形成对比。

2. 多模态与长上下文

  • 原生统一多模态:区别于传统的文本基座外接视觉模块,Qwen3.8 在预训练阶段即融合文本、图像、视频、工程图纸,支持混合输入输出与图文逻辑联合推导。

  • 上下文扩展:延续并升级至256K标准/1M极限上下文,配合优化的KV缓存压缩技术,解决百万字级文档处理的遗忘与逻辑断裂问题。

3. 内置校验与 Agent 能力

  • 实时事实校验子模块:生成过程中自动对照知识库校验,针对性削减金融、法律等严谨场景的幻觉。

  • 长程多Agent稳定性:优化了数十轮连续工具调用与跨小时自主执行能力,适配Office自动化、报表生成等流水线任务。


四、 关键技术路线对比与分析

  • 稀疏度博弈:Kimi K3 追求极致稀疏(896选16),通过架构革新(KDA)弥补稀疏带来的信息损失,目标是降低单任务推理成本;Qwen3.8 相对稠密激活(~288B活跃参数),牺牲部分推理效率换取多模态与复杂逻辑的鲁棒性。

  • 长上下文解法:Kimi 依靠KDA+AttnRes​ 从注意力机制底层重构长序列依赖;Qwen 依靠原生多模态融合+缓存压缩​ 在工程层面优化吞吐与留存。

  • 开源策略:Kimi K3 明确了7月27日开源权重的时间表,冲击全球开源社区生态;Qwen3.8 采取“预览先行+近期开源”的两阶段策略,优先通过阿里云生态(Token Plan、Qoder)回收企业反馈。


五、 总结与展望

  • Kimi K3​ 代表了底层架构驱动的Scaling Law探索,通过Delta Attention与超高稀疏MoE证明了开源模型在3T规模仍可高效训练与推理,其在代码与纯文本推理上已逼近顶级闭源模型。

  • Qwen3.8​ 代表了应用与生态驱动的规模化升级,强化了多模态原生能力与Agent工作流,更适合作为企业级生产力底座。

两者在2026年7月的密集发布,显示出国产大模型在万亿参数赛道已从单纯的“参数堆叠”转向“架构效率+场景深度”的双重竞争。需注意:Qwen3.8 的完整基准测试多由官方提供,独立第三方验证尚在进行中;Kimi K3 的开源权重实际表现也需待7月27日社区部署后进一步观察。

http://www.jsqmd.com/news/1243432/

相关文章:

  • 2026在线去水印教程:图片视频免费去水印工具实测与避坑指南 - 办公小帮手
  • 佛山禅城区怎么挑选本地靠谱除甲醛公司?实地调研多家,优选高口碑正规直营门店 - 专注室内空气检测治理
  • 免费去水印小程序怎么找?2026 还在用的方法 - AI测评专家
  • 多成分肌醇营养补充趋势:五款粉剂产品科普横评
  • 2026 年现阶段安徽正规的哪里有上门回收冷库的生产厂家推荐,揭秘:冷库变现的秘密渠道曝光! - 企业信息推荐【官方】
  • AgentSociety 2核心功能解析:从智能体行为到实验设计的完整工作流
  • 2026年微信小程序去水印免费软件哪个好用 一个实测靠谱不踩坑的实用教程 - AI测评专家
  • 佳能TS6120TS6180TS9180G1810G2810TS8080打印机清零软件,服务请求废墨收集器已满解决方法。支持代码5B00,5B02,5B04,1700,1702,P07,E08,亲测。
  • 2026 年至今,麦盖提优秀的日立中央空调安装公司全面解析与选购指南,别再踩坑!日立中央空调安装避坑全攻略-博力久能暖通 - 鉴选官
  • 装机首超火电,光伏却血亏千亿:谁能熬到 2027?
  • 2026视频去水印在线免费工具有哪些?优缺点与侵权风险提醒 - 软件小管家
  • 企业AAA信用等级认证是什么?线上办理流程指引,2026年 - 跑政通
  • 深度解析ROME原理:如何在GPT中找到并修改事实关联的核心算法
  • PS左边的工具栏没了怎么弄出来?4 种方法快速恢复侧边工具栏
  • 大厂面试要求做现场系统架构设计?留学生用自顶向下拆解法稳住节奏「蒸汽求职分享」
  • 豆包去水印方法2026实测:怎么去水印?AI视频水印消除指南 - 软件小管家
  • libvim:探索Vim核心编辑引擎的极简C库,开启高效文本处理新纪元
  • 2026年B端企业精准获客系统推荐:德益云AI大数据获客系统 - 德益云企业服务
  • 如何查看每个IP的带宽使用情况?NetFlow 技术实战指南
  • 2026即梦去水印小程序怎么样?视频无水印方法分享 - 免费软件工具方法教程
  • 手机上免费一键去水印的方法 2026 实测教程 - 免费软件工具方法教程
  • 2026具身智能三条路线:智元拼模型 宇树做量产 越疆通用平台长期优解?
  • 如何用Reqnroll实现高效行为驱动开发(BDD):从入门到精通
  • 嘉兴秀洲区王店镇亨得利官方名表服务中心电话公示(2026年7月最新) - 亨得利官方
  • 动态规划从入门到精通:基于leetcode-js项目的完整指南
  • ISO9001认证全流程详解|从0到拿证避坑指南,企业必看
  • 【爱马仕】Hermes 整合包安装避坑指南,解决各类启动异常问题(含安装包)
  • 可持久化 DS 学习笔记
  • 别再被廉价剪辑工具坑了!选AI混剪一定要看这5点
  • 国际货代律师了解空运法规哪家专业 常见问题解答 - 全域品牌推荐