Qwen 3.7 Max、Kimi K3、DeepSeek V4 实测评估:34倍价差下的性能差异分析
三个中国旗舰家族,同一套评测,跑完它的花费相差 34 倍。 最强和最弱之间的能力差是 13 个 index 分。账单差是 $2,365。
能力最强:Kimi K3 (max),Artificial Analysis Intelligence Index v4.1 得 57 分
性价比断层第一:DeepSeek V4 Flash 0731,50 分,跑完 index 只花 $72.02
最快:Qwen 3.7 Max,206.4 输出 token/秒
意外之处:这一组里最便宜的模型,分数压过了它所低于的两个旗舰
四个模型今天都在 ofox 上,所以切换只是改一个 model ID
摘要:你该选哪个?
| 你的处境 | 选 | 理由 |
|---|---|---|
| 最难的推理,预算不是约束 | Kimi K3 | 四个里分数最高,57 分 |
| 高频 agent 循环,成本主导 | DeepSeek V4 Flash 0731 | 50 分,同一套评测的花费比 K3 低 34 倍 |
| 延迟比最后几分更要紧 | Qwen 3.7 Max | 206.4 tok/s 对 K3 的 35 |
| 需要图片输入 | Kimi K3或Qwen 3.8 Max | 另外三个在目录里是纯文本 |
| 今天还在用 DeepSeek V4 Pro | 重新评估 | Flash 0731 高 6 分,花费低 2.4 倍 |
| 给混合负载挑一个默认模型 | DeepSeek V4 Flash 0731 | 分数每美元领先一个数量级,且 1M 上下文 |
| 想用最新的 Qwen | Qwen 3.8 Max | 比 3.7 Max 便宜,但还没有第三方分数 |
两种可以就此打住的情况。月 token 支出低于约 $200,直接选 DeepSeek V4 Flash 就走,下面所有优化都不值你花一个下午。生产环境的 agent 循环月支出超过 $2,000,直接跳到评测花费那一节,34 倍就在那里。
规格快速对照
下表数据全部来自 ofox 模型目录,2026-08-03 实时拉取。
| Kimi K3 | DeepSeek V4 Flash | DeepSeek V4 Pro | Qwen 3.7 Max | |
|---|---|---|---|---|
| 模型 ID | moonshotai/kimi-k3 | deepseek/deepseek-v4-flash | deepseek/deepseek-v4-pro | bailian/qwen3.7-max |
| 输入 / 每百万 | $3.00 | $0.14 | $0.45 | $2.50 |
| 输出 / 每百万 | $15.00 | $0.28 | $0.88 | $7.50 |
| 缓存读 / 每百万 | $0.30 | $0.0028 | $0.0037 | $0.50 |
| 上下文窗口 | 1,048,576 | 1,000,000 | 1,000,000 | 1,064,000 |
| 最大输出 | 1,048,576 | 384,000 | 384,000 | 64,000 |
| 输入模态 | 文本、图片 | 文本 | 文本 | 文本 |
| 开源权重 | 有 | 有(MIT) | 有 | 无 |
这张表里有三处值得停下来看。
缓存读那一列不是四舍五入的差别。DeepSeek 的缓存输入是 $0.0028 每百万。Qwen 3.7 Max 同样一件事收 $0.50,是179 倍;K3 收 $0.30,是107 倍。如果你的负载有一份大的、被反复读取的系统提示词,决定账单的是缓存读单价,不是那个显眼的输入单价。
Qwen 3.7 Max 的 64K 输出上限是四个里最紧的,比 DeepSeek 紧六倍,比 K3 紧十六倍。如果你的任务是「读一个大仓库,产出一个大文件」,最先卡住你的是这个上限而不是别的。Qwen 3.8 Max 把它提到了 131K,细节见 Qwen 3.8 Max 发布拆解。
只有 K3 同时具备开源权重和第一梯队分数。DeepSeek 的权重是 MIT 且可下载,但它在这里的最高分来自便宜的那个模型而不是旗舰。Qwen 3.7 Max 完全没有开源权重,不过阿里已宣布 Max 级别的开源权重发布定在 2026-08-10 那一周。
同一把尺子量出来是什么结果?
Artificial Analysis Intelligence Index v4.1,快照 2026-08-03。这是本文唯一一个用同样方法测过全部四个模型的来源,整篇对比都锚在它上面。
| 模型 | Index 分数 | 本组排名 |
|---|---|---|
| Kimi K3 (max) | 57 | 1 |
| DeepSeek V4 Flash 0731 | 50 | 2 |
| Qwen 3.7 Max | 46 | 3 |
| DeepSeek V4 Pro(Reasoning, Max Effort) | 44 | 4 |
这个 index 是九项评测的合成:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。
看排序,别抠绝对分。这是一个滚动榜,index 版本和模型构建变了就会重新打分,所以「K3 第一、Flash 第二」比「57 和 50」更经得起时间。Flash 与 Qwen 3.7 Max 之间那 4 分的差距,在一次重跑就可能翻转的范围内。
不会变的是这个意外的方向:这一组里最便宜的模型压在两个旗舰之上,其中一个还是同一家厂商的。
有三件事会改变这个排名,而且三件在一个季度内都可能发生:
Qwen 3.8 Max 被收录。它比 3.7 Max 便宜,阿里自己的表也把它放在明显领先上一代的位置。如果它以 $2.00/$6.00 的价格落在 K3 附近,性价比这一列就要重排。
DeepSeek 再出一个构建。0731 那次重训在架构不变的情况下把 Flash 拉高了 10 分,没有理由认为那是最后一次。
Index 版本变化。v4.1 增加并重新加权了评测项;一个 v4.2 完全可能在没有任何模型改变的情况下,把只差 4 分的两个模型换位。
所以更该做的是每季度重跑自己的评测,而不是从任何一篇文章(包括这篇)继承一份排名。
各家厂商也都发自己的表,而那些表互相之间不可比。Qwen 给 3.8 Max 发的表对标的是 Claude 和 GPT,评测框架是 Qwen 自己选的。Moonshot 的 K3 发布表里 Terminal-Bench 2.1 是 88.3,而榜首是 88.8,那是第二不是第一。DeepSeek 自己报的 V4 Flash 的 Terminal-Bench 分数高于 Artificial Analysis 对同一模型测出的值。这是三套不同的测量设置,把它们混进一张表,就是一篇对比变得毫无意义的方式。
跑完同一套评测到底要花多少钱?
这个数字重新定义了整场对比。Artificial Analysis 会公布自己在每个模型上跑完 index 的总花费,所以这是同一份工作量的真账单,而不是拿单价乘出来的估算。
| 模型 | Index 分数 | 产生的输出 token | 跑完 index 的花费 |
|---|---|---|---|
| Kimi K3 (max) | 57 | 130M | $2,437.41 |
| Qwen 3.7 Max | 46 | 100M | $1,604.13 |
| DeepSeek V4 Pro | 44 | 180M | $176.34 |
| DeepSeek V4 Flash 0731 | 50 | 210M | $72.02 |
从这四行推算出来(derived):
K3 的花费是 V4 Flash 的33.8 倍,换来+7分。
Qwen 3.7 Max 的花费是 V4 Flash 的22.3 倍,而且低 4 分。
V4 Pro 的花费是 V4 Flash 的2.4 倍,而且低 6 分。
K3 的花费是 Qwen 3.7 Max 的1.5 倍,换来+11分。
关于价格列的一点说明:Artificial Analysis 把 DeepSeek V4 Pro 标为 $0.435 / $0.87,而 ofox 目录四舍五入成 $0.45 / $0.88。评测花费那几个数字来自 Artificial Analysis,用的是它自己的单价;上面的规格表用的是目录的。
这四组对比里只有一组算是一笔交易,另外三组描述的是「又贵又差」。
K3 的溢价至少说得通:你比 Qwen 3.7 Max 多付 1.5 倍,换到实打实的 11 分,如果你的工作卡在最难的推理上,这是一次理性采购。而比 V4 Flash 多付 22 倍、分数还低 4 分,这不是交易,这是 2026-07-31 之后没人重跑过数字留下的惯性。
为什么最便宜的模型能压过两个旗舰?
因为 0731 是重训而不是新模型,而它把分数抬了 10 分。DeepSeek V4 Flash 0731 保持了同样的 284B 总参、13B 激活的 MoE 架构,回来时从上一版的 40 分变成了 50 分。
答案的另一半是啰嗦,而这一半对 DeepSeek 不利。
V4 Flash 在这套 index 上产生了210M 输出 token,四个里最多。
Qwen 3.7 Max 产生了100M,最少。
也就是说同样的活,Flash 吐出的 token 是 Qwen 的2.1 倍。
这就是实际差距小于单价差距的原因。Qwen 3.7 Max 的输出单价是 Flash 的 26.8 倍($7.50 对 $0.28),但真实账单只差 22.3 倍。Flash 靠多说话把大约五分之一的价格优势还了回去,然后还是赢了一大截。
DeepSeek 默认开启思考,而推理 token 按输出计费,啰嗦就是从这里来的。它可以关掉。但关掉的同时,你也放弃了一部分把 Flash 顶到两个旗舰之上的那个分数,所以决定之前先用自己的 prompt 两种模式各测一遍。
这一节的实用版本:按 token 的标价是一个很差的成本代理指标。单价差 27 倍的两个模型,干完同样的活只差 22 倍;单价差 1.5 倍的两个模型,干完同样的活差了 2.4 倍。模型之间的 token 用量差异,比价格差异更大。
换成你的月账是多少?
一套 benchmark 不是你的工作负载。下面把同一场对比放到一个具体团队上,单价用规格表里 ofox 目录的值。
场景:5 个开发者跑编码 agent。
每人每天 40 个任务,每月 21 个工作日
中位任务:12,000 输入 token 的仓库上下文,3,000 输出 token
40% 的输入命中提示词缓存
每人每月的量:1,008 万输入 token(403 万命中缓存,605 万未命中)和 252 万输出 token。
| 缓存输入 | 未缓存输入 | 输出 | 每人 | 5 人团队 | |
|---|---|---|---|---|---|
| Kimi K3 | $1.21 | $18.14 | $37.80 | $57.15 | $285.77 |
| Qwen 3.7 Max | $2.02 | $15.12 | $18.90 | $36.04 | $180.18 |
| DeepSeek V4 Pro | $0.01 | $2.72 | $2.22 | $4.95 | $24.77 |
| DeepSeek V4 Flash | $0.01 | $0.85 | $0.71 | $1.56 | $7.82 |
K3 与 Flash 之间落在 36.5 倍,与 index 那次跑出来的 33.8 倍很接近。两份完全不同的工作负载给出同一个量级的比值,是这个比值站得住的一个合理信号。
对这张表要做一处修正,而且对 Flash 不利。它假设每个模型每个任务都吐 3,000 个输出 token,而 index 那次的数据说这是错的:同样的活 Flash 吐的 token 是 Qwen 的 2.1 倍。把 Flash 的输出那一行乘 2.1,团队月成本从 $7.82 变成约 $11.70,与 K3 的差距从 36.5 倍降到大约 24 倍。
仍然是 24 倍。啰嗦税是真的,但它远远填不平这条沟。
这个场景会在哪里误导你:
缓存命中率在这里承担了很多。40% 命中的情况下,DeepSeek 近乎免费的缓存读几乎看不出来,因为绝对值太小。换成一份 20 万 token 的系统提示词、每天被读几百次的负载,那一列会变成账单的全部,差距只会更大。
它给 token 定价,不给结果定价。如果 K3 一次做完的事 Flash 要重试三次,重试成本和工程师时间会把上面所有数字淹没。
单价会动。DeepSeek 这两个构建在过去一个季度里价格和分数都变过。承诺之前先拉当前值。
它们各自有多快?
Qwen 3.7 Max 的输出吞吐是 Kimi K3 的 5.9 倍。
| 模型 | 输出 token/秒 |
|---|---|
| Qwen 3.7 Max | 206.4 |
| DeepSeek V4 Pro | 55.0 |
| Kimi K3 (max) | 35 |
| DeepSeek V4 Flash 0731 | 未公布 |
Artificial Analysis 把 K3 标为明显偏慢、V4 Pro 标为低于平均,而 Qwen 3.7 Max 在其价格档里明显高于平均。写作时 0731 这一版 Flash 还没有公布速度测量,所以那一格留空,不拿上一版的数字去填。
速度改变的东西和分数不一样。12 分的 index 差距体现为模型能不能完成某类任务。5.9 倍的吞吐差距体现为一次 40 分钟的 agent 运行会不会变成四小时。对交互式工具和长自治循环来说,后者往往才是人真正感觉到的约束。
什么时候该选 Kimi K3?
当任务在另外三个上失败,而失败的代价高于 token 的时候。
具体信号:
你的评测显示其他模型是在某一类任务上失败,而不只是做得差一点。
你需要图片输入配上第一梯队推理。这一条我们在 2026-08-03 通过网关实测过:发一张图让 prompt token 从 97 涨到 189,并返回了准确描述,所以视觉是真通而不只是列在字段里。
你需要一次性产出非常长的回复。K3 的 1,048,576 最大输出是 Qwen 3.7 Max 上限的 16 倍。
你希望分数最高的那个同时是开源权重,K3 是,Qwen 3.7 Max 不是。
不该选它的信号:高请求量、对延迟敏感的交互,或者任何你还没真正量出质量差异的负载。35 token/秒加 $15 每百万输出,K3 对「量大」和「性急」两件事都会惩罚。它在中国模型之外的位置见 Kimi K3 对比 GPT-5.5 与 Opus 4.8,接入方式见 Kimi K3 使用指南。
什么时候该选 DeepSeek V4 Flash?
当作默认,直到有什么东西让它失败为止。
它在四个里排第二,成本低一个数量级,有 1M 上下文窗口和 384K 输出上限,还带 MIT 开源权重。反对它的理由很窄:
纯文本。没有图片输入,任何碰截图或图片型文档的管线都用不了。
啰嗦。这套 index 上 210M 输出 token,四个里最多。要为推理 token 留预算,长循环上给
max_tokens设上限。比 K3 低 7 分。这是真的,在你最难的那一小块工作上会显出来。
如果你现在用的是DeepSeek V4 Pro,这一节是最该动手的。Flash 0731 高 6 分,跑同一套评测的花费低 2.4 倍。任何「难的给 Pro、简单的给 Flash」的路由规则,都是对着一个已经不存在的构建写的。跨厂商的预算档对比见 V4 Flash 对比 Gemini 3.6 Flash,V4 系列的整体情况见 DeepSeek V4 发布指南。
什么时候该选 Qwen?
当吞吐是约束的时候,或者你本来就在阿里的生态里。
Qwen 3.7 Max 在这一组里的论据是速度:206.4 输出 token/秒,接近 V4 Pro 的 4 倍、K3 的 6 倍。对一个用户盯着 token 一个个冒出来的对话产品,或者一个按墙钟而不是按美元衡量的 agent 循环,这是任何 index 分数都捕捉不到的真实产品差异。
反对它的论据是,在这组数字上它能力居中、成本靠上,这个位置很尴尬。它比一个跑同样评测便宜 22 倍的模型还低 4 分。
而且它已经不是阿里最新的了。Qwen 3.8 Max 在 2026-08-03 上线,$2.00/$6.00,两边都比 3.7 Max 便宜,输出上限 131K,还带图片输入。它没有进这场对比,是因为写作时 Artificial Analysis 还没有它的页面,没有可以并列的同法分数。如果你今天是在挑一个 Qwen 而不是在比公开数字,起点应该是 3.8 Max。更便宜的同系列见 3.7 Plus 与 3.7 Max 实测对比。
什么时候一个都别选?
三种情况下,这整个货架都是错的:
你需要视频输入。四个模型通过网关都不接受。Qwen 3.8 Max 的目录条目只列了文本和图片,尽管 QwenCloud 自己的页面列了视频。
你需要它们没有的某个特定前沿能力。如果你的评测是按 Claude 或 GPT 的行为校准的,7 分的 index 差距不会告诉你这次替换安不安全。跑你自己的评测集。
你的瓶颈不在模型上。如果一个检索 bug 或一个糟糕的提示词比 token 账单更贵,本文所有数字都帮不上忙。
通过 ofox 一次跑通三家:10 行做 A/B
四个模型在同一个目录里,所以这场对比是一个遍历 model ID 的循环,不是四次接入。
Python:同一个 prompt 跑遍四个模型
import os from openai import OpenAI client = OpenAI( api_key=os.getenv("OFOX_API_KEY"), base_url="https://api.ofox.io/v1", ) MODELS = [ "moonshotai/kimi-k3", "deepseek/deepseek-v4-flash", "deepseek/deepseek-v4-pro", "bailian/qwen3.7-max", ] prompt = "重构这个模块,并说明迁移过程中的风险。" for model in MODELS: r = client.chat.completions.create( model=model, messages=[{"role": "user", "content": prompt}], max_tokens=2048, ) u = r.usage print(f"{model:<32} out={u.completion_tokens:<7} total={u.total_tokens}")Node:同样的形状
import OpenAI from "openai"; const client = new OpenAI({ apiKey: process.env.OFOX_API_KEY, baseURL: "https://api.ofox.io/v1", }); for (const model of ["moonshotai/kimi-k3", "deepseek/deepseek-v4-flash", "bailian/qwen3.7-max"]) { const r = await client.chat.completions.create({ model, messages: [{ role: "user", content: prompt }], max_tokens: 2048, }); console.log(model, r.usage.completion_tokens); }打印completion_tokens,不要只看延迟。上面那张评测花费表的全部意义就在于:这几个模型之间 token 用量的差异比价格差异更大,所以在你自己的 prompt 上得到的每模型输出 token 数,比任何公开榜单都值钱。
关于目录字段的一点提醒。K3 的条目只列了/v1/chat/completions,而 Qwen 和 DeepSeek 的条目还列了/v1/responses。这个字段在两个方向上都出错过,所以按你打算用的协议发一个真请求,别拿 metadata 做规划。各模型当前单价见 Kimi K3、DeepSeek V4 Flash 和 Qwen 3.7 Max 的模型页。
常见问题
2026 年最好的中国模型是哪个?
按 Artificial Analysis Intelligence Index v4.1 在 2026-08-03 的快照,Kimi K3 (max) 的 57 分是这一组里最高的。按每美元得分算,DeepSeek V4 Flash 0731 领先大约一个数量级。
Kimi K3 比 DeepSeek V4 Flash 贵这么多值吗?
它用同一套评测 33.8 倍的花费买到 7 个 index 分。只有当某一类任务在 Flash 上失败而在 K3 上成功时才值,而这件事你必须用自己的 prompt 量出来。
DeepSeek V4 Flash 有开源权重吗?
有。0731 这一版在 Hugging Face 上是deepseek-ai/DeepSeek-V4-Flash-0731,MIT 许可,fp8,非 gated。
为什么这篇比的是 Qwen 3.7 Max 而不是 3.8 Max?
因为写作时 Artificial Analysis 还没有 3.8 Max 的页面,没有和另外三个用同一套方法测出的分数。Qwen 3.7 Max 是有可比第三方数字的最新 Qwen。
哪个模型的输出上限最大?
Kimi K3,1,048,576 token。DeepSeek 那两个是 384,000,Qwen 3.7 Max 是 64,000。
这几个里有支持视觉的吗?
Kimi K3 支持,2026-08-03 通过网关实测过。Qwen 3.8 Max 支持。Qwen 3.7 Max 和两个 DeepSeek V4 在目录里都是纯文本。
Artificial Analysis 那个花费就是我的账单吗?
不是。那是一套特定的 9 项评测,它告诉你的是模型之间在固定工作量上的比值,不是你的绝对支出。用它排序,然后用自己的 prompt 去测。
本次核实的来源
Kimi K3 (max) - Intelligence, Performance & Price Analysis
DeepSeek V4 Flash 0731 (max) - Intelligence, Performance & Price Analysis
DeepSeek V4 Pro (max) - Intelligence, Performance & Price Analysis
Qwen3.7 Max - Intelligence, Performance & Price Analysis
Kimi K3 API - 价格、上下文与接入 | OfoxAI
DeepSeek V4 Flash API - 价格、上下文与接入 | OfoxAI
Qwen3.7 Max API - 价格、上下文与接入 | OfoxAI
GET https://api.ofox.io/v1/models(2026-08-03 实调,取 model ID、价格、上下文与模态字段)针对
moonshotai/kimi-k3的图片输入实测,2026-08-03:带图 prompt token 189,同一 prompt 不带图 97,描述准确
