DeepSeek-V4-Flash正式版来袭,真的掀桌了!完成一篇完整的学术文章只要……
一、近期国内模型井喷:新模型扎堆发布 🚀
最近半个月国内大模型圈炸了。Kimi K3、Qwen3.8-Max-Preview、DeepSeek-V4-Flash正式版接连上线。参数规模全面进入万亿时代,而且每一个都在自己的赛道上放了大招。更戏剧性的是,就在国产模型密集发布的同时,海外OpenAI的GPT-5.6-Luna突然官宣降价80%——一场关于"智价比"的中外对决,正式开场。
🔥 Kimi K3 ——开源最强模型
月之暗面在7月16日发布Kimi-K3,7月27日正式开源完整权重。这货的参数量直接拉到2.8万亿(MoE架构,激活1040亿),支持原生视觉理解和100万Token上下文窗口。
💡核心亮点:KDA混合线性注意力 + 注意力残差技术,把超长文本的计算量从平方级降到接近线性级。Frontend Code Arena以1679分登顶,超过Claude Fable 5和GPT-5.6 Sol——开源模型首次在该榜单超越所有闭源模型。
API定价:缓存命中¥2/MTok,输入¥20/MTok,输出¥100/MTok。Hugging Face上开源30分钟内点赞破4000,近3700名开发者蹲守下载。
⚡ Qwen3.8-Max-Preview —— "依然自称是除Fable 5外最强"
阿里通义千问在7月19日推出Qwen3.8-Max-Preview。2.4万亿参数,第三代MoE架构,原生多模态,百万Token上下文。官方自评很克制——中文稿加了"可能"二字,英文稿直接去掉了😂。预览阶段采用"天更迭代"模式,能力每天都在变。但最狠的是价格策略。。。Qoder免费用户会给300积分,这0.01x的倍率可以爽用!
▲ Qwen3.8-Max-Preview : 常规时段0.05x(1折) → 夜间22:00-08:00仅0.01x(0.2折)
⚠️划重点:常规时段1折,夜间0.2折!这意味着调用一个2.4万亿参数的旗舰模型,成本比很多"轻量模型"还低。代码能力较前代+22.8%,协同办公+44.4%。各平台模型倍率对比一览:
▲ Qoder平台模型倍率:Qwen3.8-Max-Preview仅0.01x(几乎免费),DeepSeek-V4-Flash 0.1x
💎 DeepSeek-V4-Flash正式版 —— 后训练的魔法
小蓝鲸在7月31日悄咪咪地上线了V4-Flash正式版API公测。总参数2840亿,激活仅130亿——但成绩单亮瞎眼:
基准测试 | 得分 |
|---|---|
Terminal Bench 2.1 | 82.7 |
Cybergym(网络安全攻防) | 76.7 |
DSBench-FullStack | 68.7 |
Toolathlon Verified | 70.3 |
DSBench-Hard | 59.6 |
更离谱的是:模型结构完全没改,只是重新做了后训练。同样的2840亿参数骨架,纯靠训练策略优化就把Agent能力拉到了接近自家Pro版的水平。Artificial Analysis智能指数给到50分——仅比GPT-5.6 Luna(51分)低1分。成本呢?输出定价$0.28/百万token,加上98%缓存命中折扣,单任务成本比GPT-5.6 Luna低约60%。
✨总结:DeepSeek用不到竞品一半的钱,跑出了接近顶尖闭源模型的Agent能力。这不是"性价比高",这是直接把桌子掀了。
🌙 GPT-5.6-Luna —— 突然大降价80%的"闭源性价比之王"
说到"竞品",就不得不提OpenAI的GPT-5.6-Luna。它是GPT-5.6系列中最快、最便宜的模型,支持工具调用和多步Agent工作流,已经是Replit、Cognition、Ramp等公司的默认选型,被OpenAI自己称作"最接近'便宜到不用计量'的智能"。
关键转折在7月30日——GPT-5.6系列发布仅三周,OpenAI突然宣布Luna价格直降80%:
计费项 | 降价前 | 降价后 | 降幅 |
|---|---|---|---|
输入 / 百万Token | $1.00 | $0.20 | -80% |
输出 / 百万Token | $6.00 | $1.20 | -80% |
降价后,Luna的Artificial Analysis智能指数仍是51分——注意,这个分只比DeepSeek-V4-Flash的50分高1分。
💡智价比(Intelligence-per-Yuan)时刻到了:
每百万 token | V4-Flash | GPT-5.6 Luna |
|---|---|---|
输入(牌价) | $0.14 | $0.20 |
输入(DeepSeek 高峰 2x 后) | $0.28 | $0.20 |
输出 | $0.28 | $1.20 |
输入端,Luna 降价后仍比 Flash 牌价贵约 43%,只有打到 DeepSeek 高峰价才反超——36氪那句"Luna 输入价比 DeepSeek 还便宜"指的正是高峰场景。输出端才是长文场景的大头,Flash $0.28 对 Luna $1.20,便宜 77%。按一篇 2.8 万字论文全流程(检索+写作+绘图+排版+验收)约消耗输入 300 万 token、输出 50 万 token 估算:Flash 约$0.56(≈¥4),Luna 约$1.2(≈¥8.6)——都不到一杯奶茶,但 Flash 再省一半。智价比这张桌子,DeepSeek 确实是亲手掀的。
二、学术写作实测:五个模型同题PK 📝
光看跑分不够。我们做了一个更硬核的测试:同一篇学术论文生成任务,并行交给5个模型执行,看看谁产出的内容最完善。
🎯 测试任务说明
每个模型需要独立完成以下全套交付物:
能力报告(capability report)
研究契约(research contract)
文献检索日志(search log)
证据矩阵 + references.bib(≥30条真实文献)
引用审计报告(reference audit)
详细大纲(outline)+ 论证地图(argument map)
逐章写作(7章正文)
前端图表生成(SVG+PNG)
数据表格(table-data-and-sources.md)
全文整合 + 引用审计 + 同行评审
final-paper.docx / .tex / .pdf 三格式输出
格式验证 + 最终QA报告
被测模型:5.6-luna/opus-5/ds4-flash(DeepSeek-V4-Flash) /qoder-qwen-3.8/workbuddy-k3
📊 执行过程实拍
以下是Qoder平台使用Qwen3.8-Max-Preview执行论文生成的完整过程截图:
▲ 任务启动:从环境检查到最终QA共20+步骤自动规划
▲ 执行中:大部分子任务已完成✅,进入深度思考模式处理复杂章节
▲ 收尾阶段:PDF已生成(22页/358KB),正在进行格式验证
🏆 六维打分结果
我们从任务完成度、内容细节、图文丰富度、文献真实度、AIGC指纹五个维度量化评分(综合得分按权重加权),结果如下:
维度 | 5.6-luna | opus-5 ⭐ | ds4-flash | qoder-3.8 | workbuddy-k3 |
|---|---|---|---|---|---|
任务完成度(文件数) | 141 | 75 | 66 | 46 | 99 |
内容细节(词数) | 21.0k | 47.8k | 27.1k | 13.0k | 18.8k |
图文丰富度(图+交互页) | 54 | 51 | 36 | 24 | 37 |
文献真实度(Bib条目) | 34 | 34 | 41 | 34 | 40 |
综合得分 | 73.3 | 86.8 🥇 | 76.7 | 55.5 | 72.2 |
🔍 关键发现
- opus-5 综合登顶(86.8分)
opus依然是那个最强模型:47.8k字正文 + 51张配图,内容深度碾压全场。如果你要的是"一篇有血有肉的完整论文",opus依然是最强的。但是opus不便宜。看看opus的作图能力。绝对的Sota!碾压其他模型。
- 5.6-luna 紧随其后(73.3分)
交付物最全(141个文件),适合追求"什么都要有"的场景。但是看看这图片质量完全不是一个级别的。可以说拉完了。图片这一块真的要降不少分。
- DeepSeek-V4-Flash(ds4-flash,76.7分)
整体得分已经非常给力了,文献质量最高(41条真实引用,全部可溯源)。考虑到它的成本只有顶级模型的一半左右,这个性价比已经非常能打了。综合表现绝对夯!而且最终开销仅为1.38元。pro是其他任务消耗无视即可。
DeepSeek-V4-Flash 论文技术页面:系统结构、业务逻辑与图文解释结合
- Kimi-K3的表现中规中矩:文献核验与长任务推进扎实,但存在空白页、1 处 XML 错误、文件哈希不一致,部分图尺寸偏小,交付稳定性拖累总分。而且kimi-K3的定价并不便宜,无论是订阅还是在workbuddy里使用积分,消耗都非常快。。
- Qwen-3.8-preview一言难尽:虽然整体内容表现不俗,但是无法生成word,这个是非常致命的。主要问题不是字数,而是交付链断裂:图片未进入成品、正文与文献无法匹配、编号和元数据重复。它最能说明,调用便宜不等于返工便宜。
三、参考基准:千笔AIWritePaper学术写作平台分析 📋
这几份模型论文都参考了千笔AIWritePaper学术写作平台中的同题原稿。
千笔写作原稿页面顶部:摘要、目录与 17,602 字页面标注
千笔写作原稿中的需求表与研究框架图:视觉完成度较高
千笔-AIWritePaper原稿多维评分
维度 | 得分 | 说明 |
|---|---|---|
结构完整度 | 90 | 章节与论文要素齐全 |
内容细节 | 76 | 技术描述多,部分结论泛化 |
图表丰富度 | 92 | 21 图、11 表,表面完成度高 |
文献真实性 | 78 | 抽样文献可查,来源等级不一 |
AI率 | 85 | 自研模型适配各大平台 |
写作自然度 | 52 | 学术风格、专业性较强 |
综合 | 86 | 接近终稿,还需一定调整 |
📌 千笔AIWritePaper学术写作是什么?
千笔AIWritePaper学术写作定位为"AI论文写作与降AI、降重平台",核心卖点如下:
能力维度 | 千笔-AIWritePaper学术写作 |
|---|---|
产出速度 | 10分钟产出3万字 |
内容类型 | 真实网络数据、图、表、公式、代码 |
大纲能力 | 不限次2000字3级大纲 |
参考文献 | 40篇真实参考文献 |
质量承诺 | AI率、重复率不达标就退费 |
⚖️ 千笔AIWritePaper学术写作 vs Agent自主执行模式
两种模式的区别:
对比项 | AIWritePaper(一站式工厂) | 各家Agent(本次测试) |
|---|---|---|
使用门槛 | 极低(零基础可用) | 中等(需基本操作能力) |
可控性 | 无限改稿(结果生成后改稿) | 全透明(每步可审查干预) |
内容深度 | ★★★★★ | ★★★~★★★★★(opus-5) |
降AI | 强(有自研降AI模型) | 一般(需不断调整skill) |
成本 | 按需计价 | 与模型价格有关deepseek可能只要1元、opus可能需要十几$ |
📊 综合评分
评分项 | 千笔AIWritePaper学术写作 | Agent模式(opus-5) |
|---|---|---|
便利性 | ★★★★★ | ★★★☆☆ |
可控性 | ★★★★☆ | ★★★☆☆ |
内容深度 | ★★★★★ | ★★★☆☆ |
性价比 | ★★★★ | ★ (claude-opus-5) ★★ (kimi-K3) ★★★★(gpt-5.6-luna) ★★★★★(deepseek) |
总分 | 4.6 / 5.0🏆 | 3.0 / 5.0 🏆 |
💡结论:如果你是零基础用户、赶时间交作业,千笔AIWritePaper是最好选择。但如果你对论文质量有要求、希望全程可控、且在意成本——Agent自主执行模式成本可能更低,但需要不断迭代,并且对整个流程非常熟悉,而且不同模型很可能质量参差不齐,作为初稿写作可能比较合适。opus-5产出的47.8k字+34张图+真实文献,确实非常给力,但是考虑到成本,你愿意花跟千笔AIWritePaper差不多的价格买到一篇只是质量稍强一点的初稿吗?
四、结论:掀桌的不是某一个模型 💡
回到标题的问题:完成一篇完整的学术文章只要……?
根据我们的实测数据,答案取决于你的选择:
用DeepSeek-V4-Flash(夜间0.2折调用)→ 成本可能低至几块钱,质量中上(66.7分),文献最靠谱!
用opus-5→ 质量最高(86.8分),47.8k字+51张图,适合追求完美的场景!
用 kimi-K3 → 各项
用5.6-luna→ 交付物最全(141个文件),适合"什么都想要"的用户
用千笔AIWritePaper学术写作→ 零门槛,10分钟出活,最全能,后顾无忧!
🎯 四点核心判断
第一,2026年7月是国内大模型的"井喷月"。
Kimi K3(2.8T开源)、Qwen3.8(2.4T预览)、DeepSeek-V4-Flash(284B激活13B)接连发布,参数规模全面进入万亿时代。国产前沿模型与国际SOTA之间的差距正在快速缩小。
第二,DeepSeek-V4-Flash正式版的真正意义不在参数规模。
它证明了"后训练杠杆效应"——同样的模型骨架,纯靠训练策略优化就能实现Agent能力的质变。2840亿总参数/130亿激活参数,这个"小身材"跑出了不输GPT-5.6 Luna的成绩,而成本更低。这意味着:堆参数不再是唯一的出路。
第三,Agent自主执行模式已经可以产出专业级论文。
opus-5的86.8分不是靠"量大"取胜——它的47.8k字是有结构的、有论证逻辑的、有真实文献支撑的完整学术文本。加上每一步都可审查、可干预、可迭代,这种模式已经从"能用"进化到了"好用"。贵有贵的道理。使用门槛也极高(封号非常严重,A÷不当人)。
第四,成本曲线正在重塑整个行业。
当一篇完整学术论文的生成成本降到几块钱以内时,讨论"AI会不会取代学术写作"已经没有意义了——真正的问题是:你准备好用AI来放大自己的能力了吗?
