一次“偏科”的微调实验:Xiaothink-T17-RWKV5-MLA-Instruct-Pro 为何中文更强、前端变弱?
一、一次刻意为之的“偏科”
上一篇文章《0.6B 硬刚 8B/20B》用数据证明了一件事:Xiaothink-T17-RWKV5-MLA-Instruct-Pro(≈0.6B)在中文自然语言任务上表现亮眼。但成绩单里也躺着一个刺眼的数字——前端页面生成 25.0,全场最低。
这不是意外,而是一次刻意取舍的结果。本模型基于 t17_rwkv5_mla_instruct_frontend 继续微调,训练重心从“写前端”转向“写中文”,于是中文更强、前端变弱。这篇文章聊聊这个选择背后的架构逻辑与数据证据。
二、先复习:RWKV-v5 + MLA 是什么?
T17 系列的核心是自研的RWKV-v5 + MLA(DeepSeek V3 风格低秩压缩注意力)纯历史检索架构:
- RWKV-v5 时间混合:负责当前 token 的上下文建模,线性复杂度、可流式推理;
- MLA 历史检索:把历史状态压缩成低秩 key/value 缓存,当前 token 通过注意力检索过往“快照”,实现长程记忆,而无需完整序列注意力;
- 门控融合:把 RWKV 的当前输出与 MLA 检索到的历史信息按可学习权重融合,再喂给 FFN。
关键超参(instruct_pro):
| 参数 | 值 |
|---|---|
| d_model | 1400 |
| 层数 | 16 |
| history_top_k | 6 |
| save_every | 16(历史快照保存间隔,比基础版更密) |
| max_seq_len | 51200 |
| max_cut | 2400 |
这套架构在“0.6B 锁住超长记忆”这件事上的优势,之前的多篇文章已经拆过,这里不展开。
三、从 frontend 到 instruct_pro:一次方向调整
模型脉络是这样的:
- t17_rwkv5_mla_frontend:面向 WanlyFrontend(WF)声明式语言专项训练,擅长把一句需求编译成网页,前端生成能力强;
- t17_rwkv5_mla_instruct:在 frontend 基础上补上通用中文指令能力(对话、创作、情感等);
- t17_rwkv5_mla_instruct_pro:本模型,继续强化中文自然语言理解与指令遵循,覆盖古诗、知识问答、长文本等 6 领域。
也就是说,instruct_pro 是 frontend 版的“改行”之作——把原本花在前端语法上的容量,挪给了中文自然语言。改行有收益,也有代价。
四、数据怎么说?收益与代价
来自 DeepSeek-V4-Flash 对照盲测(6 领域 × 3 题,温度梯度 [0.68, 0.92] 采样,取最高分):
| 领域 | Instruct-Pro(0.6B) | 对比:Qwen3-0.6B | 对比:llama-3-8B |
|---|---|---|---|
| 指令遵循 | 90.7 | 78.2 | 89.7 |
| 通用知识 | 85.0 | 69.5 | 83.6 |
| 古诗生成 | 74.0 | 36.4 | 57.4 |
| 古诗赏析 | 67.0 | 72.6 | 71.6 |
| 长文本处理 | 50.0 | 85.0 | 76.5 |
| 前端页面生成 | 25.0 | 34.9 | 50.1 |
| 总体平均 | 65.3 | 62.8 | 71.5 |
收益侧:指令遵循 90.7 全场第一(含 8B/20B/云端);通用知识越过 llama-3-8B;古诗生成在同尺寸里断档领先;总体 65.3 反超 Qwen3-0.6B 的 62.8。
代价侧:前端页面生成 25.0,比 frontend 版明显下降,也不及 Qwen3-0.6B 的 34.9。长文本处理 50.0 同样偏弱。
一句话总结数据:把容量花在哪,成绩就长在哪。
五、怎么选型?
| 你要做的事 | 选哪个模型 |
|---|---|
| 中文对话、创作、古诗、知识问答、指令任务 | t17_rwkv5_mla_instruct_pro(本模型) |
| 前端页面生成(WF → HTML) | t17_rwkv5_mla_frontend |
| 纯架构研究、超长记忆基准 | t17_rwkv5_mla(基础版) |
模型下载(ModelScope):Xiaothink-T17-RWKV5-MLA-0.6B-Instruct-Pro(本模型)、Xiaothink-T17-RWKV5-MLA-0.6B-Frontend(前端版)
配合 xiaothink ≥ 1.5.0 的深度思考(think=True 强制<think>),本模型在古诗创作、知识问答这类需要“先想再答”的任务上还有额外增益。
六、总结
- Instruct-Pro 是一次刻意偏科:把容量从 WF 前端语法转向中文自然语言;
- 盲测数据验证了取舍——指令遵循 90.7 全场第一、总体反超同尺寸 Qwen3-0.6B,代价是前端 25.0 明显下滑;
- 选型大于调参:做前端用 frontend 版,做中文用 instruct_pro 版,各司其职。
数据全部来自真实盲测,欢迎交流讨论!
