NAVER AI实验室发现:让AI数学家“同时说多国语言“的秘密武器
这项由韩国NAVER AI实验室完成的研究以预印本形式发布于2026年8月6日的arXiv平台,论文编号为arXiv:2608.05802,题为《On-Policy Delta Distillation for Multilingual Math Reasoning》。对该领域感兴趣的读者可通过上述编号查阅完整原文。
如果你曾经用中文问过一个AI助手一道数学题,却发现它用英语回答你,那你大概能感受到这项研究试图解决的核心痛点。人工智能在做数学题这件事上越来越厉害,但它"说人话"——尤其是说非英语的人话——依然是一个被严重忽视的问题。NAVER AI实验室的研究者们把目光投向了韩语和日语这两种东亚语言,试图搞清楚一个关键问题:有没有办法让AI在数学推理能力变强的同时,也能用你提问时用的语言来回答你?
这个问题看起来简单,背后却牵扯着AI训练领域一场正在发生的技术变革。
一、AI学数学,靠的是什么"老师"?
在理解这项研究的核心之前,我们得先弄清楚AI是怎么"学会"做数学的,或者说,它是怎么从一个只会复读机式背诵的工具,进化成能真正推理解题的助手的。
传统上,AI学做数学靠的是一种叫做"强化学习"的方法。可以把它理解成这样一个场景:老师给学生出了一道题,学生写完整个解答过程后,老师只看最终答案,然后说"对"或者"错",给出一个总评分。这种方式虽然有效,但有一个显而易见的缺陷——学生做了很多步骤,老师只评价了最后一步,中间到底哪里做对了、哪里做错了,完全不知道。这种"一锤子买卖"式的反馈,导致训练效率低下,AI需要做大量的题才能有明显进步。
于是,研究者们开始探索一种更精细的替代方案,叫做"在策略蒸馏",英文缩写是OPD(On-Policy Distillation)。这个名字听起来很复杂,但背后的逻辑其实相当直观。换一个场景来理解:一位经验丰富的数学老师(我们叫他"师傅")和一位正在学习中的学生坐在一起。学生先自己做一道题,写下整个解题过程。然后,师傅对着学生写的每一步逐字审阅,在每个关键节点上给出反馈:"这一步你选了这个词,我会选那个词,因为……"这种逐词逐句的细致指导,显然比最后只给一个总分要有效得多。
在OPD框架下,AI学生自己先生成一段解答,然后把这段解答送给"师傅模型"(一个更强大、已经经过充分训练的AI),师傅会对学生生成的每一个词打一个分数——这个词是否符合师傅自己的偏好。学生模型则根据这些逐词的分数来调整自己的行为,让自己未来的输出越来越接近师傅的水平。这种机制的精妙之处在于,它提供的是"词元级别"(token-level)的监督信号,远比强化学习那种"序列级别"(sequence-level)的笼统评分精细得多。
二、从"模仿师傅"到"学习师傅的成长"
OPD已经很好用了,但研究团队在这个基础上进了一步,提出了一个名为OPD?(On-Policy Delta Distillation,在策略增量蒸馏)的改进版本。这个改进的关键,在于一个颇具哲学意味的转变:与其让学生去模仿师傅现在的样子,不如让学生去学习师傅究竟"成长了什么"。
具体来说,任何一个强大的AI师傅,在成为"师傅"之前,都经历过两个阶段:第一阶段是大规模的基础训练,产生一个"基础模型",这个基础模型已经掌握了大量语言知识,但还不太会深度推理;第二阶段是专项的"后训练",通过强化学习等手段,让基础模型蜕变成擅长数学推理的师傅模型。OPD?的核心思路是:把师傅模型在每个词上的打分,减去基础模型在同一个词上的打分,得到一个"差值"——这个差值代表的就是后训练阶段为师傅带来的纯粹的推理能力增量。
用一个更生动的类比来说:假设你想学烹饪,你可以模仿一位大厨做的整道菜(普通OPD的思路),也可以专门学习大厨在成为大厨之前和成为大厨之后,他的做法究竟发生了哪些具体变化——哪些步骤是新加的、哪些手法是精进的(OPD?的思路)。后者让你学到的,是更纯粹、更精华的"功夫进阶秘诀",而不会被大厨一直以来的个人习惯和风格所干扰。
这个"差值信号"被研究者称为"delta信号",它的目的是过滤掉师傅模型中那些来自基础训练阶段就已存在的、与推理能力无关的语言偏好和风格倾向,只保留后训练过程中真正习得的推理能力精华。此前,OPD?在英语的数学、科学和编程推理任务上已经证明了自己比普通OPD更胜一筹。而这项研究要解答的,是同样的优势能否延伸到韩语和日语这样的非英语世界。
三、实验室里的"多语言数学考场"
为了回答这个问题,研究团队搭建了一个颇具规模的实验环境。他们构建了一个包含十万道数学题的训练数据集,英语、韩语和日语各占三分之一,彼此之间没有重叠题目。韩语和日语题目从NVIDIA发布的一个多语言数学数据集中抽取,英语题目则来自另一个专门的英语数学数据集。除了这套混合语言数据集,他们还单独准备了一套纯英语的十万道题,用于后续的对比实验。
学生模型选用了Qwen3家族中的两个版本:参数量较小的Qwen3-1.7B和参数量较大的Qwen3-8B——这两个数字大体上可以理解为模型的"脑容量"大小。师傅模型则是更强大的Qwen3-30B-A3B-2507。所有模型都在"思考模式"(thinking mode,类似于让AI在回答前先列出推理过程)和"非思考模式"(non-thinking mode,直接给出答案)两种状态下分别训练和评测。
评测所用的基准测试覆盖多个维度:PolyMath是一个专门评测多语言数学推理的基准;Global-MGSM是另一个多语言数学测试;HRM8K则是包含GSM8K、MATH、Omni、KSM、M-MMLU五个子集的韩语为主的综合测试;日语方面还额外使用了MAWPS基准。
四、韩语和日语的"成绩单"
实验结果相当清晰。先看非思考模式下的核心数据——研究者用PolyMath和Global-MGSM两个基准的平均分来呈现整体趋势。
对于较小的Qwen3-1.7B模型,基础版本(未经任何OPD训练)在英语上的平均分是55.1,在韩语上是40.9,在日语上是37.2。经过普通OPD训练后,这三个数字分别提升到61.5、48.8和48.0。而经过OPD?训练后,进一步提升到63.6、51.9和52.0。这意味着OPD?在韩语上比普通OPD高出3.1分,在日语上高出4.0分,在英语上高出2.1分——非英语语言的进步幅度反而更大。
对于较大的Qwen3-8B模型,同样的规律继续成立。基础版本的英语、韩语、日语平均分分别是62.8、57.0和57.1。OPD训练后变为69.8、61.1和61.9。OPD?训练后达到70.5、64.4和65.0。OPD?相对OPD在韩语和日语上分别多出3.3分和3.1分,在英语上只多出0.7分。
从完整的基准测试数据来看,OPD?在Qwen3-1.7B上将非思考模式下英语平均分从47.6拉升到65.7,韩语从37.4拉升到56.5,日语从55.5拉升到65.4。在思考模式下,由于基础模型本身已有相当强的推理能力,提升幅度相对较小,但OPD?依然将英语平均分从70.4提升到73.4,韩语从63.7提升到68.2,日语从68.5提升到71.2,而普通OPD的对应成绩分别是71.4、66.2和70.5——OPD?的优势依然稳定存在。
对于更大的Qwen3-8B,非思考模式下OPD?将英语平均分从58.7提升到75.3,韩语从55.4提升到72.2,日语从70.2提升到75.2。在思考模式下,普通OPD出现了一个耐人寻味的现象:它的英语平均分从80.9反而下降到79.9,韩语从78.0下降到75.7——也就是说,对于本身已经很强的模型,普通OPD的训练信号反而可能帮倒忙。OPD?则没有这个问题,它将英语推至83.2,韩语推至80.4,日语推至78.9,全面超越基础模型。
五、英语和韩语之间的"成绩差距"能缩小吗?
研究者还专门观察了一个现实中颇为突出的现象:AI在处理英语数学题时,普遍比处理韩语数学题表现更好,这种系统性的差距究竟有多大,又能通过OPD训练缩小多少?
以Qwen3-1.7B在思考模式下的数据为例,基础模型在各个基准上的英韩差距触目惊心:PolyMath上差6.4分,Global-MGSM上差13.4分,HRM8K的GSM8K子集上差12.1分。经过普通OPD训练后,这些差距有所收窄:PolyMath降到4.4分,Global-MGSM降到8.6分,KSM子集上的差距从3.3分大幅缩小到仅0.4分。但OPD的效果并不稳定,M-MMLU子集上的差距反而从1.1分扩大到了4.6分。
OPD?的表现更为一致。它将PolyMath上的差距压缩到5.0分,Global-MGSM上压缩到9.3分,HRM8K-GSM8K差距从12.1分降至9.2分。MATH、Omni、KSM三个子集的差距也全部收窄,而M-MMLU上的差距保持在1.1分不变。归根结底,在七个报告的基准中,OPD?在六个上缩小了英韩差距,在剩余一个上维持了现状——没有一个出现恶化。这说明多语言联合训练往往对韩语推理能力的提升幅度更大,因此在不损害英语表现的前提下,实际上拉近了两种语言之间的能力鸿沟。
六、"只学英语"能走多远?
整个研究中最出乎意料的发现,来自一组对比实验:如果把多语言训练数据换成纯英语数据,韩语和日语的表现会发生什么?
答案令人惊讶:纯英语训练的OPD?,居然也能大幅提升韩语和日语的数学推理成绩。在非思考模式下,英语专训的OPD?将韩语平均分从37.4提升到59.3,将日语平均分从55.5提升到66.5。这两个数字不仅远高于基础模型,甚至在有些情况下还略高于多语言训练版本(多语言OPD?的对应成绩分别是56.5和65.4)。在思考模式下,英语专训OPD?将韩语平均分提升到65.1,日语提升到69.9,多语言训练版本则达到68.2和71.2——多语言版本整体略优,但英语专训版本依然相当接近。
这个发现在直觉上有些违反常识:明明没有看过任何韩语或日语训练题,AI的韩语和日语数学能力怎么还提升了?研究者认为,这背后的逻辑是:数学推理本身是一种语言无关的抽象能力,当AI通过英语题目练就了更强的逻辑推理能力之后,这种能力在面对非英语输入时也能被调用,产生迁移效应。
然而,这里藏着一个关键的陷阱。
七、测试分高不等于"说对语言"
仅仅看测试分数,会产生一种虚假的乐观。研究团队做了一项补充调查:当AI用韩语或日语被提问时,它究竟用什么语言来回答?
结果揭示了纯英语训练的真实代价。在非思考模式下,多语言训练的OPD?,给出韩语回答的比例高达90.5%,给出日语回答的比例高达90.9%——也就是说,九成以上的时间里,模型能用提问语言来作答。而英语专训的OPD?,这两个数字分别骤降到48.3%和29.6%——超过一半的韩语问题和超过七成的日语问题,模型选择用英语来回答,尽管题目是韩语或日语写的。
思考模式下(只统计最终答案部分,不含中间推理过程,因为思考过程本来就主要用英语),多语言OPD?的韩语目标语言回答率是97.6%,日语是95.2%。英语专训OPD?则分别跌到36.1%和30.8%。
普通OPD的情况也值得单独关注。在思考模式下,英语专训的普通OPD,韩语目标语言率是83.1%,看起来还不错;但日语仅有36.9%。多语言训练的普通OPD,韩语是72.9%,日语是70.1%——多语言训练同样改善了语言保持能力,但幅度不如OPD?明显。非思考模式下,多语言普通OPD的韩语目标语言率达到99.7%,日语达到99.8%,几乎完美;英语专训普通OPD的韩语是83.6%,日语是40.5%。
这组数据清晰地揭示了一个重要区分:数学推理能力可以跨语言迁移,但"用对语言回答"这件事,是需要专门训练的。一个AI可以"读懂"韩语题并在内心用英语把它做出来,然后用英语把答案说出来——这在基准测试上可能得分不错,但对于真实用户来说,这是一种令人沮丧的体验。多语言训练数据的存在,是保证模型不仅"能做"而且"会用对语言做"的关键。
归根结底,这项研究的发现可以用一句话来概括:OPD?是一种比普通OPD更有效、更稳定的AI数学训练方式,它在韩语和日语上的提升幅度甚至超过英语;英语数据训练出的推理能力确实能跨语言传播,但如果你真正在意AI能不能用你的语言跟你交流,多语言的训练数据就不是可有可无的选项,而是不可或缺的基础。这对未来开发面向多语言用户群体的AI系统,是一个务实且重要的参考信号。
想深入了解技术细节的读者,可通过arXiv编号2608.05802查阅NAVER AI实验室的完整论文,研究使用的OPD?代码也已开源。
Q&A
Q1:OPD?和普通OPD有什么区别?
A:普通OPD让AI学生去模仿师傅模型的输出分布,而OPD?改为利用"师傅模型"和"师傅的基础版本"之间的概率差值作为训练信号,专门提取师傅在后训练阶段习得的推理能力精华,过滤掉基础语言偏好的干扰。实验结果显示这个简单修改带来了稳定且显著的性能提升。
Q2:只用英语数据训练AI,为什么韩语和日语数学成绩也会变好?
A:数学推理是一种抽象逻辑能力,和具体语言有一定程度的解耦。AI通过英语题目强化了推理能力后,这种能力在面对其他语言的数学题时也能被调用,产生跨语言迁移效应。但这种迁移只影响"做题能力",不影响模型用哪种语言回答,所以英语专训的AI经常用英语回答韩语或日语问题。
Q3:多语言OPD训练会不会损害英语的数学推理能力?
A:根据实验结果,不会。多语言OPD?在英语基准上的表现与纯英语训练的OPD?相当甚至更好,同时还显著提升了韩语和日语的推理能力,并有效保持了模型用目标语言回答的能力。总体来看是一种各方面损耗都很小的联合提升方案。
