
https://arxiv.org/pdf/2608.13698
实验结果表明,采用中文作为推理介质训练,性能与英文训练仅相差 1.1 个百分点,远低于以往同类研究所报告的 10 个百分点以上的落差。
GRPO 强化学习存在一项核心技术抉择:奖励模型应该基于英文思维路径,还是基于提问方的本族语言进行评估。
假如选择英文方案,模型即便输入中文问题也会切换至英文推理模式;若选择本族语言方案,整个推理链条将全程维持中文。
长期以来,学术界普遍认为本族语言推理的性能代价过于沉重,导致非英语地区的团队大多只能默认采纳英文推理方案。
本次论文的发现彻底改变了这一判断——其实这种代价远没有想象那么大。对中文而言,差异仅为 1 个百分点。这直接转变了决策逻辑:中文推理模型已具备在训练源头就绕过英文、走自主发展道路的条件。
从中文 AI 实践者角度看,这是推理模型能否摆脱依赖、独立演进的必备前提。
同一研究还发现,跨语言能力迁移在多数场景卓有成效,然而某些特定的模型与语言配对组合会引发极端的性能陷阱。

200 组对照试验要回答的究竟是什么
推理工作是否必然依赖英语
历年来的多项研究均指出,若强制模型以非英语方式进行推理,其精准度会遭遇 10 个百分点甚至更大的跌幅。这使「推理必需英文」演变成了多语言智能领域的行业默认认知。
Dobler 等研究团队通过大规模系列对照试验对该共识提出了质疑:选取三个模型系列(Qwen3、Gemma 3、SmolLM3),涵盖 1B 至 8B 的参数量级,跨越 11 种语言的训练场景,分别在英文推理奖励和本族语推理奖励这两种模式下各训练 500 步,随后进行交叉效能测评。
通过语言维度细化观察结论数据会更加清晰。
经中文训练实现的英文性能优势仅余 1.1 个百分点;法文为 1.4、德文为 1.7、日文为 1.6 个百分点——这类数据充沛的语言的差异广泛保持在 2 个百分点之内。
性能差距扩大主要体现在数据相对稀缺的语言:孟加拉文 5.7、泰卢固文 4.6、斯瓦希里文 4.5 个百分点。

语言在预训练阶段所积淀的资源深度,直接制约了本族语推理优化的成本效益比。

单一语种训练,多语言普遍获益
试验中另外一组值得拆解的数据维度,乃是多语言跨越转移的性能矩阵。
论文将 11 种语言分别进行单独语言训练,继而在全部 14 种语言平台上做效能评测,生成一张 11×14 的性能对比表。
这份对比表最为突出的讯息在于:经某一种语言实施 GRPO 训练后,其他语言的性能表现几乎无一例外地随之上升。
西班牙语单独语言训练后,法语的性能复原达到了该语言直接训练增益的 96%,仅差 1 个百分点。中文与日文之间的相互转移同样呈现显著效应,中日韩语系的预训练资源共享可能在发挥作用。
一个突破常规直觉的观察是:英文并非总是最优的转移源。
在 Qwen3-4B-Base 和 Qwen3-8B 的测试中,孟加拉文训练对中文的转移贡献反而最强。
论文团队推断,数据稀缺语言的训练过程会驱动模型深层重构推理机制,这类深度重组所带来的泛化能力有时会超越数据丰沛语言的效果。
多语言协同训练的结果也值得重视。
Qwen3-Base 系列在多语言协同模式下,相比于「针对各评测语言分别甄选最优转移源」的理想状态,平均仅差 0.3 个百分点,且只需单次模型训练过程。
对资源受限的研发单位而言,这条路径解决了实际问题:无需为每个目标语言单独启动训练循环。

警惕性能坍塌的黑天鹅
多语言迁移的利好消息,被某类特殊失效模式所削弱。
研究指出,某些模型与特定训练语言的组合方式会造成其他语言或具体任务维度的剧烈倒退,而同一模型若更换训练语言就完全不会出现此类问题。
最为严重的案例来自 Qwen3 系列的非 Base 类模型。
采用斯瓦希里文或泰卢古文进行训练后,这些模型在包含英文内容的未见任务上展现了高达 19.2 个百分点的性能断崖(Qwen3-4B 斯瓦希里文训练),而在训练语言本体表现反而正常甚或有所改善。
一旦转换为英文或多语言训练,同一批测试任务的性能旋即稳定。
在数学难题应用上,性能倒退现象更加普遍。
Qwen3 非 Base 系列、SmolLM3-3B 在采纳非英语单语言训练后,PolyMath 中等难度及以上题目的平均得分大幅滑坡,部分配置的跌幅甚至突破 30 个百分点。

与此相反的是,同类模型在其他测试任务上保持稳定表现,倒退现象高度聚焦于特定任务领域。
推理奖励机制本身采用的语言也可能触发性能坍塌。
gemma-3-1b-it 以斯瓦希里文数据配合本族语推理奖励进行训练后,基础数学任务(MGSM 及 PolyMath-low)的成绩较原始模型下滑了 3.1 个百分点;
但同样数据搭配英文推理奖励时,性能竟然攀升 17.5 个百分点。
差异超过了 20 个百分点,且在该模型的孟加拉文训练版本中并未出现。
这类倒退无法从单个模型或语言维度提前推断,仅在特殊配对情形下才会暴露。

超越中文的思考
所有非英语阵营都在追问同样的问题
将话题聚焦于中文开发者最为关切的问题——中文推理训练究竟可行不可行。
依据本次论文的数据结果,答案倾向于「可行」。
在所有被检验的语言样本中,中文所显示的性能差异属于最小档位(1.1 个百分点)。Qwen3-Base 整个产品线的中文推理奖励训练都能有效约束推理路径,中文在多语言迁移中既是良好的接纳方也是优质的输出方。
这套结果在 9 个模型架构中展现一致性,绝非个案。
但这项结论的适用疆界需要划定清晰:论文的评估范畴是 8B 以下的开源模型,处理的是程序化生成的数学与逻辑类题目,基于单次随机种子的试验,未包含逐参数微调的深度优化。实际部署环境下的效能仍然需要单独验证。
扩大视角范围,本论文释放的讯息对整个非英语 AI 领域都具有借鉴意义。
过往十二个月里,从阿拉伯语系到法语社区再到日语团队,各地都在提出一个共同诘问:推理训练流程是否必然绕过英文这一环节。
若答案是「必然绕不过」,那非英语模型将永远处于英文模型下游的适配位置;
若答案是「性能差异在可控范围」,非英语生态就获得了可能在推理训练源头就开启自主演进的机会。
本篇论文将「差异可控」从理论假设转变为有数据支撑的结论——至少对数据充沛的语言和中小规模模型而言确实如此。
把差异压缩至 1–2 个百分点的水准后,直接从 RLVR 训练阶段启用目标语言运行,演变成了一个成本可以接纳的工程决策。
这对中文 AI 而言意味着,中文推理模型可能从最源头就走上自主发展的道路,跳过英文推理模型的翻译转接层环节。
然而论文同时揭示了另一个真相:「可控」与「确保安全上线」之间的沟壑就是评测覆盖密度。
若仅关注目标语言的整体评分,风险会藏身于暗处;唯有逐语言、逐任务、逐模型的细致排查,才能在部署前期就把潜在风险曝光于阳光下。
这 200 组试验最深层的贡献,正在于它证明了这种细致排查过程无法省略。