一份200组实验的证明:中文推理无需绕道英语

近日,苹果公司携手 Hasso Plattner 研究所联合发布学术论文,基于 9 个基础模型、11 种语言设计框架,开展了超过 200 组 GRPO 强化学习推理训练的对照实验。

苹果新研究:纯中文推理训练 和用英文几乎没差距

https://arxiv.org/pdf/2608.13698

实验结果表明,采用中文作为推理介质训练,性能与英文训练仅相差 1.1 个百分点,远低于以往同类研究所报告的 10 个百分点以上的落差。

GRPO 强化学习存在一项核心技术抉择:奖励模型应该基于英文思维路径,还是基于提问方的本族语言进行评估。

假如选择英文方案,模型即便输入中文问题也会切换至英文推理模式;若选择本族语言方案,整个推理链条将全程维持中文。

长期以来,学术界普遍认为本族语言推理的性能代价过于沉重,导致非英语地区的团队大多只能默认采纳英文推理方案。

本次论文的发现彻底改变了这一判断——其实这种代价远没有想象那么大。对中文而言,差异仅为 1 个百分点。这直接转变了决策逻辑:中文推理模型已具备在训练源头就绕过英文、走自主发展道路的条件。

从中文 AI 实践者角度看,这是推理模型能否摆脱依赖、独立演进的必备前提。

同一研究还发现,跨语言能力迁移在多数场景卓有成效,然而某些特定的模型与语言配对组合会引发极端的性能陷阱。

AMP

200 组对照试验要回答的究竟是什么

推理工作是否必然依赖英语

历年来的多项研究均指出,若强制模型以非英语方式进行推理,其精准度会遭遇 10 个百分点甚至更大的跌幅。这使「推理必需英文」演变成了多语言智能领域的行业默认认知。

Dobler 等研究团队通过大规模系列对照试验对该共识提出了质疑:选取三个模型系列(Qwen3、Gemma 3、SmolLM3),涵盖 1B 至 8B 的参数量级,跨越 11 种语言的训练场景,分别在英文推理奖励和本族语推理奖励这两种模式下各训练 500 步,随后进行交叉效能测评。

通过语言维度细化观察结论数据会更加清晰。

经中文训练实现的英文性能优势仅余 1.1 个百分点;法文为 1.4、德文为 1.7、日文为 1.6 个百分点——这类数据充沛的语言的差异广泛保持在 2 个百分点之内。

性能差距扩大主要体现在数据相对稀缺的语言:孟加拉文 5.7、泰卢固文 4.6、斯瓦希里文 4.5 个百分点。

AMP

语言在预训练阶段所积淀的资源深度,直接制约了本族语推理优化的成本效益比。

AMP

单一语种训练,多语言普遍获益

试验中另外一组值得拆解的数据维度,乃是多语言跨越转移的性能矩阵。

论文将 11 种语言分别进行单独语言训练,继而在全部 14 种语言平台上做效能评测,生成一张 11×14 的性能对比表。

这份对比表最为突出的讯息在于:经某一种语言实施 GRPO 训练后,其他语言的性能表现几乎无一例外地随之上升。

西班牙语单独语言训练后,法语的性能复原达到了该语言直接训练增益的 96%,仅差 1 个百分点。中文与日文之间的相互转移同样呈现显著效应,中日韩语系的预训练资源共享可能在发挥作用。

一个突破常规直觉的观察是:英文并非总是最优的转移源。

在 Qwen3-4B-Base 和 Qwen3-8B 的测试中,孟加拉文训练对中文的转移贡献反而最强。

论文团队推断,数据稀缺语言的训练过程会驱动模型深层重构推理机制,这类深度重组所带来的泛化能力有时会超越数据丰沛语言的效果。

多语言协同训练的结果也值得重视。

Qwen3-Base 系列在多语言协同模式下,相比于「针对各评测语言分别甄选最优转移源」的理想状态,平均仅差 0.3 个百分点,且只需单次模型训练过程。

对资源受限的研发单位而言,这条路径解决了实际问题:无需为每个目标语言单独启动训练循环。

AMP

警惕性能坍塌的黑天鹅

多语言迁移的利好消息,被某类特殊失效模式所削弱。

研究指出,某些模型与特定训练语言的组合方式会造成其他语言或具体任务维度的剧烈倒退,而同一模型若更换训练语言就完全不会出现此类问题。

最为严重的案例来自 Qwen3 系列的非 Base 类模型。

采用斯瓦希里文或泰卢古文进行训练后,这些模型在包含英文内容的未见任务上展现了高达 19.2 个百分点的性能断崖(Qwen3-4B 斯瓦希里文训练),而在训练语言本体表现反而正常甚或有所改善。

一旦转换为英文或多语言训练,同一批测试任务的性能旋即稳定。

在数学难题应用上,性能倒退现象更加普遍。

Qwen3 非 Base 系列、SmolLM3-3B 在采纳非英语单语言训练后,PolyMath 中等难度及以上题目的平均得分大幅滑坡,部分配置的跌幅甚至突破 30 个百分点。

AMP

与此相反的是,同类模型在其他测试任务上保持稳定表现,倒退现象高度聚焦于特定任务领域。

推理奖励机制本身采用的语言也可能触发性能坍塌。

gemma-3-1b-it 以斯瓦希里文数据配合本族语推理奖励进行训练后,基础数学任务(MGSM 及 PolyMath-low)的成绩较原始模型下滑了 3.1 个百分点;

但同样数据搭配英文推理奖励时,性能竟然攀升 17.5 个百分点。

差异超过了 20 个百分点,且在该模型的孟加拉文训练版本中并未出现。

这类倒退无法从单个模型或语言维度提前推断,仅在特殊配对情形下才会暴露。

AMP

超越中文的思考

所有非英语阵营都在追问同样的问题

将话题聚焦于中文开发者最为关切的问题——中文推理训练究竟可行不可行。

依据本次论文的数据结果,答案倾向于「可行」。

在所有被检验的语言样本中,中文所显示的性能差异属于最小档位(1.1 个百分点)。Qwen3-Base 整个产品线的中文推理奖励训练都能有效约束推理路径,中文在多语言迁移中既是良好的接纳方也是优质的输出方。

这套结果在 9 个模型架构中展现一致性,绝非个案。

但这项结论的适用疆界需要划定清晰:论文的评估范畴是 8B 以下的开源模型,处理的是程序化生成的数学与逻辑类题目,基于单次随机种子的试验,未包含逐参数微调的深度优化。实际部署环境下的效能仍然需要单独验证。

扩大视角范围,本论文释放的讯息对整个非英语 AI 领域都具有借鉴意义。

过往十二个月里,从阿拉伯语系到法语社区再到日语团队,各地都在提出一个共同诘问:推理训练流程是否必然绕过英文这一环节。

若答案是「必然绕不过」,那非英语模型将永远处于英文模型下游的适配位置;

若答案是「性能差异在可控范围」,非英语生态就获得了可能在推理训练源头就开启自主演进的机会。

本篇论文将「差异可控」从理论假设转变为有数据支撑的结论——至少对数据充沛的语言和中小规模模型而言确实如此。

把差异压缩至 1–2 个百分点的水准后,直接从 RLVR 训练阶段启用目标语言运行,演变成了一个成本可以接纳的工程决策。

这对中文 AI 而言意味着,中文推理模型可能从最源头就走上自主发展的道路,跳过英文推理模型的翻译转接层环节。

然而论文同时揭示了另一个真相:「可控」与「确保安全上线」之间的沟壑就是评测覆盖密度。

若仅关注目标语言的整体评分,风险会藏身于暗处;唯有逐语言、逐任务、逐模型的细致排查,才能在部署前期就把潜在风险曝光于阳光下。

这 200 组试验最深层的贡献,正在于它证明了这种细致排查过程无法省略。


上一篇 2026/08/29 08:15
下一篇 2026/08/29 08:17

相关推荐

  • 人民币被低估两三成?华尔街日报重提「新广场协议」

    中国贸易顺差今年或达1.2万亿美元,人民币被指低估近两成甚至更多。美欧对华制造业冲击的担忧持续升温,欧洲多国政界人士重提「新广场协议」,希望借汇率协调缓解贸易失衡。但人民币升值能否真正化解顺差之谜,答案或许在于中国能否提振内需。

    2026/08/30
    00
  • 半年卷走940万美元换豪宅豪车!亚马逊「监守自盗」案女主谋获刑16年不得假释

    美国乔治亚州一名女子伙同同伙,勾结亚马逊内部人员半年间骗走近940万美元,用赃款购置豪宅名车,事后又伪造法官签名企图脱罪,终被判16年3个月监禁且不得假释,同伙也已获重刑。

    2026/08/30
    00
  • 剑指太空竞赛!特朗普签令筹建美版“西点军校”太空学院

    特朗普签署行政令,宣布筹建定位为军民合一机构的美国“太空学院”,被外界视为西点军校模式的翻版。选址尚未公布,运作细节和经费也待国会批准,此举延续其登月与太空军事化布局。

    2026/08/30
    00
  • 孙宇晨深藏的身份:一个只有7平方公里迷你国的“总理”

    波场创始人孙宇晨近来因感情纠纷、财产争议频频登上热搜,鲜为人知的是,他还身兼巴尔干半岛迷你国家利伯兰的总理一职。这个仅7平方公里的“国家”依靠币圈捐助运转,并试图借助与川普家族的交情提升国际认可度。

    2026/08/30
    00
  • 美股离历史高点只差1%!下周非农数据+博通财报成关键考验

    美股在AI热潮带动下重新逼近历史高点,标普500距顶点仅差约1%。下周非农就业报告与博通财报将成两大关键:就业数据若过热恐推升Fed升息机率,博通财报则关乎AI投资热潮能否延续,牛市能否再进一步就看这两役。

    2026/08/30
    00

发表回复

登录后才能评论