从散落的研究论文到大模型破局者,揭秘DeepSeek技术团队的成长密码

从散落的研究论文到大模型破局者,揭秘DeepSeek技术团队的成长密码

模型迭代在周三夜间再度启动。

DeepSeek-V4-Pro-0813的发布标志着V4 Pro正式版的到来。在能力指标方面,新版本将上下文窗口扩充至百万Token量级,单次生成能力达到384K Token,并同时兼容推理与常规两种运行模式,其中推理模式默认激活。费用结构上,百万Token计价为输入3元、输出6元,相比Flash版本翻了三倍。

Terminal Bench基准测试中,V4 Pro取得87.9分的成绩,与当前领先的Fable 5仅相差0.1分。

AMP

模型性能之外,另有一条更隐蔽的叙事线索值得追踪——人的网络。

DeepSeek-MoE、DeepSeekMath、DeepSeek-Coder,到V2、V3、R1,再至今日的V4,历经三年的技术迭代中,模型命名虽在变化,但论文署名栏里那些身影却显得格外恒定。王培懿、许润昕、代达劢、陈德里、杨德健、吴俣、邵智宏等人,并非在R1获得关注后才登上舞台的新面孔。

向前回溯,这支团队分散在同批论著、研究院所和学术协作的网络中。不同的校园背景、不同的研究方向——有人投身数学推理,有人致力于对齐研究,有人专注验证器设计,有人研究代码与架构——却在DeepSeek成立前后逐步交汇融合。

这是一份DeepSeek技术进化的地图,同时也是这支年轻学者群体的集体画像。

AMP

群像聚焦,从R1之前开始

在DeepSeek于2025年农历新年突然进入全球视野之前的2024年2月,一次静水深流的技术里程碑已经出现——DeepSeekMath的发布。论文作者团队仅11人的精干编制,与日后那些动辄数百署名的阵容形成鲜明对比。

一年时光流转,R1的诞生让那11个名字全数汇入其作者序列。

时间继续往前推移。这群人的早期交集,其实源自比DeepSeek创立时更久远的缘源。

最初的三人组合是王培懿、许润昕和代达劢。2021年《Behind the Scenes》论文发表时,他们三人已经并肩出现在署名中。那时,DeepSeek还未诞生。

AMP

三人都师出北京大学计算语言学研究所(PKU-ICL),在穗志方和常宝宝两位导师的课题组共事,研究课题是少样本事件分类——那还是BERT范式的时代。

许润昕属于较早加入DeepSeek者。作为北大计算语言学研究所2020级硕士研究生,他在2023年8月步入DeepSeek。此后,从DeepSeek-MoE、DeepSeekMath、Coder,经过V2、V3,直至R1,他的名字串联起了公司初期最为关键的技术项目。

一月后,王培懿也成为了DeepSeek的一员。天津大学本科出身,他后来进入北京大学计算语言学研究所攻读博士,跟随隋志方教授。当DeepSeek在2023年9月成立时,一位师兄告诉他这家公司「扎根于对技术的执着探索」,基于这份推荐,王培懿递交了申请。他后来解释,真正吸引他留下的,源于公司对通用人工智能这一长远目标的执着。

AMP

前排中间为王培懿

在加入DeepSeek之前,王培懿主要从事文本分类、大模型评估与对齐等研究,期间与许润昕、刘天宇等人多次开展合作。到了2023年,一篇具有预示意义的著作在这个协作网络中现身——Math-Shepherd

AMP

Math-Shepherd

这项研究探讨在缺少人工标注的情况下,如何逐步验证数学推导过程。作者阵容包括王培懿、邵智宏、许润昕、代达劢、陈德里、吴俣等人。后来当R1的论文讨论过程回报模型时,Math-Shepherd已成为其溯源的先驱工作。站在今天回望,这些论文如同提前勾勒的草图。

代达劢和陈德里同样来自北大计算语言学的学术生态,但师承不同——前者追随穗志方,后者追随孙栩。成为DeepSeek同事前,两人已有论文联署。当《Label Words are Anchors》获得EMNLP 2023最佳长论文奖时,陈德里还在腾讯,这是他们名字首次并列;数月之后,这种协作扩展到了DeepSeekMoE的工作中。

DeepSeek到来之前,杨德健和吴俣已有多年的协作历史。在北航求学期间,二人共同发表了《Neural Response Generation with Dynamic Vocabularies》(AAAI 2018);2023年,两人先后加盟DeepSeek;2024年,他们再度共现于DeepSeek-Coder的作者表,随后又以核心贡献者身份进入了R1的18人核心团队。

他们的研究方向原本各不相同——事件分类、对齐机制、验证方法、代码与架构——但数年后,这些看似独立的问题竟在同一处汇聚了。

AMP

推理能力的前世今生

2024年2月,DeepSeekMath亮相舞台。相比数年后动辄数百人署名的阵容,这个11人的队伍显得格外精悍:邵智宏、王培懿、朱启豪、许润昕、宋俊晓、毕晓、张浩威、张明川、李宇琨、吴俣、郭达雅。一年后,这些名字毫无例外地悉数汇入了R1的作者班底。

这篇论文的分量不仅体现在署名。DeepSeekMath首次正式亮相了GRPO算法框架。相比传统PPO需要额外的评论家网络,GRPO改而利用同组回答间的奖励信号来计算相对收益,从而降低强化学习的计算代价。日后,这套方法成为DeepSeek训练技术的核心支撑。

不过,他们在共聚DeepSeekMath前走的并非同一条路。

有人来自传统语言学与对齐的研究堡垒——北大计算语言学系出身的许润昕,以及涉猎文本分类、对齐和奖励设计的王培懿;有人承载着代码研究的严谨基因,比如在微软期间领导过CodeBERT、GraphCodeBERT等代码智能标志性项目的郭达雅;还有人从「另一扇窗」进入——朱启豪在北大计算机博士阶段师从熊英飞,长期深耕程序生成、理解与修复,早期关注的是模型如何遵循语法生成代码、如何自动纠错。进入DeepSeek后,他的研究向代码生成和逻辑推理这两个方向自然延伸。

邵智宏则是数学、强化学习与工具应用交叉地带的典型代表。

邵智宏本科在北航完成,博士在清华读取,师从黄民烈。他的早期研究集中于文本生成、问答和对话系统,后来逐步转向工具调用、数学推导与模型自我完善的研究方向。

AMP

在他的个人学术主页上,DeepSeekMath被赋予了明确的定位:它为后续DeepSeek强化学习的GRPO架构奠定基础;而R1则进一步把这套思路规模化到海量强化学习。

有趣的是,在这个技术网络交织的过程中,许多关键合作甚至发生在加入DeepSeek之前。比如邵智宏与苟志斌的协作。

苟志斌在清华修习人工智能硕士学位,导师为杨余久。从2023年到2024年,他在微软亚洲研究院自然语言计算团队实习。直至2024年6月,他才正式投身DeepSeek。

AMP

然而在成为DeepSeek同事之前,两人已经开始联手攻克数学推理的难题。2023年他们完成了ToRA,随后发表于ICLR 2024。这项工作让语言模型在自然语言推理的同时,能够调用代码工具解决数学题。接着,他们又合作了CRITIC,让模型能借由搜索、代码等外部工具来检验和修正自己的推导过程。

AMP

待苟志斌加盟DeepSeek后,那些曾经在论文中被分别验证的研究内核,进入了一个完全不同量级的实验环境。半年时间里,他与邵智宏一起成为了R1的18名核心开发者。

相比清华、北大或微软亚洲研究院这些闪耀的机构标签,真正应该关注的是这群研究者彼此交织的学术网络。这张网连接着微软亚洲研究院自然语言组、北大计算语言学研究所、清华自然语言处理实验室,以及一批多年致力于代码、推理、对齐、工具使用等问题的年轻学者。他们可能师承各异,难以被定义为「同门」,但长期共现在相邻的论著、院所与学术圈层里。技术谱系到此不再是一棵清晰的师承关系图,而是一张持续延展、自我更新的网络。

将这群人的经历拼凑起来,会发现日后被统称「推理」的庞大能力,从一开始就没有单一的源头。有人从语言学出发,有人投身数学,有人研究验证机制,有人专攻强化学习,也有人长年与代码和程序逻辑为伴。他们拥有不同的技术语言,却最终撞上了同一个核心问题:能否让模型仅通过正误反馈,就自己探索出解题的路径?

DeepSeek-R1-Zero后来把这个问题推向了更激进的极限。它摒弃了传统监督微调的热启策略,直接让模型承受大规模强化学习的训练。R1论文里,他们把某个中期检查点出现的自我反思现象称作「顿悟时刻」。

如果把焦点从模型转向研究者本身,也能看到另一种更缓慢的「涌现」过程。最初分别研究语言、数学、代码、验证与强化学习的人,沿着各自的轨迹缓缓靠近。最终,他们汇聚成了一支推理能力小组。

AMP

多模态阵营的多元汇聚

与推理路线上清晰可见的学术渊源相比,DeepSeek的多模态团队呈现的是跨越不同技术范畴的融合图景。

这支队伍中,陈小康代表了最坚实的计算机视觉基础。陈小康在北大完成本科和博士学位,博士导师是曾钢。在迈向大模型之前,他长期致力于语义分割、目标检测、无监督视觉学习等研究。2024年4月加入DeepSeek后,他的个人主页明确标注了自己负责公司多模态团队。

AMP

刘星超则用另一套数学语境踏入这个领地。他在UT Austin修习博士,指导教师为Qiang Liu,专研概率推断与生成建模。他最具代表性的早期贡献之一是Rectified Flow:试图把生成过程里复杂弯曲的概率轨迹拉直,从而减少采样迭代数。

AMP

刘闻的研究历程则记录了从传统视觉向生成式范畴的逐步演进。2017年到2020年间,他与上海科技大学高盛华等研究者长期协作,从视频异常检测推进到人体动作转移和图像生成。

AMP

这群原本分散在不同研究机构、掌握不同技术方言的人,之前几乎毫无瓜葛;直到Janus、JanusFlow、VL2和Janus-Pro相继诞生,不同的研究积累被汇聚到同一个组织框架,在全新的模型结构中碰撞,完成了多次的交融。

AMP

模型与基础设施的深层耦合

由于公司内部将模型设计与基础设施紧密融合,DeepSeek还拥有一条难以用「研究」或「工程」简单标签概括的技术路线。

这条路线的演化,源于两类研究取向的逐步靠近:一类从模型设计向下探查,进入更底层的计算制约;另一类从系统与硬件出发,向上延伸进入模型设计的内核。

从上而下的架构优化,从下而上的系统延伸

先聚焦架构一侧。

高华佐和曾旺丁在DeepSeek-V2中被特别标注为MLA创新的关键推动者,他们选择在Attention机制层面做文章,把推理时不断增长的KV Cache尺寸压缩;代达劢沿着稀疏化的轨道推进,让MoE框架只激活部分参数来执行一次计算。

再看系统这一侧,赵成钢、邓成祺、李嘉实、黄盼盼、张立悦、周尚言、刘宇轩、何莹等人的名字频频出现在DeepSeek的训练系统与硬件优化的著作中。他们的研究生涯因此具有少见的连贯性——有人改动网络配置,有人调度机器间的数据流,有人想办法让计算和通讯互相掩盖彼此的等待时间。

到达V3阶段,这些之前分散在Attention、MoE、训练框架与集群系统中的优化,首次被完整地装进同一个模型。DeepSeek后来把这种方法论总结为硬件与模型共同设计在面向体系结构领域发表的论文中,他们把MLA、MoE、FP8和通信拓扑归纳在统一的叙述框架里,对这批研究者而言,GPU的限界不是模型研究的终局,而是起点之一。

两条线索的交汇:以mHC为缩影

mHC更直观地展示了两类研究者如何在同一个问题上相遇。

解振达涉足mHC前有着长期的视觉研究履历。2021年,他以第一作者身份完成SimMIM,用精简的掩码和像素重建策略探索视觉自监督;随后参与Swin Transformer V2,推动视觉Transformer朝更大规模和更高分辨率的方向拓展。在这几年间,他的名字逐渐从视觉、多模态研究过渡到DeepSeek的基础模型工作。

到了mHC,他处理的是一个更基础的层次:十多年来沿用的残差路径在网络不断深化时能否重新审视。mHC把残差流扩展成多条并行通路,然后用流形约束来管理信息在深层网络中的流动。审视解振达的研究轨迹,这次转变自有其逻辑延续:早前的问题是视觉Transformer如何放大规模;如今的问题定位在Transformer层与层之间最根基的连接机制。关注点降低了,但对模型构造与规模化训练的重视贯穿始终。

mHC的另一端汇聚着一批更早从「系统」起步的研究者。

2018年,清华在世界大学生超算竞赛参赛时,赵成钢还是参赛学生,而曹焕琦以研究生身份为队伍提供技术保障。竞赛规则要求他们在严格限制的能耗、CPU、GPU和时间框架内反复优化程序,让受限的计算能力发挥最高效率。

AMP

https://www.tsinghua.edu.cn/info/1173/17723.htm

此后,曹焕琦把这类问题扩展到更大的数量级。2022年,他以第一作者身份把图遍历扩展到281万亿条边和4000万个处理器核心,也参与了「八卦炉」等大规模预训练框架的设计。赵成钢则从学生超算跨入机器学习系统领域,先后参与DeepSeekMoE、Fire-Flyer、DeepEP和V3。研究对象从传统超算转向大模型,但他们始终关心的问题相似:当规模增长若干个数量级,那些不起眼的内存访问、通讯成本和同步开销,会在哪一刻吞噬掉系统效率?

多年后,解振达、曹焕琦和赵成钢的名字一起出现在mHC的署名中,身边还有代达劢、高华佐、曾王鼎等长期投身DeepSeek架构与效能研究的人员。这个作者组合也镜像了mHC的双重使命:一端重塑Transformer的拓扑关系,一端让新架构适应大规模训练。

一个算法公式能否进入大模型,取决于它能否经受集群级别的计算考验;那些曾在超算赛场上反复压缩程序开销的人,也已经来到重新构想Transformer架构的研究者身旁。

系统工程生态与人才梯队构建

当模型与系统真正耦合之后,下一个课题变成如何把这种能力体系化为一套持续运行的工程生态。

赵成钢成为了这个过程的关键枢纽。

赵成钢后来在清华大学交叉信息研究院获得硕士学位,导师高明宇从事计算机体系结构与机器学习系统研究。求学期间,他参与开发了Canvas,把神经网络架构搜索推进到核函数级别的粒度。那段较早的超算竞赛经历,又使他接触了MPI、并行程序编写和体系结构优化。

来到杭州后,这条研究轨迹得到了快速展开。赵成钢从DeepSeekMoE的模型架构工作切入,之后参与了专家分配通讯库DeepEP的设计,主导了矩阵运算核函数库DeepGEMM的研发,还成为了TileKernels的首要作者。模型中的专家调度路由,通过他的工作被层层翻译为通讯协议、低精计算和GPU指令集。

他的身边还有两位清华出身的年轻工程师。徐哲安从清华本科毕业后留在杭州,依次参与了DeepEP、DeepGEMM、V3、R1和mHC的开发;田睿在DeepEP V2中负责网络后端、弹性缓冲和Engram,并列入TileKernels的开发者名单。

田睿处理的是RDMA、GPU与CPU异构内存,以及跨设备通讯中的条件记忆模块。任何一个环节堵塞,问题都会沿着集群放大。赵成钢负责跨层规划,徐哲安连通通讯与计算层,还在本科阶段的田睿已经开始承担网络基础设施的工作。

刘胜与和徐陈皓的故事,为DeepSeek团队的代际传承提供了更生动的说明。两人都来自北京大学图灵班,进入DeepSeek时仍在本科阶段,学术热情聚焦于机器学习系统与底层性能优化。

刘胜与系2021级北大图灵班学生,科研指导教师为计算机学院金鑫,研究方向涵盖机器学习系统、编译器与分布式计算。他曾任北大超算队队长,率队赢得第十届ASC全球大学生超级计算机竞赛冠军。北大官方资料记载,他自学Transformer和CUDA,在金鑫的指导下参与开发大模型推理系统。

AMP

2025年加盟DeepSeek后,刘胜与参与了DeepGEMM的开发,进入DeepEP V2的性能优化小组。超算赛事培养的能力进而向大模型核函数的优化延伸。

徐陈皓的年纪更小。他于2022年进入北京大学信息与计算科学图灵班,获得过NOI银奖和两届北大程序设计大赛二等奖。加盟DeepSeek后,他以系统工程师身份参与DeepGEMM、DeepEP V2和TileKernels的开发,工作范围横跨矩阵乘法、通讯优化和核函数编程。

这个方向在他入职前已见端倪。2024年,徐陈皓专注研究异构计算环境下Ceph纠删码存储性能,随后从事Serverless计算平台的存储层优化。早期项目关注负载平衡、延迟指标和存储设计,进入DeepSeek后,研究范围逐步收束到GPU核函数的效能、稳定度与易维护性。

AMP

周尚言代表着北大系统方向的较早参与者。他于2016年至2020年在北大求学,在校期间活跃于信息学竞技和程序编程赛事,毕业后先入幻方,后转向DeepSeek。加入DeepSeek后,周尚言深化对通讯网络的研究,刘胜与和徐陈皓投身核函数优化,数代北大学子就这样汇聚进同一套训练基础设施的构建中。

伴随这套系统框架逐步完善,DeepSeek的组织边界也变得越来越难以用传统部门架构来描述。于星凯跨界多模态和R1的研究,吴俣从Math、R1延伸到VL2,马世荣同时参与强化学习和基础设施工作,代达劢、高华佐等架构研究者也持续进入新的项目协作。人员追随问题而流动,项目一变,作者序列就被重新排列。

对于一家很少对外发布组织架构的研究机构,论文由此成为一份带有时间印记的员工档案。DeepSeek的技术演化谱系,也正隐藏在这些不断变换的署名名单之中。一代代模型问世,这些研究者名字一次次重逢、相汇,最后拼凑出这家机构真实的面貌。


上一篇 2026/08/14 03:56
下一篇 2026/08/14 03:57

相关推荐

  • 纽约市长竟然用普通话「官宣」免费百老汇,背后有深意

    纽约市长曼达尼最近上传了一段普通话视频,为纽约市中学生免费百老汇观演项目宣传。这位来自乌干达、通晓多种语言的民主党市长,在这部41秒的短片中,用流利的汉语与观众互动。他的做法在网上引起热议,众多网友对他跨越语言和文化壁垒与民众沟通的努力表示肯定。该活动将向高中学生发放两千多张免费门票。

    2026/08/17
    00
  • 朝鲜劳工秘密:超6千未婚女性为何被批量外派?

    近年来,朝鲜在绕过联合国制裁约束下依然派遣劳工获取外汇。外泄资料显示2024至2026年初,朝鲜向中国吉林图们经济开发区输送约7000名劳工,超85%为未婚女性。朝鲜当局选择未婚女性易于集中管理。这些派遣活动与朝鲜劳动党「39号室」关联,后者是该政权重要的海外筹资部门。

    2026/08/17
    00
  • 全球乱局中的大棋手:揭秘中国2049战略如何重塑世界格局

    《费加罗报》深度分析:俄罗斯在乌克兰战争中日益依赖中国,北京从陪衬升至主导。中国巧妙利用全球混乱与冲突,通过俄伊等国学习战争经验,为2049年超越美国铺路。报告揭示中国如何形成以自身为核心的不对称关系网络,同时扩大对全球南方的影响力。

    2026/08/17
    00
  • 微软在华三十年:从拥抱到警惕的转身

    过去五年微软在华至少15家机构关停。这家科技巨头曾与政府亲密合作,如今在地缘政治、贸易战和本土竞争的三重夹击下陷入两难——留下需扶持字节跳动等出海企业,离开则失去中国顶尖人才的接触窗口。全球营收中中国占比仅1.5%。

    2026/08/17
    00
  • 西太平洋陷入无母困局:11艘美国航母为何还是不够用

    伊朗军事行动致美军航母部署承压,林肯号舰员超期服役身心俱疲。美国决定撤回亚太最后一艘航母华盛顿号赴中东接替,西太平洋陷入无母空档,引发地区盟国对美防御承诺的质疑,为中国展示影响力创造机遇。

    2026/08/17
    00

发表回复

登录后才能评论