上个月,全球计算机存储领域的顶级学术会议——第23届USENIX文件与存储技术会议(FAST),在美国加利福尼亚州圣克拉拉举行。
本届大会上,来自中国的人工智能初创公司月之暗面和清华大学团队合作发表论文并提出Mooncake系统,获得埃里克·里德尔最佳论文奖。
香港《南华早报》报道认为,Mooncake的效率比之前的基准提高了五倍,降低了对计算资源的需求。在美国围堵打压中国获取先进AI芯片的背景下,这一成果有助于对抗美国芯片禁令、减少对英伟达等企业GPU的依赖。
本月,无问芯穹和上海交通大学、清华大学共同提出的视频生成大模型推理IP工作——FlightVGM,也在国际顶级会议上获奖。他们在可重构逻辑集成电路(FPGA)上实现了视频生成模型的高效推理,在AMD V80 FPGA芯片上,该系统性能提升了30%,能效比英伟达RTX 3090 GPU高出4.5倍。
《南华早报》称,中国AI科研团队用工业芯片取代英伟达高端GPU而获全球大奖,预示着全球优化AI硬件的竞赛出现了重大转变。
这篇获奖论文由清华大学计算机系教师章明星、武永卫、郑纬民团队和月之暗面公司合作发表,名为“以键值缓存为中心的以存换算大语言模型推理架构”。第一作者为博士生秦若愚。
清华大学介绍,Mooncake是月之暗面大语言模型Kimi的底层推理服务平台。Mooncake采用以键值缓存(KV Cache)为中心的分离架构,高效利用了集群中未充分利用的硬件资源,构建了独立的KV Cache缓存池。其核心创新在于最大化吞吐量。
实验结果显示,Mooncake在处理长上下文输入的场景中表现出色。与基线方法相比,Mooncake将有效请求处理能力提升了59%至498%。目前,Mooncake已在数千个节点上运行,每日处理超过1000亿个token。
一段时间以来,美国政府对向中国出口先进AI芯片实施了一系列限制措施,包括对英伟达高端芯片的多项禁令。
2022年10月起,美国实施AI芯片出口限制,英伟达为中国市场特供A800和H800芯片。2023年10月,美国商务部扩大了高级AI芯片定义,将A800和H800也列入禁售名单。
美方围堵打压意图压制中国AI计算能力与模型开发。然而,这些限制反而促使中方研究人员和企业通过软件优化和创新数据结构来挖掘现有芯片潜力。
清华大学MADSys实验室已在GitHub上启动Mooncake项目,该项目已被阿里巴巴和蚂蚁集团等公司内部采用,并融入开源社区。
今年1月,中国AI初创公司深度求索发布的开源大模型DeepSeek-R1,使用英伟达H800 GPU驱动的数据中心进行训练,成本低廉却效果拔群,引发多国关注。
月之暗面由清华大学助理教授杨植麟创立。其最新产品Kimi k1.5利用强化学习加速扩展训练,支持最多200万字符的中文语境。
FAST是计算机存储领域的顶级学术会议,被CCF认定为A类国际学术会议。
除了FAST获奖外,中方团队近期在其他顶级会议上也频频获奖。3月3日,在国际可重构计算领域顶级会议“FPGA 2025”上,无问芯穹等团队共同提出的FlightVGM获得最佳论文奖。这是FPGA会议首次将该奖项授予完全由中国大陆科研团队主导的工作。
这项工作首次在可重构逻辑集成电路上实现了视频生成模型的高效推理。与英伟达3090 GPU相比,FlightVGM在AMD V80 FPGA上实现了1.30倍性能提升与4.49倍能效提升。
《南华早报》认为,在挑战英伟达AI硬件主导地位的过程中,中国研究人员在现成工业芯片上训练出超越高端GPU的尖端视频生成模型,预示着全球优化AI硬件竞赛的重大转变。