该机构的资深分析人士罗伯特·利在最新报告中披露,中美顶级AI模型在各项基准测试中的成绩差异已经压缩到仅3%的水平——这一数字在今年5月还是9%,而在年初时更是高达15%。这一转变始于上月深度求索推出的V4.1 Flash版本。
这些进展引发了业界对美国AI技术长期领先地位能否得以保持的广泛质疑。随着中国模型性能的持续攀升,行业专家认为中国厂商在全球市场份额中的占比势必会继续提高。
根据LiveBench的最新评测数据,深度求索V4.1 Flash已登上全球排行榜的第六名,这也是该创业公司自去年推出推理能力突出的R1以来最好的战绩。该排行榜通过测试AI系统对各类问题、谜题和实际任务的解答能力来评分,其方式与评估人类智力商数相类似。值得注意的是,进入前15名的模型中,国内企业开发的产品已占据了三个席位。
在最新一轮的LiveBench评测中,深度求索获得了81.1的分数,与美国Anthropic旗下最强模型的83.4分之间仅有2.3个百分点的差距。分析人士由此指出,这说明深度求索的技术水平已经能够与Anthropic和OpenAI等美国龙头AI企业的主力产品相提并论。
然而分析师也提醒投资者,排行榜上的排名并非一成不变的。更为重要的是,即便技术指标领先,商业化变现仍然困难重重。这是因为中国模型制造商近期饱受关于模型蒸馏指控的困扰,正在承受来自美国越来越严苛的监管管制,并存在被禁用的风险。
在盈利前景方面,专家预测中国AI产业的整体盈利之日可能要延迟到2030年左右。这是由于国内市场已经成为一个拥挤的竞技场——超过1100家企业都在开发大语言模型,使得各家公司为了争夺利润极低的接口调用生意而疲于奔命,这几乎不可能让哪一家企业获得稳固的市场竞争地位。
分析人士认为,中国AI企业要实现长期可持续发展,关键在于降低市场竞争的激烈程度,通过产业整合完成行业洗牌,并建立更加科学合理的商业定价体系。