在工程代码编写、法律财务领域的长篇幅文档、安全漏洞的发现与修复,以及长时视频内容的理解等方面均展现出卓越能力
最高可输出100万token的内容!单次交互即可完成一部体量达数十万字的综合性文献撰写
这一回谷歌研发了一套续航性能出众的超大型AI助手,专长于处理百万级长篇写作、大规模代码库解析以及庞大商业文件审核
不过!大伙儿先别急着高兴
该产品现阶段仅限谷歌认可的安全伙伴进行使用,一般开发者连基础API接口都没办法获得。所以你会发现网上很多人的称赞实际上都缺乏根据
况且根据第三方评估平台Arena的数据,Gemini 4在前端开发类任务中的表现只是略胜于Qwen产品,反而不敌GPT-6 sol,莫非这又是典型的「高分低能」现象?
倒不如让我们回顾一下Google往年的一些风波
Gemini 1.0 Ultra曾因为发布内容而引起质疑。
发布会上谷歌说Gemini Ultra在MMLU这项测试中得了90分,声称已经超越人类专业人士,彻底战胜了GPT-4。殊不知真实情况是,他们让模型针对同样的题目进行了32轮的运算,最后才将最常出现的结果作为最终答案
再就说到Gemini 3.8 Flash这一版本的失利
当时采用的是旧版Terminal-Bench 2.1的测评方案,Gemini3.8 Flash取得89.4分的不俗成绩,位列全球第二。但一旦切换到新版本Terminal-Bench4.0的评估标准,分值就大幅下跌至19.1分,成了最后一名!



因此,不如再等一段时间看看情况发展。待到普通用户能够真实体验之前,Gemini产品系列仍然摆脱不了北美用户戏谑的「豆包」标签。即便宣传内容再浮夸,若不经过大规模用户检验,也就只能作为一种参考意见存在。