OpenAI大牛的新创意:一个「不会说话」却能做决策的AI

OpenAI大牛的新创意:一个「不会说话」却能做决策的AI

TypeSafe AI创始人Diogo Almeida。 图片由AI生成

文|晓静

编辑|徐青阳

进入9月中旬,一个叫作Jev的创新模型在硅谷开发者圈掀起热议。

这个模型颇具颠覆性。它放弃了代码生成、文章写作乃至对话交互的能力,摒弃了大模型过去数年最核心的技能——自然语言文字生成,转而专注于一项核心职能:「判断」。TypeSafe将其理念概括为:「Decisions, not strings」——追求决策导向,摒弃文本冗余。

只需输入信息片段和若干预设问题,它便能立即输出选项判断、分值评估和概率指标。以客服邮件处理为例,Jev能够一次性完成多个决策:确定应转往何部门、评估事项紧急度、估测退款风险、判定是否需要人工接手。

这套看似「超级分类工具」的模型迅速吸引业界视线。根据Latent Space在9月16日发布的AI News,TypeSafe的产品发布后在Hacker News长期占据前排位置,共同创始人Diogo Almeida的宣传帖迅速累积逾420万浏览量、将近2万个点赞。

TypeSafe发布的性能数据令人瞩目。在所选工作流测评场景中,Jev相比基准模型最多快出193.6倍、成本低至其五百分之一,端到端响应时间仅为70至500毫秒,单个输入按百万Token计价仅需$0.042,输出部分免费计费。

这款产品背后的创业团队自带热度。Jev由新近浮出水面的三藩市初创企业TypeSafe AI研发,由Diogo Almeida、Erik Gafni和Sasha Sheng三位联合创办,最近刚获得DCVC领导的4000万美元种子融资,据Forbes援引的业内消息,当前估值达2亿美元左右。

Almeida此前供职于OpenAI研究部门,是2022年InstructGPT重要论文的核心作者之一,对后来被广泛沿用的RLHF训练方法的建立做出过关键贡献。OpenAI在GPT-4的致谢名单中将其记为「Foundational RLHF and InstructGPT work」的贡献者。

在离开OpenAI后,Almeida用两年光阴沉思一道难题:既然大模型的智能程度已如此之高,那么世界上为何大部分工作流程仍未实现自动化?

Jev正是他对这一问题的初步探索。

01

Agent的每个决策都必然要通过文本表达吗?

眼下的大型语言模型从根本上而言仍是一部性能强劲的Token生成装置。以电商应用Agent为例,打开界面后它需要决断下一步动作:应该点哪个按钮。标准流程是将页面情况提交给GPT、Claude或Gemini,模型对页面做出理解,再通过递推方式逐Token吐出应答,比如「按照现在的页面内容,我应当点击屏幕右下方的Checkout按钮」。系统再从返回文本中解析出Checkout,触发相应浏览器指令实现点击动作。

然而从系统工程的层面讲,真正需要获取的数据也许仅是「第三颗按钮」这一信息。

Agent运行过程中充斥着这样的场景:工单应该流向销售团队还是服务团队,这笔交易蕴含的风险是否为高位,检索返回的十条数据中哪一条最贴切。这一类操作固然需要模型展现出语义认知和决策能力,但对自由文本输出的依赖程度其实很低。

Jev恰恰就面向这类工作而设计。TypeSafe将其命名为「System One Model」,这一术语源自丹尼尔·卡尼曼《思考,快与慢》一书中System 1的概念——指那种迅速、凭直觉做出的判断。

「Jev」这一命名灵感源自经济学家William Stanley Jevons及其「杰文斯悖论」——当某项资源的利用效率提升、花销随之下降后,最终对它的需求反而会攀升。TypeSafe的设想是让相同的逻辑在AI领域上演:一旦「智能判断」的成本足够低廉,它就会广泛融入各式软件系统。

Jev目前的基础输出类型主要包含Choice、Score和Noul三种。

其中Choice用于从预设选项里挑选一个,Score负责输出等级评分或数值评分,Noul处理是/否二元判断并提供相应概率指标。举例来说,一个防风控制系统可以让Jev评估某位用户的退款可能性是否属于低、中或高等级,模型则返回「高风险75%」的结论。软件系统获得该结果后,能够直接利用常规程序代码来判定是否转入人工复查环节。

从这个视角看,Jev呈现为一条具备泛用性语义认知能力的「聪慧if条件语句」。这正是它与传统分类方法的根本不同之处。

传统分类系统也能够展开垃圾邮件甄别、交易欺诈识别或图像分类工作,然而一旦要加入新的任务场景,通常意味着必须重新组织数据、进行新一轮训练或对模型做适配调整。Jev的理想是保留大模型原本具有的通用性常识储备和少样本泛化潜能,同时把模型的返回值精简为系统实际所需的判定选项和置信概率。

这种需求在Agent驱动的新时代被明显地放大了。一项繁复的Agent操作任务可能包含数十次甚至数百次的模型调用,其中不少都归属于路由转发、数据分类、验证检查以及流程状态评估。假若这一切都依赖于功能完备的生成型大模型去处理,那么模型既要完成理解,还要投入资源生成一份最后根本不会有人看的文字内容。这类多余的资源开销看起来确实无足轻重。

AMP

图:TypeSafe演示显示,Jev直接返回多项结构化判断,而传统LLM仍在逐步生成文本。官方示例中,前者耗时0.114秒,后者为8.566秒。

02

仅仅是分类模型吗?

GPT、Claude和Gemini这些大规模语言模型基于自回归的生成机理。模型需要先接收输入信息,进而按照之前所有Token来推断下一个Token,因此一条文本必然要依照时间流逐步进行解码。这类架构赋予模型极大的生成空间,它既可以撰写长篇、创作代码、给出阐述,也能执行高难度的逻辑推演,然而代价在于生成流程的严格顺序性制约,产出的篇幅越长,所需完成的解码迭代步骤一般也越多。

Jev采取主动的措施去限定输出的范围。开发人员可以事先设定回答的选项集合,比如refund_risk={low, medium, high},模型仅需评估三种选择各自的可能性大小,毋需另外吐出「我判定该用户具备很高的退款倾向」这类自然语言陈述。TypeSafe还声称Jev融入了新型的parallel sampler机制,能够在单一请求内同步处理多项彼此独立的提问。举个例子,对一张发票文件进行处理时,能同步完成类型判断、风险检测、审核等级确定和人工复核必要性判定。

这正是揭示Jev性能数据的钥匙。

因此它与最近获得越来越多关注的Flash技术路线存在显著分野。Google Gemini Flash、DeepSeek V4.1 Flash一类的模型本质仍属生成式大模型,靠着改进架构设计、调节激活权重、优化KV Cache策略和深化推理引擎等途径来降低单个Token的计算耗用,本质上在回答「怎样加快Token输出速率」的问题。

Jev的做法则是从源头削减token数量。假定一个Agent把任务跑完需要调用模型100次,这之中只有10次涉及到复杂的方案制定和文本输出需求,其余90次纯粹是工具调度、输出排序、危险评估以及任务进展确认,那么通篇采用同一款大规模生成模型明显留出了不少优化的余地。

在可预见的未来,更切合实际的Agent架构很可能会采纳分层的模型搭配方案:将高难任务分配给Frontier Model去完成,日常逻辑推理交由Flash模型处理,像路由指挥、数据分类、逻辑校验这样的高发判断需求则交由Decision Model承担,那些规则确定的逻辑部分维持由常规程序代码来执行,而一个Harness层来协调这些各不相同的能力之间的协作。

这恰恰是Jev最具产业洞察意义的地方,它所启示的是「所有需要智能介入的任务都必然需要调用生成式大模型」这个假设并不总是成立。

AMP

图:TypeSafe称,Jev会为每次判断返回经过校准的概率,软件可以据此设置自动执行阈值:高置信度任务直接处理,低置信度任务转交人工复核。

03 幻觉真的为零吗?

TypeSafe官方网站最突出的宣传卖点之一是「Zero Hallucinations」。这个表述很容易被解读为Jev攻克了困扰大模型已久的「幻觉」难题,事实上它所说的仅仅是能确保返回结果不会跳出预先设置的类别范围。

AMP

图:TypeSafe公布的官方评测显示,Jev在其工作流测试中以更低成本获得接近前沿模型的准确率;右图则显示,Jev的工具调用类型错误率为0%

举个例子来说,设若开发者设定模型只可从「猫、狗、鸟」这三类中进行选择,Jev就不会蹦出「大象」这样的答案,也不可能输出一段程序没法解析的杂乱文本。

正因为如此,TypeSafe着重强调其type error能够达到0%。这对于实战生产流程而言确实意义重大,特别是当Agent执行自动化API调度、进行数据库操作以及驱动工作流时,返回值结构越是稳定可靠,下游系统的接入就越顺畅。

然而类型精确未必代表判定精确。倘若输入明确是一只猫,但模型给出「狗:97%」的答案,虽然没有出现type error,可业务后果却南辕北辙。因此,将「Zero Hallucinations」正确地阐述应是:系统对返回格式和数据类型施加的限制,还缺乏充分证据表明Jev在事实层和判定层已排除了错误。

Jev更加值得业界聚焦的核心之处其实在于TypeSafe自主提出的RLCD——Calibrated Decisions强化学习体系,也就是指向校准决策的强化学习方法。根据团队官方的阐述,RLHF的要点在于迎合人类的喜好偏向,RLVR则依靠可验证的奖励机制来强化数学演算、编程等方面的工作表现,而RLCD所针对的问题是「模型对自己的判定把握有多大,这种把握程度的数值指标是否真正靠得住」。

这一点对Agent大规模进入生产环节来说至关重要。想象这样一个场景:某模型的真实判断准度只达80%,然而它经常会宣布99%的置信指数,这样的数值几乎无从用于驱动自动化决策流程。理想的状态应该是,当模型向某批工作表示90%的置信度时,实际有大约90%的决策应该是准确无误的。只要达成这个要求,公司才可以制定有效的分类制度:高置信度的工作直接运行,中等置信度则提交给性能更优的模型再次检查,低置信度的任务才最后转交人工处理。

一旦RLCD的效果能由第三方进行独立认证,其实际价值将非常可观。一款经过精妙校准的Decision Model,本身足以胜任Agent系统中的流量分配器职责。

但是,TypeSafe目前还没有公布完整学术论文,更未对参数量级、网络拓扑、练习数据集和充分的消融分析做出说明。业界由此还缺乏足够信息来判定RLCD代表的是全新的教练方法论,抑或是把强化学习、概率矫正等现有技巧的工程层面整合。相同地,TypeSafe对parallel sampler和System One Model的阐述如今也信息不足,基于现有材料很难推断Jev已然完成了如Transformer、Attention或MoE这个量级的革命性技术突破。

04 「193倍快、444倍便宜」的真相?

Jev的传播历程中,还有一组吸引广泛目光的性能指标。TypeSafe披露的类生产工作流测试结果显示,Jev在自己设定的四大工作流类别上的平均分数大约为67.8%,某些先进模型的得分则在68%—74%这个范围;其间,Jev每个个例的花费能降至大概0.0004美金,返回用时约为0.4秒。企业依此发布了最高可达193.6倍的速率增长和444.6倍的成本降低这组数字。

这批数字绝对不应当被简单地理解为「Jev具有接近GPT水准的聪明程度,并且速率翻高了193倍」。

一方面,这批任务本身便属于Jev最为拿手的System One类操作,即分类操作、选项挑选、分数分配和决策判定。如果让一个量身为结构化决策打磨的模型去和通用生成型模型比拼这类工作,那从一开始就会扩大Jev相对的强势地位。另一方面,眼下最为完整的测验主要由TypeSafe自身执行,公司也坦诚工作流测验由内部的model capabilities小组来筹划,难免会有倾斜;部分参照答案是取材于性能更强模型的生成结果,并未全数采用人工标注的ground truth。

「193.6倍」和「444.6倍」这两组数据是在特定操作、特定模型对标中得出的最高差幅,根本代表不了Jev在各种操作上都能获取如此幅度的优化收益。

它所证实的更多是一个质朴的道理:若某项操作的最后产品仅为一项选择或一个可能率值,那具体为决策优化而打造的模型确实有可能比功能全备的生成型大模型的花销少得多。

更关键的一点是,Jev应该去做基准比对的竞争对手也绝非仅有GPT、Claude那一类高成本的前沿解决方案。如今的Flash轻量模型已能与JSON Schema、Structured Output、Function Calling和Constrained Decoding等机制配套使用来产生结构化产出。传统的分类装置以及embedding向量+分类的组合架构的经济成本说不定会更具竞争力。

因此,真正足以令人信服的第三方测试应当将Jev、Flash+Constrained Decoding方案、常见的分类系统和Embedding分类器等各种选项共同放到一批真正的应用工作中检验,以Accuracy(分类精准度)、Calibration(置信值校准效果)、Latency(反应时长)、Cost(投入成本)、OOD Robustness(分布转移鲁棒性)和Batch Scaling(成批处理容量)这些维度进行横向比照。遗憾的是,迄今还不存在这样的比对测试。

这究竟是名气大于价值的炒作,还是确有真材实料的技术创新?业界的讨论已经变得沸沸扬扬。

AMP

图:一位Reddit用户调侃「行业又重新发现了分类模型」,另一位认为,Jev更像是加入了LLM级语义理解能力的通用分类器,如果成本和速度数据成立,意义并不小。

Jev切实挖掘到了Agent模型时代的一条现实痛点:AI系统的「聪慧能力」是否务必依托于耗资巨大的文字生成工艺来落地。是否存在其他的、更优越、更坚实、更精巧的处理途径?

不过,也存在开发工作者直言地告诉腾讯科技:「天下没有白吃的宴席。」


上一篇 2026/09/18 00:32
下一篇 2026/09/18 00:34

相关推荐

  • 七年陨落:中国男篮如何失去了「不能输」的底气

    9月18日,中国男篮以77比97不敌日本队,连续两届亚运无缘决赛。这个20分的历史最大分差背后,隐藏着七年持续衰落的轨迹。从2018年亚运冠军到如今的连连败北,曾经的「非赢不可」已成奢望。

    2026/09/19
    00
  • 爆火的「河北内卷网」背后:开发者欲破低价怪圈的野心

    「河北内卷网」在短短数日间突然蹿红,用户数突破17万,信息发布过万条。这个名字精准诠释了河北制造业的现状:产能强、利润薄、渠道掌握权有限。多位开发者顺势推出小程序、网站和公众号,声称要突破低价竞争怪圈。

    2026/09/19
    00
  • 国内互联网版图剧变!字节超越腾讯阿里,为何却执意不敲钟上市?

    最新消息显示字节跳动已成国内最大互联网公司,营收利润超腾讯阿里之和。2026年上半年营收1200亿美元、净利200亿美元,估值接近6000亿美元。尽管海外增速达50%前景广阔,但字节坚决拒绝上市,张一鸣因此成为亚洲首富。这一决策背后隐藏着怎样的战略考量?

    2026/09/19
    00
  • 「飞碟」来了!义乌这款黑科技为何刷屏全网

    一款独特的飞碟形电动垂直起降飞行器在义乌展厅亮相并登上热搜。这是深圳智航自主研发的纯电动飞行器,可承载两名乘客,搭载全透明座舱实现360度观景,采用六轴十二桨涵道风扇确保平稳飞行。目前处于适航认证阶段,预计三年后获得载人许可。该飞行器专注文旅娱乐领域,已在全国40多座城市进行数十场演示飞行。

    2026/09/19
    00
  • 万亿矿产为何难救困局?阿富汗经济突围的现实阻碍

    阿富汗拥有1万亿美元矿产资源,塔利班欲借此突破经济困境,却面临物流不畅、产业链缺失、基础设施薄弱等多重挑战。与多国达成合作意向后,能否真正实现矿业价值转化成为关键。

    2026/09/19
    00

发表回复

登录后才能评论