文丨晓静
编辑丨徐青阳
Astra在9月3日亮相以后,与芯片相关的股票随之走强。芯片指数SOXX在随后一个交易日上升3.5%,镁光科技股价攀升6.1%,西数上扬11.9%。三天后的9月7日,亚洲市场也出现共鸣,韩国综合指数KOSPI拉升4.61个百分点,三星电子涨幅达5.7%,SK海力士更是跃升约8%。
此前对AI投资过度和算力需求触顶的顾虑,曾使芯片板块长期处于波动状态。这一波反弹被MarketWatch直接解读为Astra「重燃存储芯片交易热情」。
《The Nvidia Way》著作者、曾任Barron’s科技版记者的Tae Kim提出了更具进攻性的观点:过去四年间AI的算力需求可能正在经历第四次指数级暴增。
前三轮增长分别源于聊天机器人、推理模型和代码Agent,本轮则可能由Astra重点演示的计算机视觉操作来驱动。Kim的推理框架如下:聊天机器人拉动了数亿用户的推理需求,推理功能强化后每次回复都需更多算力,代码Agent让模型从单次生成转向连续数十分钟乃至数小时的工作流。而今,计算机视觉操作将这类持续型Agent的适用范围,从开发者拓展至Excel、Blender、CAD软件、Power BI及网页浏览等一般白领工作场景。
Kim的长期研究主要聚焦Nvidia与芯片领域的投资机会,其创办的Key Context通讯的核心逻辑就是科技投资判断,最近的观点文章也总体看好AI基础设施。所以「第四轮指数增长」本质上是由看涨算力市场的投资者率先提出的假设,尚未获得产业实践的验证。
不过其出现的时刻值得玩味。
在Astra正式推出前不久,Agent技术路线才经历过一轮「遇冷」的质疑:虽然解决简单问题的表现在升级,但涉及长链条、多层次决策以及真实应用软件的场景下,其稳定度始终无法达到预期,这进一步强化了市场对于算力需求已近天花板的担心。若Agent技术无法突破现有瓶颈,那么继续扩充算力的论证就显得站不住脚。
但Astra是否真的能够打破这层困局呢?

01
这里说的「指数增长」的三轮浪潮
这里说的「指数增长」的三轮浪潮,描述的是随着AI应用范式每一次改变,每个用户所能驱动的计算资源消耗都会跃升到新高。
ChatGPT首次把推理能力引入了普通大众的日常使用;推理类模型则为单个问题投入了更充分的内部计算资源;而代码Agent则能将一条简单命令扩展成包括代码阅读、修改、检验、错误诊断和重新调整的完整迭代链条。
同时Agent正在打破传统的「单人日工作八小时」的自然约束。
OpenAI在9月6日披露的内部统计显示,截至8月中旬,研究部门使用频率处于五十分位数的人员,每天通过Coding Agent产生的推理成本按公开价目折算超过600美金;排在九十分位数的人员日均超7000美金。按Business Insider对OpenAI数据的梳理,7月的中位水平仅约162美元,这意味着一个多月的涨幅接近3.7倍。

图:截至8月中旬,OpenAI研究部门每一个人工工作日已匹配上3.1个Agent工作日;中位研究员日均调度的Agent推理资源按API市场价折算超过600美元
这种折算把内部消耗量转换为市场价格对标,所反映的实际上是「单用户的推理工作强度」。
在6月之前,该部门所有Agent的累计运行时长还不足研究人员的实际工作时间;但到8月中旬时已然反转,每一个人工工作日已匹配上3.1个Agent工作日。与此同时愈来愈多的研究员在并行调度多个Agent。
由此可知,在进入Agent时代之后,每个用户的身后已然存在多个能够并行运转的「数字员工」,这些进程已然摆脱了「依赖人工输入速率」的自然约束。目前一个人足以驱动三四个乃至更多Agent持续运作,甚至还能让Agent自主启动子Agent。
因此算力需求的衡量维度也可能随之演变:转而关注每个用户同步运行的Agent数量以及这些Agent的每日工作时长。
02
计算机视觉操作拓宽了适用范畴
虽然代码Agent的扩张速度可观,但其边界依然清晰,采纳多Agent工作流的使用者主要还是开发人员,而开发人员在全球知识劳动力中仅占少数。
计算机视觉操作技术则把这一可能的市场空间大幅拓宽。Astra上线后,Kim进行了一次亲身实验。由于他本身不熟悉Blender操作,他便指挥Astra在Mac上查阅航天飞机资料、启动Blender软件并独立完成三维建模。大约十分钟的时间里,一份能够三百六十度旋转展示的模型就此诞生。
标准的对话流程是「输入-推理-反馈」三步;代码Agent则是「分析代码-推理-改进-验证-重新思考」的循环;到了计算机视觉操作则更为复杂,涉及「观察屏幕-解析界面-选择动作-完成操作-获取回馈-重新审视-核实成果-纠正缺陷」的完整闭环。
人类用时十分钟的工作,AI可能需要经历数十次的视觉解析、逻辑推敲和动作指令。
若这项技术从浏览器与代码工具的应用范畴拓展至Excel、Salesforce、SAP、Power BI、Photoshop、CAD乃至各类企业级系统,那么其适用对象就会涵盖坐在办公电脑前的几乎全体知识工作者。
这正是Kim口中「第四轮需求浪潮」的本质所在:
代码Agent的目标是吞噬程序猿的屏幕前工作时间,计算机视觉操作则志在夺取所有上班族的电脑办公时间。
然而迄今为止,这仍旧停留在理论层面。
OpenAI未曾发表Astra发布后的计算机视觉操作任务统计,也没有给出单用户日均Token消耗、GPU驱动率或推理吞吐的时间序列数据。所以目前还缺乏确凿的依据来证实「Astra已触发第四轮算力扩张」这一判断。
03
供给压力是否已然出现?
Astra问世后,部分开发者论坛涌现出难以定量却值得关注的反馈意见:来自不同地理区域和账户等级的用户,其服务体验似乎产生了明显偏差。
不少亚太地区的开发人员指出,近来ChatGPT与Codex的反应速率下滑,复杂任务的完成度与稳定性也不如美国用户体验明显。部分用户甚至用「智力退化」来形容这种现象。
但这其中的部分反馈并非完全源于主观印象。
9月4日,OpenAI的官方服务状态页明确指出亚太区域经历了性能衰退事件,波及ChatGPT、Work、Codex Cloud等多项服务。随后的第四天,OpenAI又对外宣布与得到Nvidia支持的数据中心商Firmus缔结长期合作协议,将从马来西亚两个数据中心获取专用算力供应。

与此同时,暂无迹象表明OpenAI因Astra流量猛增而对亚太用户调低推理成本预算或启用了性能较弱的替代模型。
那么所言的「亚太服务衰退」中,可能掺杂了三类不同的诱因:地域级网络基建与链路难题、账号层级的风险管控与流量限制,以及流量高峰下的弹性资源分配。用户端呈现的结果则都可能是速度变缓、失败率上升、工具链条中断,甚至多步任务的最终输出质量下滑。
然而这些信号仍然为我们观察AI算力是否趋紧提供了一扇新的窗口。
伴随着模型持续消耗能力的上升,算力供应紧张可能最先表现为地理位置和账户间的延时抖动、错误率上升和服务质量浮动。
问题的关键在于,这一论断当前仍缺少一组决定性的数据支撑:
相同的模型版本、相同的用户套餐、相同的任务需求,在各地区间的初始Token响应延迟、总耗时、功能调用成功率及任务最终完成率是否确实存在系统性偏差。
未待这些数据公开前,「服务衰退」仅可视作一条线索,尚不足以成为算力告急的直接证明。

图:9月8日,开发者晒出GPT-6 Astra「容量已满」的提示,表示自己的4个账号均无法正常使用,系统建议用户切换其他模型。业内人士Tibo在转发时不禁感慨「we are so back(我们又回来了)」,将「模型满载」视为AI应用热度重新升温的信号。
04
资本再次开始下注
虽然Astra推出后的真正算力消耗走势尚未披露,资本市场却已抢先下注于「AI需求远未达到顶点」的叙事。
MarketWatch的数据显示,Astra面世后,美国芯片指数基金一时飙升逾3.5%,三星、SK海力士、铠侠等存储芯片厂商的表现尤为突出。海外媒体的评述甚至直言这一波行情是Astra「重新燃起了存储芯片交易热度」。
值得一提的是,本轮涨势中最抢眼的并非英伟达,反而是存储领域。
若计算机视觉操作确实演变成为长期运行的Agent任务形态,那么所需的资源升级远超GPU运算这一项。扩充的语境窗口、KV缓存扩容、多Agent并发、虚机池、浏览器及应用环境,都将进一步驱高对HBM、DRAM、CPU、网络通信及存储容量的需求。
因此资本市场最近的投资逻辑并不单纯是「GPT-6变得更强」,而是核心思考:更卓越的模型能否诱发用户去采购更多算力。
这也恰好是本轮AI基础设施叙事与经典软件业态最大的分歧所在。
传统软件的优化通常会压低单个用户所需的服务器开支。
而生成式AI则可能陷入反向的「杰文斯悖论」怪圈:模型效能愈强、任务达成率愈高,人们便愈发倾向于把海量、冗长、复杂的工作流推给AI处理,结果是算力的总消耗量依旧不断攀升。
但值得小心的是,资本市场本身也有其利益所在。
AI基础设施板块早已经历过一轮涨跌循环,芯片公司股票也曾因投资支出过热、云服务商现金流恶化而大幅缩水。所以Astra引发的数日反弹仅能表明资本方再度押注,远不足以坐实「第四轮算力需求已然来临」的论断。
05
一道经济难题
Kim这一判断要想真正落地,还需要经得起三项更加务实的拷问。
其一是稳定性的验证。
实际的商业场景并非公开演示。Agent是否能够在数小时内稳定控制ERP、财务系统或工程工具,并在遭遇突发弹框、权限调整或数据刷新的干扰下保持执行的准确性,这是截然不同的难题。
其二是经济性问题。
计算机视觉操作完成一小时的人力电脑工作需要支付多少成本呢?
倘若AI用10美元能替代50美元的人工成本,那么需求定会大幅释放;但若成本高达100美元,市场想象空间就会大打折扣。
OpenAI研究部600美元/天的消耗既展现了Agent创造需求的庞大潜力,也反射出当下这类工作流的成本仍可能高企。
其三则是:
计算机视觉操作是否可能最终自我消蚀掉部分需求?
当下AI需要观察屏幕、定位按钮,根本原因在于现存软件的设计对象是人类。若Salesforce、Microsoft、Adobe乃至各企业系统着手对外开放API、MCP与Agent接口,许多操作就毋须再去模拟鼠标键盘动作。
更有可能的最终形态乃是计算机视觉操作与工具调用的融合:存在结构化接口的系统直接相连,而对于缺乏接口、难以升改的陈旧系统以及开放式网页,则仍依靠视觉交互来处理。
因此计算机视觉操作真正解锁的市场,并非「让AI永久充当电脑使用者」,而是凭借「我受人类授权可操控你的应用,你无权干涉」这一武器,让Agent硬生生冲破现有生态壁垒。Agent终得以步入自动化技术此前触及不了的最后一块工作地盘。
这才是Kim口中「第四轮指数爆发」中最需验证的内核,「计算机视觉操作仅是打入市场的锤子,还是代表又一轮深层次的范式升级」?
在GPT-6的加持下,那个因Agent能力瓶颈而日渐乏力的算力增长叙事,会否再度获得说服力?
资本市场重启了下注。
自生成式AI引爆以来,市场持续向唱衰「算力扩张」的声音放出硫磺炮,本次会有不同的结局吗?