BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年09月03日

注册 / 登录

谷歌AI牌价一分没涨,每个任务的账单却贵了四成

美东时间9月2日,谷歌和Meta在同一晚交出了各自的新旗舰:Gemini 3.8 Flash和Muse Spark 1.3。前一天,Anthropic刚刚发布Claude Fable 5.1。一圈发布看下来,牌价最刺眼的对比出现在谷歌身上——输入0.75美元、输出3.75美元每百万token,与三周前的3.7 Flash一字未改,缓存读取0.075美元。

但如果据此得出"AI又便宜了",就和实际发生的账单变化正好相反。第三方评测机构Artificial Analysis的实测口径显示,Gemini 3.8 Flash完成一个任务的平均价格约为0.58美元,而3.7 Flash大约是0.40美元——单价分文未涨,每个任务却贵了约四成。原因不难解释:这一代模型在复杂任务上会更主动地"卖力干活",平均每个任务吐出约4.8万token,比上一代多出约三成,智能体的交互轮数也在增加。

牌价和账单开始分道扬镳,才是这个晚上真正值得记住的事。

牌价不动,账单反涨:被忽略的40%

Gemini 3.8 Flash在软件工程基准DeepSWE v1.1上的得分约74%,与Claude Opus 5的74.0%基本咬平,而上一代3.7 Flash只有65.3%。性能一次涨了八九个百分点,价格却原地踏步——这在模型市场上通常被读作"变相降价"。

问题在于,Agent时代的成本从来不是由单价单独决定的。真实支出等于"单价×消耗量÷任务成功率",三个变量里,单价是厂商写在公告上的,后两个只有在实际工作流里才看得见。Gemini 3.8 Flash多干了30%的活,把单价持平带来的好处全部吃掉还倒贴。Artificial Analysis同时给出的三档数据更能说明问题:high档每任务0.58美元、medium档0.41美元、low档0.24美元,智能指数分别为59、57、52,而3.7 Flash为56。也就是说,想要更高的智能档位,就得按次付更多钱。

还有一层时间差没被足够强调:华尔街见闻在报道中把0.75/3.75美元称为"引导价",优惠只持续到今年年底;爱范儿进一步指出,2027年1月1日起该价格将恢复至1.5美元/7.5美元。换句话说,今天的"低价"本身是有到期日的。

三条路线同时推进:降价、省token、取消token

同一晚Meta的选择更能说明行业已经意识到这一点。Muse Spark 1.3没有主打降价,而是主打"少做无用功":Meta称,与1.2版本相比,新模型在编码任务中工具调用次数减少约20%,token使用量减少约25%。在DeepSWE v1.1上,媒体转述的得分是75.4%,而1.2版本约55%。省下的20%调用和25%token不体现在任何一张价目表上,却会直接落进客户的月度账单。

第三条路线来自一家初创公司。据凤凰科技转述《连线》(WIRED)报道,名为Mostik的公司尝试让不同模型之间直接交换潜空间表示,而不是各自生成自然语言再互相阅读——其创始人Sasha Malysheva的比喻是,两台电脑直接传数据,不必先打印成纸再由对方扫描识别。在一个实验中,7530亿参数的GLM-5.2与可运行在手机上的40亿参数Qwen 3.5桥接后,混合系统的能力落在两个模型之间,推理成本仅为完整GLM-5.2的二十分之一。该公司首席科学家、菲尔兹奖得主Stanislav Smirnov自己也承认,目前甚至还没有成熟的数学语言来描述不同模型之间的共同表示。

三条路线指向同一个判断:token单价这条降价曲线已经接近尽头,接下来的成本战场在"浪费"二字上——浪费的推理步骤、浪费的工具调用、浪费在语言这一低效传输格式上的开销。

中国厂商在打另一场价格战

把视线移回国内,价格战并未停火,只是打的不是同一张表。据财联社8月报道,OpenAI在7月30日宣布GPT-5.6 Luna输入价从每百万token 1美元下调八成至0.20美元、输出从6美元降至1.20美元;Anthropic在7月下旬以5美元/25美元推出Opus 5,只有自家Fable 5的一半,并在8月中旬取消了原定9月生效的Sonnet 5涨价。Silicon Data的token价格指数显示,7月中旬以来的近一个月内,客户采购美国头部实验室模型的实际支出下降了近四分之一。

阿里云也在9月1日前后调低了价格:8月31日起,Qwen3-VL-Rerank在北京地域的文本输入单价从每百万token 0.7元降至0.5元,多模态输入从1.8元降至0.5元;此前8月27日,阿里云还宣布下调Qwen3.8-Flash的计费单价。值得注意的是,这一轮国内下调集中在检索重排、轻量Flash这类外围环节,而不是旗舰模型的主干价格。

而真正决定企业选谁的是那个除法。同一批评测显示,GPT-5.6 Luna最高档的性能接近DeepSeek V4 Flash最高档,但单任务成本约为后者的两倍;DoorDash、Airbnb已经改用中国模型来控制AI开支。性价比的竞赛已经从"每百万token多少钱"迁移到"把活干成一次要多少钱"。

什么应用现在才算得过账

把三层口径拆开,很多模糊的判断会立刻清晰。第一层是牌价,可以砍价,可以等促销,但它决定不了成本;第二层是单任务实际账单,目前大致落在几毛到几十美元的宽区间里,且随模型"勤快程度"上下浮动;第三层是任务完成率,一次跑废重跑两次,成本就是三倍。只有三层一起看,才能判断一个Agent应用是不是真的算得过账。

按这个标准,最先跨过经济可行性边界的是那些高频、单次价值低、过去因为要调用旗舰模型而必然亏本的批量任务:大规模代码库巡检、存量文档的结构化改写、安全漏洞的批量扫描与补丁验证。谷歌同日发布的Gemini 3.8 Flash Cyber已经透露了方向——华尔街见闻援引的数据称,其CWE-Bench pass@1达47.2%,接近当前领先前沿模型的47.8%,Chrome团队的有效补丁量提升2.6倍,第三方安全厂商Wiz测得其召回率提升7.5%到9.7%、成本低2.3到5.2倍。安全审计这类过去按人天计价的工作,正在被换算成"每次调用几美分"。

反过来,那些需要连续长时间稳定推进、失败代价高的任务,短期内依然要用最贵的模型。Gemini 3.8 Flash在另一项真实计算机操作基准OSWorld 2.0上只有59.0%,而对照模型为75.4%;在Terminal-Bench 4.0上为19.1%,对照组51.8%。同一个模型,跑熟悉的代码任务接近世界第一,换到陌生环境操控电脑就明显掉队——"便宜"从来不是全局属性。

接下来值得盯住的指标也很具体:明年初谷歌引导价到期后的真实价格;Artificial Analysis"每任务均价"这类指标会不会取代token单价成为厂商主打卡片;Meta宣称的开源权重与更大规模模型何时落地;以及Mostik这类潜空间通信能否从一份演示变成可复现的公开结果。这几件事里任何一件兑现,"完成一个任务多少钱"这条曲线的斜率都会再变一次。

参考数据来源

  1. Google DeepMind · Gemini 3.8 Flash 官方模型页 · 2026年9月 · https://deepmind.google/models/gemini/flash/
  2. 华尔街见闻 · 才三周Flash就换代!谷歌上新两款Gemini 3.8:编程与推理能力升级,网安模型瞄准自动修复 · 2026-09-02 · https://wallstreetcn.com/articles/3780934
  3. 凤凰网科技 · Gemini 3.8 Flash上线:性能接近Opus 5,价格不变但任务更贵 · 2026-09-03 · https://tech.ifeng.com/c/8w6nKm0IrUg


版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。