Gemini 3.8 Flash 发布:更努力工作,但可能让你花更多钱
2026-09-03
·
AI资讯
·
有封面图
Google 发了一个新模型,叫 Gemini 3.8 Flash。
官方文案是:"这个模型工作更努力。"
但下一句是:"你可能因此花更多钱。"
同价但可能更贵
Gemini 3.8 Flash 和上一代 3.7 Flash 定价完全一样:$0.75/百万输入 token,$3.75/百万输出 token。
但 Google 在发布说明里加了一句:"模型可能会消耗更多 token 来最大化性能,尤其是在高强度模式下。"
翻译一下:模型思考得越多,消耗的 token 就越多。定价不变,但单次请求的实际成本可能上涨。
这和"工作更努力"是同一个硬币的两面——模型在复杂任务上做更多推理步骤、迭代调用工具,输出的质量提高了,但你的账单也跟着涨了。
用户的一个调侃在社区里传开了:"Google 给你打折,但让你用更多。"
3.8 做了什么改进
The Verge 9月2日报道,Gemini 3.8 Flash 在复杂任务上做了更多推理步骤,并且在需要的时候迭代调用工具。
这不是新能力——Anthropic 的 Claude 系列、OpenAI 的 o1/o3 系列早就有了"推理时计算"的概念。但 Google 把这个能力塞进了 Flash 系列,定价和上一代一样。
对开发者来说,这是好事:同样的价格,更强的推理能力。但 Google 的说明暴露了一个问题——"可能更贵"是模型的隐形成本,不是写在定价页上的数字。
为什么这个细节值得关注
AI 模型的定价一直在降,这已经是行业规律。GPT-4o 比 GPT-4 便宜,Claude 3.5 Sonnet 比 3.0 便宜,DeepSeek 更是把价格杀到了几分钱。
但 Gemini 3.8 Flash 的案例说明了一个新趋势:模型能力越强,消耗的 token 越多,实际成本不一定跟着降。
这和云服务商的逻辑有点像——带宽是"无限"的,但实际账单由使用量决定。AI 模型的使用量不是固定的,它取决于任务的复杂度、模型的能力边界、用户设置的推理强度。
开发者如果想控制成本,需要关注的不只是每百万 token 的单价,还要看平均每次请求消耗多少 token。
Google 给了一个选项:如果想控制 token 消耗,可以继续用 3.7 Flash。但这样做的代价是放弃了 3.8 的推理改进。
这是一个取舍,不是免费升级。
这篇文章来自 The Verge(9月2日,作者 Stevie Bonifield)。
评论区