同一天,两间公司都在说同一件事:模型够快了。差别是,Google 的东西已经在你手上,OpenAI 的还锁在名单后面。

Google 周四推出 Gemini 3.7 Flash,锁定写程序与自动化工作流程,直接全面开放,目前已在超过 160 个国家上线。这颗模型可吃下最多 100 万个输入 token(约 75 万字),输出上限 6.4 万 token,文字、图片、视频、音频、PDF 都能处理,还能调用工具、操作电脑界面。实测上,它跑完同一个内部编码测试只花 2 分 13 秒,前一代 Flash 得花超过 5 分钟,速度差距肉眼可见。Google 自己的评测数据显示,Gemini 3.7 Flash 在 18 项测试中有 11 项领先 Claude Sonnet 5、GPT-5.6 Terra 等对手,Code Arena 网页开发项目拿下 1,588 Elo,企业流程测试 AutomationBench 得分 30.4%——这是 Google 自家方法论算出来的数字,领先幅度多少要打折看待。

价格也砍了一半:年底前每百万输入 token 0.75 美元、输出 3.75 美元,是上一代 Flash 原价的一半。这个优惠价到 12 月 31 日就结束,之后会涨回 1.5 美元和 7.5 美元,即便如此,以 Google 的模型来说仍然便宜。

OpenAI 同一天预览的 GPT-5.6 Sol Ultrafast,其实不是新模型,而是把原本就存在、经过红队测试强化过提示注入防御的 GPT-5.6 Sol,接上 Cerebras 的芯片重新跑一遍。输出速度最高冲到每秒 750 个 token,换算大约每秒 560 个英文字,比 Sol 原本的速度快了 14 倍。Cerebras 的晶圆级芯片是关键——这个速度快到让语音助理可以在讲电话的当下同步思考。问题是,这个版本目前只先开放给 OpenAI API 的一小群客户,属于邀请制,还没公开任何跟其他模型的正面评测数字。

Jane Street 的 AI 工程师 John Crepezzi 在 OpenAI 的发布文里说,这个速度「让模型有了不同的用法」;Podium 产品负责人 Courtland Lykins 则说这对他们的语音系统「非常宝贵」,「彻底改变了通话体验」。这些都是客户引言,不是公开跑分。

值得一提的是发布的时间点。Google 真正的旗舰模型 Gemini 3.5 Pro 至今没有发布日期,距离 3.6 Flash 推出已经三周,而且就在 DeepMind 高层改组——Demis Hassabis 让位给副手 Koray Kavukcuoglu——之后没几天。OpenAI 这边选择用租来的 Cerebras 算力冲速度,而不是等自家基础设施跟上。两边都在用「快」转移话题,但只有 Google 把东西真的交到开发者手上。

Gemini 3.7 Flash 现已全面开放;GPT-5.6 Sol Ultrafast 仍为邀请制预览,尚无公开发布时间。