沉寂许久的「美国豆包」,突然掏出了Gemini 3.8

天才制造惊叹,豆包占领生活

#AI模型#Gemini#产品观察
沉寂许久的「美国豆包」,突然掏出了Gemini 3.8

昨天,Google 发了 Gemini 3.8 Flash。沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 1

不仅有3.8Flash,还有一个面向网络安全的Cyber模型,我看到这个名字的第一反应:

3.8?Gemini 已经更新到 3.8 了?

这感觉有点像,半年没见的朋友突然给你发消息,然后跟你说她要结婚了。

说实话,我自己很久没有关注Gemini了,最多用用香蕉,所以看到gemini居然到3.8了,还挺惊讶的。

然后我去了解了下,发现Gemini3.8,挺强的。

沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 2

现在在Gemini网页端打开就能选择到这个3.8Flash。

「模型跑分」

它支持最长100万 token 输入、6.4万 token 输出,可以处理文本、图片、视频、音频和 PDF,还能调用搜索、代码执行、函数以及预览状态的计算机操作。推理强度也能在低、中、高三个档位之间调节。

来看下跑分,相对 Gemini 3.7 Flash,3.8 的提升主要是把已有能力做得更稳、更能完成长任务。

基准3.7 Flash3.8 Flash提升Vals Finance Agent V259.0%61.4%+2.4 个百分点HLE-Verified53.6%54.9%+1.3 个百分点Harvey 法律 Agent8.8%10.0%+1.2 个百分点

在需要高级分析和报告的定量和专业领域方面,3.8 版本的Flash在测试中的表现优于 3.7 版本以及其他前沿模型。

在 HLE 验证测试中,3.8 版本的 Flash 取得了 54.9 的评分。

沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 3

另外就是是这个3.8的Cyber网络安全版本,在找漏洞等一些网络安全标准测试中,cyber版本的得分甚至超过了GPT-5.6Sol。沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 4

下面是一些跑分的官方图,稍微翻译了下贴在这:沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 5

但,跑分归跑分,3.8flash在一些社区的测试中,反响却很一般。

比如这个对比。

沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 6

对比Kimi-K3、Claude opus5、GPT5.6Sol的编程渲染场景能力,结果效果最拉跨。

虽然如此,但3.8的能力相较于3.7,确确实实提升了很多。

下面这个图,是有人用它复刻wyy音乐的界面网页,感觉3.8flash谢谢前端还是很ok的。 

沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 7图像沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 9

「为什么叫美国豆包」

这名字妙就妙在,它不完全是骂人。

你说它不行吧,Gemini也辉煌过,感觉啥都有,也有视频模型VEO,也有图片模型香蕉,免费额度还经常挺大。

你说它特别强吧,每逢模型大战,大家聊的又总是OpenAI、Claude,或者某个突然杀出来的国产模型。

沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 10

它像一个每次考试都坐在前三排,但从不抢着上台领奖的人。

然后,沉寂许久。

至少在很多普通用户的注意力里,是这样。

可 Gemini 3.8 出来之后,我去翻了一下 Google 最近的更新节奏,发现事情好像完全不是这么回事。

虽然,Google 昨天正式发布的Gemini 3.8 Flash 和Cyber。

但,其实你计算下时间,按照 Google 自己的说法,这是它们六周之内发布的第三个 Flash 模型。Gemini 3.7 Flash,甚至才发布三周。

沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 11

六周,三次更新。

这不叫沉寂。

生产队的驴都不敢这么迭代。

但除了3.8,其余的都没怎么有水花,很多人都说谷歌是在挤牙膏,但我觉得Gemini 最近走的却是另一条路,它没有把全部筹码押在一个顶尖模型上。

像Flash、Flash-Lite、Audio、Image、Omni,以及各种面向具体任务的变体,谷歌是想做成一个综合能力兼备的超级APP。

沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 12

这也是「美国豆包」这个外号最准确的地方,而是一种很微妙的产品气质。

一种深入人心,直接好用,老人小孩都能用的AI产品气质。

Gemini 3.8 想改的,恰好就是这个印象。

在Google 对 3.8 的描述里,有一句我觉得特别重要:它在复杂任务上会执行更多推理步骤,反复调用工具,并检查自己的工作。

更高的推理档位可能消耗更多 token。

更多token,这就不得不聊到Gemini 3.8 这次最值得论道的:

价格。

「API价格」

在 2026 年底前,它的 API 预售价是每100万输入 token 0.75美元,每100万输出 token 3.75美元。Google 还保留了 AI Studio 的免费层。到了 2027 年,标准价格会翻到1.5美元和7.5美元。

沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 13

Gemini 3.8 与3.6、3.7当前同价,相比3.5输入降价50%、输出降价约58%。

Gemini似乎也开始在价格上赛跑了。

一个模型如果只强20%,但一次任务贵5倍,它很难成为真正的基础设施。

反过来,一个模型如果在多数任务上足够强,价格又低到开发者敢让它反复试错,突然就值得了。

这才是 Flash 最可怕的地方。

「谷歌在布局一盘大棋」

Google 其实有一套更夸张的牌。

搜索、Android、Chrome、Workspace、Cloud、地图、YouTube,再加上 AI Studio 和 Gemini API。

沉寂许久的「美国豆包」,突然掏出了Gemini 3.8 · 图 14

如果 Gemini 只是一个竞技场里很聪明的聊天框,这些牌只是背景板。

如果 Gemini 变成便宜、可靠、可以调用工具的工作马,这些牌会全部变成它的四肢?

可能现在的Gemini没这么顶尖,但,当哪一天这一切都完善起来…

所谓「美国豆包」,突然就不再像一句嘲讽了。

更像一句危险的产品定义。

这很像浏览器,也很像汽车。

成熟产品不会每次升级都重新发明方向盘。真正建立壁垒的,是那些不值得单独开发布会的东西。少一次崩溃,多跑完一条流程,工具调用不再抽风,长任务不再半路失忆。

它们很无聊。

也最值钱。

所以我觉得,Gemini 这段时间真正的变化,不是终于从沉寂里醒了。

而是 Google 可能已经不太在乎,每次更新能不能抢走全网24小时的注意力。

它在抢另一件东西。

默认位置。

默认进入搜索,默认进入办公套件,默认进入 Android,默认成为 Agent 背后的那个模型。用户甚至不需要记住 Gemini 更新到了 3.8,就已经在使用它。

一个产品最强的时刻,未必是所有人都在讨论它。

也可能是所有人都懒得讨论它了。

像搜索框,像输入法,像云服务。

像电。

天才负责制造惊叹。

豆包负责占领生活。


以上就是本期内容,感谢你看到这里,如果对你觉得文章不错!⭐标!期待我们的后续!欢迎投稿,如你需要,一起交流~>/撰稿:惊云>/供稿请点击公众号菜单栏