
大半夜的,Google 发布了 Gemini 3.8 Flash 新模型。
这已经是他们六周之内发的第三个 Flash 模型了,从 3.6 到 3.7 再到现在的 3.8,差不多每三周就来一版,我真的已经写不过来了……

每次新模型发布,大家最关心的无非就是两件事,能力怎么样 和 价格贵不贵。
先看价格。Gemini 3.8 Flash 的单价一分钱没涨,还是每百万 token 输入 0.75 刀、输出 3.75 刀。
这是什么概念呢?
Claude Opus 5 是输入 5 刀、输出 25 刀,也就是说 3.8 Flash 的单价只有 Opus 5 的七分之一左右。
再看看能力。最能说明问题的是 DeepSWE v1.1 这一项,它专门考查模型能不能自己端到端做完一整套长周期的软件工程任务。
3.8 Flash 拿了 73.7%,上一代 3.7 Flash 只有 65.3%,而贵了七倍的 Claude Opus 5 是 74.0%,两者只差 0.3 个百分点!

考察 Agent 终端编码能力的 Terminal-bench 2.1 测评上,它拿了 89.4%,是全场第一,超过了 Opus 5 的 89.1%!

单价只有七分之一,跑分却跟顶级旗舰模型不分上下,光看这些数字,我对这个模型还是有点期待的。
但这次发布最有趣的地方,恰恰藏在单价的背后。
Google 一直在强调 3.8 Flash 跟上一代 同价同速,可第三方评测机构 Artificial Analysis 拿真实任务测下来,单任务消耗的 token 从 3.7 万涨到了 4.8 万,涨了将近 30%,单任务的实际成本也从 0.40 刀涨到了 0.58 刀,整整贵了 40%。
更要命的是首字延迟,它吐出第一个字平均要等 13.3 秒,而同类模型的中位数只要 2.99 秒。
所以有网友制作了这样一张梗图:

官方自己在博客里交代了原因,说 3.8 Flash 会「works harder」,遇到复杂任务会在背后反复推理、多次调用工具、自己纠错。
那 Gemini 3.8 Flash 模型到底怎么样呢?
老规矩,好不好用还是得自己试了才知道。
接下来我会在 Cursor 里使用 Gemini 3.8 Flash 模型,通过 3 个全新设计的项目 来测试它的实际编程能力:
测试方法很简单,我在 Cursor 里同时起了 3 个子 Agent,每个 Agent 负责一个独立项目、一个独立目录,全程不需要人工干预,让 AI 自己跑到底。

大家可以猜猜看,跑完这 3 个项目要花多少钱?答案在结尾揭晓。
平时我们天天跟 HTTP 打交道,但在浏览器地址栏敲下回车之后、页面显示出来之前,中间那一串过程大多数人只在架构图上见过,从来没见过它动起来。
第一个项目我就让它做一支能在浏览器里全屏播放、还能导出成视频文件的 3D 动画短片《一个 HTTP 请求的一生》,把这个过程讲明白。
提示词里我把片长卡在 40 到 60 秒、分成四段,其余的全部放开,不指定任何技术栈,只要求它用 Context7 查所用 3D 库的最新文档,而且片子里所有的模型和场景必须用代码生成,不许用任何外部的图片或者模型文件,其他的全部留给 AI 自己编排。

拿到任务之后,AI 先用 Context7 查了 Three.js 里三维样条曲线和管道几何体的最新用法,然后花了大约 14 分钟做完。
整个过程它不光用 Canvas 2D 纯代码画出了发光芯片和机房指示灯的贴图,还自己写了个自动化脚本逐帧抓取渲染画面,再转码成视频。
来看看成品效果。
短片开场是一台发光的显示器,模拟用户在地址栏敲入网址然后按下回车的瞬间。

回车按下去,镜头立刻拉进微观电路,第一幕 DNS 递归查询开始,发光的数据包沿着光纤在根域和顶级域名服务器之间穿梭。

镜头再推近权威域名服务器,芯片亮起并返回解析出来的 IP 地址,第一幕的动画流畅度还不错。

第二幕切换到 TCP 三次握手,数据包变成金色脉冲在客户端和服务端之间往返,先是发起 SYN 报文。

服务端收到之后回复了 SYN+ACK,画面上两端的节点跟着闪烁确认。

客户端再回传 ACK,三维世界里立刻贯通出一条双向的数据光纤隧道,这个连通感做得挺到位。

其他镜头我就不挨个儿介绍了,最终完整的网页呈现在屏幕中央,天上还放起了烟花。

通过这个任务,我发现确实如 Google 官方所说,AI 主动做了不少事情。
比如网页 Canvas 导出视频的时候,默认只会录到三维画布,外面所有的 HTML 字幕都会丢掉。它自己搭了一套双层复合录制管线,把底部字幕和协议标签直接压进了视频帧里,导出来的 MP4 可以直接发到视频平台。
不足之处也很明显了,整套前端效果真的不好看!!!
我印象中前端设计能力一直是 Google 系列模型引以为豪的亮点,怎么这次这么拉了,无论是配色还是字体都透露着浓浓的 AI 味儿,甚至有些字体根本看不清……
第一个项目考察 AI 对镜头和叙事的编排,接下来这个就纯粹看图形算法、物理建模和性能优化能力了。
我让 AI 做一个 3D 烟花燃放的仿真网页,做球形、牡丹、柳条三种形态,升空和炸开都要按真实的重力和空气阻力来算,不许用预先做好的动画糊弄,爆炸的时候还要有声音。技术栈依然完全放开,让 AI 自己想办法。

AI 这次花了大约 11 分钟,用 Context7 插件查了 Three.js 动态缓冲顶点属性的用法,然后自己写了一套着色器。
先看初始场景,夜幕下是城市天际线的剪影,下方水面还有微光在荡。

第一种是经典的金色球形烟花,它用斐波那契球面算法算初速度,炸开之后是一个非常规整对称的球壳。

第二种是牡丹,它做成了双层结构,外层是主花瓣、内层是星蕊,炸开的一瞬间花团锦簇。

第三种柳条烟花最考验 AI 的物理建模能力,火星受重力和空气阻力双重作用往下垂,燃烧时间长达 3.5 秒以上,拖出一挂金色的瀑布。

接下来是这道题的重头戏,验帧率。我要求的是上万颗粒子维持 60 帧,AI 在压测模式里直接把同屏活跃粒子拉到了 40000 颗,是我要求的 4 倍,画面依然稳稳跑在 120 帧上。

总体来说,AI 完成的还是不错的,但还是老问题,整个前端 AI 味儿太足了,用了很多 Emoji 图标,没有什么让人惊喜的地方。
前面两个项目都在看 AI 的图形表现力,接下来试试它的全栈能力。
我写文章的时候经常要配图,截完图要压缩、转格式、上传、再手动复制链接,比较麻烦。
所以我打算让 AI 做一个自用的图床,截图拖进去或者直接粘贴进去,它自动把图片转成 WebP 格式压缩,然后返回一条能直接贴进 Markdown 的链接。

大约 5 分钟,AI 就完成开发并且跑通测试了。它选的是 Express 配 Sharp 做图像处理,数据库用了轻量的 better-sqlite3 并开了 WAL 模式。
来看看成品效果。
界面是暗色玻璃拟态的风格,顶部是已存图片、节省体积和压缩比率三个统计,中间是拖拽上传区。

传一张图上去,它自动转成了 WebP,体积从 87.87 KB 压到了 12.13 KB,压缩了 86.2%,同时给出了可以直接复制的 Markdown 代码。

把同一张图再传一遍,它立刻通过 SHA-256 认了出来,弹出黄色提示,并且直接把上次的链接还给我,没有额外占用磁盘空间。

点击图片卡片,可以打开大图详情弹窗,能看到原图和 WebP 的体积对比、分辨率,还能一键复制不同格式的链接。

支持按照文件名称实时搜索图片,也能按照时间和体积正反序排列。

勾选卡片左上角的复选框就进入批量管理模式,支持全选,删除前还有二次确认。

整个系统的功能还是很完整的,美中不足的是,如果我传一张特别长的代码截图进去,图片墙在算瀑布流高度的时候卡片底部偶尔会错位。
3 个项目全部跑完了,我个人对 Gemini 3.8 Flash 还是有点失望的。
虽然能够顺利完成全栈开发任务,但这已经是现在新模型的门槛了,关键是新模型在前端的表现上有点拉,尤其是我昨天刚测试完 Claude Fable 5.1,跟顶级模型的差距非常明显。
而且测试中,我也发现了 Gemini 3.8 Flash 模型首字延迟的问题,起步速度略慢于 Grok 4.6、DeepSeek V4 Flash 等模型,不知道你们有没有遇到?
最后揭晓开头的谜底,这 3 个项目花了多少钱。
答案是 30 块钱左右,如果直接用官方的 API 可能会更便宜一些,你觉得这个价格怎么样?

虽然肯定比 Claude Opus 5 这种顶级模型便宜,但是跟 GLM、Kimi 等国产模型相比,基本上没有什么价格优势。而且同样的任务,交给 GLM-5.3、Kimi K3 来做,效果可能更好。
所以测完这次之后,我应该不会再用 Gemini 3.8 Flash 这个模型了。
怎么回事,谷歌那么强大的公司,怎么在大模型领域被其他公司按在地板上反复摩擦呢?

OK 就分享到这里,本文会收录到我免费开源的 《AI 编程零基础入门教程》,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。
开源指路:https://github.com/liyupi/ai-guide

我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~
也欢迎在评论区聊聊:你觉得 Gemini 3.8 Flash 怎么样?
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。