Gemini 3.8 Flash 测评,低价编码模型稳不稳
这篇 Gemini 3.8 Flash 测评核对价格、编码能力和 Cyber 访问限制,并用范围遵循、构建结果与总 token 判断是否值得从 3.7 升级。
Gemini 3.8 Flash 的首发 API 价格是每百万输入 token 0.75 美元、输出 token 3.75 美元,与 3.7 Flash 的首发价格相同。Google 把它定位为更擅长编码、代理任务和多步推理的工作模型。这个组合很有吸引力,真正影响迁移的却是另一件事,模型能否在复杂仓库里守住修改范围,并且用可见结果证明任务完成。这篇 Gemini 3.8 Flash 测评围绕这条线索展开。
3.8 Flash 会在难任务上多想几步
Google 表示,3.8 Flash 会在复杂任务中执行更多推理步骤,也会反复调用工具检查结果。官方公布的 DeepSWE 与专业领域基准都有明显提升,其中 HLE-Verified 得分为 54.9%。这些分数来自发布方,适合说明研发方向,不能直接推导你的项目成功率。
更多推理也会增加 token 消耗。Google 明确提醒,高 effort 档位可能为了提高表现使用更多 token。计算效率优先时,可以降低 effort,3.7 Flash 也会继续受到支持。价格相同只表示单位 token 价格不变,一次任务的总费用仍可能提高。
近期公开用户反馈与这个变化相符。有人认为 3.8 比 3.7 更愿意规划和验证,也有人遇到它在只要求改两项时继续处理其余事项。社区体验没有统一结论,却指出一个值得测量的问题,模型的能力提高以后,范围遵循是否也足够稳定。
Cyber 版本不在普通模型列表里
Gemini 3.8 Flash Cyber 使用相近的基础能力,针对漏洞发现和自动修补做了强化。Google 公布的外部修补基准 pass@1 为 47.2%,并称它已用于 Chrome 和 Google 内部代码安全工作。
这款模型通过 Fairwind Program 向受信任的政府部门、关键基础设施运营方和软件维护者开放。普通 AI Studio 或 Gemini App 用户不能把它当作 3.8 Flash 的高级档直接切换。一般编码、代理和专业分析使用普通 3.8 Flash。符合防守方条件的机构才需要申请 Cyber。
开放范围会影响文章标题和采购判断。把 Cyber 的安全基准写成普通 Flash 用户拿到手的能力,会造成错误预期。两者共享研发基础,部署权限和安全措施仍然不同。
怎样测试编码可靠性
准备五个已经有正确答案的仓库任务,包括小范围修复和跨文件修改。每个任务写明允许修改的目录、必须运行的命令和完成证据。模型结束后检查 git diff、测试输出和未授权文件变化。
先用 medium 或较低 effort 跑一轮,再对失败任务提高档位。记录总 token、完成时间、测试通过率和越界修改次数。若 high 档让模型多做很多工作,却没有提高验收通过率,回到较低档更合算。
对代理任务,指令要把停止条件写清。比如只修两个编号问题,完成后运行指定测试并停止。用户反馈显示 3.8 仍可能扩大修改范围,所以人在合并前要看 diff。模型自己报告完成不能替代构建与测试结果。
适合谁升级
正在使用 3.7 Flash 做代码理解、数据分析和工具调用的团队值得优先试。单位价格没有上涨,测试成本容易控制。若现有 3.7 工作流经常因为推理过早结束而失败,3.8 的额外思考可能直接减少重试。
只做短文本生成或高度固定的批处理时,3.7 仍有价值。它的行为已经经过现有评测,切换模型会带来回归测试成本。安全团队也不要因为看到 Cyber 发布就调整普通 API,先确认组织是否符合 Fairwind 的访问条件。
当前结论
Gemini 3.8 Flash 以较低单价提供了更积极的推理与工具使用,适合拿真实编码和代理任务做迁移测试。它的风险集中在总 token 上升和任务范围扩大。把文件范围、测试命令和停止条件写进任务,再以通过率和越界次数判断,结论会比看官方榜单可靠得多。
文中工具
