- 发布日期:2026 年 9 月 3 日
- 最后核对:2026 年 9 月 3 日
- 当前状态:有效;
gemini-3.8-flash 已在老张API控制台上线,具体可用分组和实时价格以控制台为准
老张API现已上线 gemini-3.8-flash,通过 Chat 按量计费。2026 年 9 月 3 日控制台显示的价格为:输入 $0.75 / 1M tokens,输出(补全)$3.75 / 1M tokens。准备迁移的用户应先确认目标令牌分组可见该模型,再用真实提示词完成小流量验收。
关键事实
Google 官方规格说明的是上游 Gemini API 能力,不自动证明老张API当前线路已逐项兼容所有原生参数、内置工具、输入模态或响应字段。工具调用、结构化输出、多模态、流式响应和 Thinking 参数请使用目标令牌分别验收。
谁需要关注
- 正在为长时间软件工程、代码重构或复杂 Agent 工作流选择 Flash 模型的开发者;
- 当前使用
gemini-3.6-flash、gemini-3.7-flash 或更早 Flash 型号,并准备做同任务对照测试的团队;
- 需要在输入、输出质量、延迟和 token 成本之间重新评估模型选择的生产应用。
不使用 Gemini 文本模型的图像生成、语音或视频生成工作流不受本次上线影响。已有稳定生产调用也不需要立即迁移;本公告新增模型,不代表旧模型同步下线。
如何调用 Gemini 3.8 Flash
先在控制台模型与价格页面确认目标令牌分组可见 gemini-3.8-flash,再发送最小文本请求:
成功验收至少应确认:响应包含可用文本、响应中的模型与请求一致、调用日志记录输入与输出 tokens、实际扣费符合当前控制台价格。需要工具调用、结构化输出、多模态或流式响应时,再为每项能力增加独立测试,不要只凭一次 HTTP 200 全量切换生产流量。
迁移注意事项
Google 官方迁移说明指出,Gemini 3.8 Flash 默认 Thinking 等级为 medium,支持 low、medium、high,但 minimal 会返回错误。Google 原生 API 还要求迁移时检查已弃用的采样参数、thinking_budget、candidate_count 和对话轮次格式。
这些原生规则不应直接等同于老张API的 OpenAI 兼容协议。迁移时建议:
- 只替换测试环境中的模型 ID,保留已验证的回退模型;
- 使用代表性请求比较答案质量、首 token 延迟、总耗时与 token 用量;
- 单独测试工具调用、JSON 输出、图片或文件输入以及流式返回;
- 核对调用日志中的实际扣费后,再分阶段增加流量。
常见问题
Gemini 3.8 Flash 的正确模型 ID 是什么?
使用 gemini-3.8-flash。不要自行添加 -preview、-thinking 或 -nothinking 后缀;只有控制台明确列出的兼容别名才可使用。
当前价格是多少?
2026 年 9 月 3 日老张API控制台显示:输入 $0.75 / 1M tokens,输出(补全)$3.75 / 1M tokens。价格可能随线路或活动变化,批量调用前请复核控制台,并以调用日志中的实际扣费为准。
Gemini 3.8 Flash 是正式版吗?
是。Google 将 gemini-3.8-flash 标记为 GA 和稳定模型。老张API是否对某个令牌分组开放,仍需在控制台单独确认。
可以只改模型 ID 就迁移吗?
可以把替换模型 ID 作为第一步,但不能因此认定完整兼容。生产迁移前还需检查提示词效果、Thinking、工具调用、结构化输出、流式响应、token 用量和延迟。
旧版 Gemini Flash 需要立即停用吗?
不需要。本次是新增模型上线公告,不是旧模型下线通知。若旧模型的质量、延迟和成本仍满足要求,可以继续使用并安排对照测试。
证据来源与相关文档