Skip to main content
  • 发布日期:2026 年 9 月 3 日
  • 最后核对:2026 年 9 月 3 日
  • 当前状态:有效;gemini-3.8-flash 已在老张API控制台上线,具体可用分组和实时价格以控制台为准
老张API现已上线 gemini-3.8-flash,通过 Chat 按量计费。2026 年 9 月 3 日控制台显示的价格为:输入 $0.75 / 1M tokens,输出(补全)$3.75 / 1M tokens。准备迁移的用户应先确认目标令牌分组可见该模型,再用真实提示词完成小流量验收。

关键事实

Google 官方规格说明的是上游 Gemini API 能力,不自动证明老张API当前线路已逐项兼容所有原生参数、内置工具、输入模态或响应字段。工具调用、结构化输出、多模态、流式响应和 Thinking 参数请使用目标令牌分别验收。

谁需要关注

  • 正在为长时间软件工程、代码重构或复杂 Agent 工作流选择 Flash 模型的开发者;
  • 当前使用 gemini-3.6-flashgemini-3.7-flash 或更早 Flash 型号,并准备做同任务对照测试的团队;
  • 需要在输入、输出质量、延迟和 token 成本之间重新评估模型选择的生产应用。
不使用 Gemini 文本模型的图像生成、语音或视频生成工作流不受本次上线影响。已有稳定生产调用也不需要立即迁移;本公告新增模型,不代表旧模型同步下线。

如何调用 Gemini 3.8 Flash

先在控制台模型与价格页面确认目标令牌分组可见 gemini-3.8-flash,再发送最小文本请求:
成功验收至少应确认:响应包含可用文本、响应中的模型与请求一致、调用日志记录输入与输出 tokens、实际扣费符合当前控制台价格。需要工具调用、结构化输出、多模态或流式响应时,再为每项能力增加独立测试,不要只凭一次 HTTP 200 全量切换生产流量。

迁移注意事项

Google 官方迁移说明指出,Gemini 3.8 Flash 默认 Thinking 等级为 medium,支持 lowmediumhigh,但 minimal 会返回错误。Google 原生 API 还要求迁移时检查已弃用的采样参数、thinking_budgetcandidate_count 和对话轮次格式。 这些原生规则不应直接等同于老张API的 OpenAI 兼容协议。迁移时建议:
  1. 只替换测试环境中的模型 ID,保留已验证的回退模型;
  2. 使用代表性请求比较答案质量、首 token 延迟、总耗时与 token 用量;
  3. 单独测试工具调用、JSON 输出、图片或文件输入以及流式返回;
  4. 核对调用日志中的实际扣费后,再分阶段增加流量。

常见问题

Gemini 3.8 Flash 的正确模型 ID 是什么?

使用 gemini-3.8-flash。不要自行添加 -preview-thinking-nothinking 后缀;只有控制台明确列出的兼容别名才可使用。

当前价格是多少?

2026 年 9 月 3 日老张API控制台显示:输入 $0.75 / 1M tokens,输出(补全)$3.75 / 1M tokens。价格可能随线路或活动变化,批量调用前请复核控制台,并以调用日志中的实际扣费为准。

Gemini 3.8 Flash 是正式版吗?

是。Google 将 gemini-3.8-flash 标记为 GA 和稳定模型。老张API是否对某个令牌分组开放,仍需在控制台单独确认。

可以只改模型 ID 就迁移吗?

可以把替换模型 ID 作为第一步,但不能因此认定完整兼容。生产迁移前还需检查提示词效果、Thinking、工具调用、结构化输出、流式响应、token 用量和延迟。

旧版 Gemini Flash 需要立即停用吗?

不需要。本次是新增模型上线公告,不是旧模型下线通知。若旧模型的质量、延迟和成本仍满足要求,可以继续使用并安排对照测试。

证据来源与相关文档