Google 于 2026 年 7 月 21 日正式发布 Gemini 3.6 Flash。它不是用来取代所有旗舰模型的“全能王”,而是一款面向生产环境的主力模型:在 Flash 级速度和成本下,重点提高代码、知识工作、多模态理解、长上下文与智能体执行效率。

如果只看官方宣传,最醒目的数字是“比 Gemini 3.5 Flash 少使用 17% 的输出 Token”。但这还不足以判断它是否值得接入。开发者真正需要知道的是:它每百万 Token 多少钱、上下文到底多长、哪些基准确实提升、与同期旗舰模型还有多大差距,以及真实用户是否认可它的速度和效果。

本文结合 Google 官方模型资料、Google DeepMind 评测表、Artificial Analysis 独立测试和发布后早期社区讨论,给出一份尽量完整且保留边界条件的 Gemini 3.6 Flash 介绍。资料核验时间为 2026 年 7 月 22 日。模型刚发布一天,价格、排名和社区口碑仍可能快速变化。

先说结论:Gemini 3.6 Flash 的价值不在于每项能力都超过 GPT-5.6、Claude Sonnet 5 或 Grok 4.5,而在于用很高的输出速度、1M 上下文和较强的代码、Computer Use、图表理解能力,提供适合规模化 Agent 的综合性价比。它很可能成为实时 Agent、前端迭代、长文档分析和多模态工作流的热门候选,但高风险生产任务仍应先用自己的数据复测。

核心结论

  • 正式可用于生产:gemini-3.6-flash 已进入 General Availability(GA),不是预览版模型。
  • 上下文很大:支持 1,048,576 个输入 Token 和 65,536 个输出 Token,输入可包含文本、图片、视频、音频和 PDF,输出为文本。
  • 价格比上一代更有利:输入仍为每百万 Token 1.50 美元,输出由 Gemini 3.5 Flash 的 9 美元降至 7.50 美元,降幅约 16.7%。
  • 强项集中在效率与 Agent:官方数据表明,它在长周期代码、机器学习工程、Computer Use、长上下文检索和图表理解方面明显优于 3.5 Flash,并减少无效代码修改、推理轮次与工具调用。
  • 不是同期旗舰的全面替代品:在 Google 公布的同条件表格中,GPT-5.6 Luna、Grok 4.5 和 Claude Sonnet 5 仍在部分代码与知识工作基准上领先。
  • API 行为发生变化:temperaturetop_ptop_k 已被废弃并会被忽略,未来还可能直接返回 400;旧项目迁移时需要重点检查。

Gemini 3.6 Flash 是什么?

Gemini 3.6 Flash 是 Google Gemini Flash 系列的通用高吞吐模型。Google 将它称为“workhorse model”,即可以承担大量日常生产流量的主力模型,而不是只用于极难问题、响应更慢且成本更高的 Pro 级模型。

它的目标用户主要包括:

  • 需要低延迟、多轮工具调用的 AI Agent;
  • 需要理解大型代码库并持续修改代码的开发工具;
  • 处理 PDF、图表、录音、视频和图片的多模态应用;
  • 需要一次输入大量文档、日志或仓库内容的长上下文任务;
  • 对输出速度和单位任务成本敏感的在线产品。

需要注意,Google 没有公开 Gemini 3.6 Flash 的总参数量、激活参数量、MoE 专家数量或训练数据规模。网上出现的参数量推测不能当成官方规格。本文所说的“模型参数”,指已经公开的上下文、输出上限、模态、思考等级、工具支持和 API 配置,而不是未经证实的权重规模。

Gemini 3.6 Flash 参数与功能一览

项目 Gemini 3.6 Flash 官方信息
正式模型 ID gemini-3.6-flash
发布状态 General Availability(GA)
发布时间 2026 年 7 月 21 日
输入模态 文本、图片、视频、音频、PDF
输出模态 文本
最大输入 1,048,576 Token(官方概述通常写作 1M)
最大输出 65,536 Token(官方概述通常写作 64K)
默认思考等级 medium
参数量 Google 未公开
缓存 支持
Function Calling 支持
Structured Outputs 支持
Code Execution 支持
Google Search / Maps Grounding 支持
URL Context / File Search 支持
Computer Use 支持,仍标注为 Preview
Batch / Flex / Priority Inference 支持
图片、音频生成 不支持
Live API 不支持

这份规格表揭示了两个容易误解的地方。

第一,Gemini 3.6 Flash 是一个多模态理解模型,不是图片、语音或视频生成模型。它可以读图、听音频和分析视频,但标准模型输出仍然是文本。

第二,1M 上下文不等于模型能在一百万 Token 中毫无损失地记住每个细节。Google 公布的 GDM-MRCR v2 长上下文成绩显示,它在 128K 条件下为 91.8%,在 1M 条件下为 54.0%。这已经比 3.5 Flash 的 77.3% 和 26.6% 明显提高,但也说明上下文越接近上限,检索与推理可靠性仍会下降。

Gemini 3.6 Flash 价格是多少?

Google Gemini API 标准付费价格如下:

计费项目 Gemini 3.6 Flash Gemini 3.5 Flash 变化
输入 Token $1.50 / 1M $1.50 / 1M 不变
输出 Token(含思考 Token) $7.50 / 1M $9.00 / 1M 降低约 16.7%
上下文缓存读取 $0.15 / 1M $0.15 / 1M 不变
缓存存储 $1.00 / 1M Token / 小时 $1.00 / 1M Token / 小时 不变
Gemini 3.6 Flash 与 3.5 Flash 输入和输出 Token 价格对比图
Gemini 3.6 Flash 输入价格不变,输出单价由 9 美元降至 7.50 美元。图表依据 Google 官方价格重新绘制。

Google Search Grounding 和 Google Maps Grounding 与模型 Token 费用分开计算。官方价格页显示,Gemini 3 系列共享每月前 5,000 个免费 Grounding Prompt,之后按每 1,000 次 Search Query 14 美元计费。一个 Prompt 可能触发多个查询,因此做联网 Agent 时不能只估算输入输出 Token。

降价不等于每个任务都便宜 16.7%

假设一次请求输入 100,000 Token、输出 10,000 Token,不考虑缓存和工具费:

  • Gemini 3.5 Flash:0.10 × $1.50 + 0.01 × $9.00 = $0.24
  • Gemini 3.6 Flash:0.10 × $1.50 + 0.01 × $7.50 = $0.225

这个例子中,单次请求只下降约 6.25%,因为输入价格没有变化。如果 3.6 Flash 在你的任务上也确实减少输出 Token、工具调用和失败重试,单位任务成本才会进一步降低;如果它输出更多内容或需要更多重试,官方平均值就不一定适用于你。

Google 官方引用 Artificial Analysis 的结果称,3.6 Flash 比 3.5 Flash 少使用 17% 的输出 Token。Artificial Analysis 在 2026 年 7 月 22 日的模型页同时显示,3.6 Flash 的 Intelligence Index 测试共输出约 5,900 万 Token,而可比模型平均约为 6,300 万。这个数据支持“相对简洁”的方向,但不能代替你自己的请求级成本日志。

免费层虽然不收取输入输出 Token 费用,但 Google 价格页同时说明:免费层提交的内容可能被用于改进 Google 产品,付费层内容不会用于这一目的。涉及公司代码、合同、客户资料或个人数据时,应先核对当前数据条款,不要因为“免费”忽略数据治理。

主要能力升级在哪里?

1. 更适合长周期代码与 Agent 任务

Google 对 3.6 Flash 的优化重点不是让它生成更多代码,而是减少无关修改、重复执行和工具调用。官方开发文档称,它更倾向于在修改前先运行诊断,并用更少的推理步骤和对话轮次完成任务。

这类改进对真实 Agent 很重要。一个代码模型即使单次回答看起来聪明,如果频繁改错文件、反复运行同一命令或生成无法应用的补丁,最终延迟与成本都会上升。

在 DeepSWE v1.1 上,3.6 Flash 从 3.5 Flash 的 37% 提高到 49%;MLE-Bench 从 49.7% 提高到 63.9%。说明它在长周期软件工程和机器学习工程任务上的提升比普通短代码补全更明显。

2. Computer Use 成为原生工具

Gemini 3.6 Flash 支持原生 Computer Use,可根据界面截图识别元素并执行操作。OSWorld-Verified 成绩由 3.5 Flash 的 78.4% 提高到 83.0%。

不过,Computer Use 仍标注为 Preview。涉及支付、删除文件、发送消息、修改账号权限等不可逆操作时,仍应设置人工确认、域名白名单、操作日志和最小权限,而不是把公开基准成绩当成安全保证。

3. 多模态理解更适合文档和图表

3.6 Flash 可以在一个请求中处理文字、图片、PDF、音频和视频。Google 客户案例将它用于文档解析、图表与数据分析、报告起草,以及从金融材料中查找可引用证据。

在 CharXiv 图表理解基准中,3.6 Flash 无工具时得分 85.2%,使用工具时为 89.4%,均高于 3.5 Flash 的 84.2% 和 84.9%。这意味着它不仅能“看见”图表,还能在工具辅助下完成更可靠的信息综合。

4. 长上下文能力明显提高

除了 1M 的输入上限,真正值得关注的是长文本中的有效检索能力。GDM-MRCR v2 结果显示:

  • 128K:91.8%,3.5 Flash 为 77.3%;
  • 1M:54.0%,3.5 Flash 为 26.6%。

3.6 Flash 在极长上下文中的表现接近翻倍,但 54% 也提醒我们:把整个知识库无筛选地塞进一次请求,仍然不是稳定的生产方案。重要信息应结合检索、分块、引用校验和结果复核。

基准成绩应该怎么解读?

先看同系列升级,Gemini 3.6 Flash 在 Google 公布的主要指标上均高于 3.5 Flash:

基准 测试重点 Gemini 3.6 Flash Gemini 3.5 Flash
SWE-Bench Pro Public 多样化 Agent 编程 58.7% 55.1%
DeepSWE v1.1 长周期软件工程 49% 37%
Terminal-Bench 2.1 终端 Agent 编程 78.0% 76.2%
MLE-Bench 机器学习工程 63.9% 49.7%
OSWorld-Verified Computer Use 83.0% 78.4%
GDPVal-AA v2 知识工作,Elo 1421 1349
CharXiv,有工具 复杂图表信息综合 89.4% 84.9%
GDM-MRCR v2,128K 长上下文检索 91.8% 77.3%
GDM-MRCR v2,1M 极长上下文检索 54.0% 26.6%
Gemini 3.6 Flash 相比 3.5 Flash 在四项重点基准中的提升
代际提升主要集中在长周期软件工程、机器学习工程、Computer Use 与极长上下文检索。百分点变化不等于相对百分比。

但如果把对比对象换成 2026 年 7 月的同期模型,结论会更完整。Google DeepMind 的同一张评测表显示:

基准 Gemini 3.6 Flash GPT-5.6 Luna Grok 4.5 Claude Sonnet 5
SWE-Bench Pro Public 58.7% 62.7% 64.7% 63.2%
DeepSWE v1.1 49% 67% 54% 54%
MLE-Bench 63.9% 47.6% 43.2% 66.9%
OSWorld-Verified 83.0% 72.6% 未公布 81.2%
GDPVal-AA v2 1421 1584 1535 1607
CharXiv,无工具 85.2% 82.7% 81.6% 77.0%
Gemini 3.6 Flash 与 GPT-5.6 Luna、Grok 4.5、Claude Sonnet 5 基准热力图
同期模型没有单一赢家:Gemini 3.6 Flash 在 OSWorld 和 CharXiv 中领先,在 SWE-Bench Pro 中则落后于其他三款模型。

这张表更准确地定义了 3.6 Flash 的位置:

  • 它在 Computer Use、图表理解和部分机器学习工程任务上非常有竞争力;
  • 在通用软件工程和知识工作上,它并没有全面超过同期旗舰或高阶模型;
  • 它真正的优势需要和速度、价格、上下文长度放在一起看,而不能只看一个能力总分。

所有上述结果都来自 Google 公布的评测表。即使评测方法有说明,厂商仍会选择最能展示产品价值的测试。基准成绩适合建立候选清单,不适合直接替代真实业务验收。

第三方测试和用户评价怎么样?

由于 Gemini 3.6 Flash 发布仅一天,现在还不存在覆盖足够多任务、语言和长期稳定性的“最终口碑”。比较可靠的方式,是把反馈分为第三方测量、官方客户案例和开放社区讨论三层来看。

Artificial Analysis:速度突出,综合智能处于前列但不是第一梯队顶端

截至 2026 年 7 月 22 日,Artificial Analysis 对高思考版本的测量为:

  • Intelligence Index:50,列该页面同类 186 个模型中的第 21 位;
  • 输出速度:约 275.5 Token/秒,列同类模型第 1 位;
  • 输入价格:1.50 美元 / 1M Token;
  • 输出价格:7.50 美元 / 1M Token;
  • 该测试中的加权平均任务成本约 0.50 美元。

排名会随模型和供应商数据更新而变化,但它很好地验证了本文的核心判断:3.6 Flash 最大亮点是智能程度、响应速度和价格之间的平衡,而不是单纯追求最高能力分。

官方客户案例:真实业务信号积极,但属于筛选样本

Google DeepMind 页面展示了四家早期客户反馈:

  • Figma 认为它在质量、速度和成本之间达到较好平衡,可更快探索和迭代原型;
  • Harvey 表示内部基准明显提升,文档起草和审查任务平均快 12%;
  • Hebbia 称其在引用密集型金融研究的证据查找中,优于该公司测试的前沿基线;
  • JetBrains Junie 认为其编码与推理质量接近 Gemini Pro,同时保留 Flash 的速度和成本优势,低思考级别的编码表现提高约 10%–20%。

这些案例来自真实产品团队,比普通宣传语更有参考价值,但它们仍由 Google 选择并展示,测试集和失败样本没有完整公开。因此可以把它们看成“适合进一步试用”的信号,不能当作独立、全面的用户满意度调查。

Hacker News:认可速度,也质疑相对价格和能力上限

发布后约 16 小时,相关 Hacker News 讨论已获得约 671 分和 515 条评论,说明开发者关注度很高。具有代表性的观点包括:

  • 有开发者认为它在 Artificial Analysis 的智能分数只是中上水平,但“智能程度 / 任务耗时”和输出速度非常突出;
  • 有用户认为 3.5 Flash 本来就是被低估的前端迭代模型,速度快、适合频繁试错,预期 3.6 会延续这一优势;
  • 也有用户质疑,3.6 Flash 相比 GLM-5.2、DeepSeek V4 Flash 等低价模型并不便宜,不能只与 Google 上一代比较;
  • 一部分讨论担心 Google 把重点放在 Flash 效率上,意味着它在最高能力上仍未追上 GPT-5.6 或 Claude Fable 5 等顶级模型。

这些评价来自发布当天的自选样本,很多人尚未完成系统实测。它们更适合帮助我们发现需要验证的问题——前端效果、真实 Token 用量、任务总成本和极难代码能力——而不是直接得出“好用”或“不好用”的总体结论。

哪些场景值得优先试用?

适合优先测试

  • 实时 AI Agent:需要低延迟、Function Calling、搜索和多轮工具执行;
  • 代码助手与前端迭代:重视修改速度、视觉理解和快速试错;
  • 长文档与大型代码库:需要一次读取大量 PDF、日志、规范或仓库文件;
  • 图表与财务材料分析:需要从图像、表格和文档中提取证据并生成说明;
  • 浏览器与桌面自动化:希望使用原生 Computer Use,同时能设置人工审批;
  • 高并发在线功能:模型能力达到要求后,更重视输出速度与规模化成本。

不应直接替换现有方案

  • 任务要求最高级别的软件工程或知识工作能力,且延迟和成本不是主要约束;
  • 需要原生生成图片、音频,或使用 Live API 做实时双向语音;
  • 高风险法律、医疗、金融结论没有人工复核;
  • 需要在超长上下文中逐字无遗漏地找出每个事实;
  • 现有系统高度依赖 temperature、预填充 Assistant 回答或多候选输出。

从旧版 Gemini 迁移时要改什么?

Gemini 3.6 Flash 不只是替换模型 ID。Google 最新模型迁移文档列出了几项兼容性变化:

  1. temperaturetop_ptop_k 已废弃并被忽略,未来会返回 400 错误;
  2. 直接按 Google 最新模型接口开发时,优先使用 thinking_level;通过 UnifyLLM 的 Gemini 原生兼容端点调用时,也可以传递 thinkingConfig.thinkingBudgetincludeThoughts
  3. 不再支持预填充 model / assistant 轮次;
  4. 不支持 candidate_count
  5. 默认思考等级为 medium
  6. Google 推荐新项目优先评估 Interactions API。

迁移时应先从请求体中删除已经无效的采样参数,再根据所选协议测试思考等级或思考预算对准确率、延迟和费用的影响。Google 直连接口、不同 SDK 与 UnifyLLM 原生兼容端点的字段形式可能不同,不要混用两套请求结构。

如果业务依赖固定格式,应优先使用 Structured Outputs 或 JSON Schema,而不是通过降低 temperature 追求确定性。对于 Agent,还要记录每次工具调用、失败重试、输出 Token 和端到端耗时,才能判断 3.6 Flash 是否真的降低单位任务成本。

通过 UnifyLLM 快速接入 Gemini 3.6 Flash

UnifyLLM 为 Gemini 提供两种调用方式:Gemini 原生 generateContent 格式,以及便于统一切换不同厂商模型的 OpenAI-compatible 格式。两种方式使用同一个 UnifyLLM Key,但请求路径和参数结构不同。

方法一:使用 Gemini 原生格式并开启思考

Gemini 原生格式的优势是可以保留 contentspartsgenerationConfigthinkingConfig 等原生结构。下面的示例通过 thinkingBudget 分配 1,024 个思考 Token,并通过 includeThoughts: true 请求在响应中包含思考内容:

curl --location --request POST \
  'https://api.unifyllm.top/v1beta/models/gemini-3.6-flash:generateContent?key=<YOUR_UNIFYLLM_API_KEY>' \
  --header 'Content-Type: application/json' \
  --data-raw '{
    "contents": [
      {
        "parts": [
          {
            "text": "啄木鸟能啄几棵树?"
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingBudget": 1024,
        "includeThoughts": true
      }
    }
  }'

这种方式适合已经使用 Gemini SDK、需要精确控制 Gemini 原生能力,或者希望观察思考内容的应用。thinkingBudget 会影响输出延迟和计费,生产环境应按任务难度设置,并避免把真实 Key 写进脚本、日志或公开仓库。由于 Key 位于查询参数中,还应特别注意网关和访问日志的脱敏设置。

方法二:使用 OpenAI-compatible 格式统一切换模型

如果你需要在 Gemini 3.6 Flash、GPT-5.6、Claude Sonnet 5、Grok 4.5 或其他模型之间做同条件对比,OpenAI-compatible 接口可以减少为每家供应商分别改造客户端的工作。

常用配置为:

Protocol:OpenAI Compatible
Base URL:https://api.unifyllm.top/v1
API Key:在 UnifyLLM 控制台创建的专用 Key
Model:gemini-3.6-flash

一个最小 OpenAI-compatible 请求示例:

curl https://api.unifyllm.top/v1/chat/completions \
  -H "Authorization: Bearer <YOUR_UNIFYLLM_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.6-flash",
    "messages": [
      {
        "role": "user",
        "content": "请比较这份产品需求中的三个实施方案,并用表格列出成本、风险和依赖。"
      }
    ]
  }'

第二个示例没有加入 temperature,因为该参数对 Gemini 3.6 Flash 已被废弃。如果应用主要调用 Gemini 并需要原生思考参数,优先使用第一种格式;如果应用需要用一套客户端切换多家模型,优先使用第二种格式。模型是否已对你的账户开放、实际计费和可用能力,以 UnifyLLM 控制台当前模型列表为准。

建议用同一组真实任务对候选模型做盲测,并至少记录:任务通过率、严重错误、格式合规率、首 Token 延迟、总耗时、输入输出 Token、工具调用次数和实际费用。可先阅读 快速开始集成指南API 参考

总结

Gemini 3.6 Flash 是一次目标明确的升级:输出单价更低,代码、机器学习工程、Computer Use、图表理解和长上下文能力提高,同时努力减少冗长输出、无效修改与工具循环。Artificial Analysis 的早期数据也验证了它非常快,适合对响应速度和规模化成本敏感的应用。

它不是所有排行榜上的第一名,也不应被包装成同期旗舰模型的全面替代品。更准确的定位是:一款能力足够强、速度极快、上下文很长,并针对生产 Agent 优化的主力模型。

如果你的任务是实时 Agent、代码迭代、文档分析或多模态知识工作,Gemini 3.6 Flash 值得进入首轮候选;如果你追求最高难度推理和代码能力,则应同时与 GPT-5.6、Claude Sonnet 5、Grok 4.5、GLM-5.2、DeepSeek V4 等当前模型做同条件实测,再按任务通过率、总成本和延迟决定。

常见问题

Gemini 3.6 Flash 已经正式发布了吗?

是。Google 将 gemini-3.6-flash 标记为 General Availability,可通过 Gemini API、Google AI Studio、Gemini App、Gemini Enterprise 和 Google Antigravity 等渠道使用。不同地区、账户和平台的开放节奏可能不同。

Gemini 3.6 Flash 的参数量是多少?

Google 尚未公布总参数量、激活参数量或 MoE 结构细节。可以确认的参数是 1,048,576 Token 输入上限、65,536 Token 输出上限,以及默认 medium 思考等级。不要把社区推测当作官方数据。

Gemini 3.6 Flash 比 3.5 Flash 便宜多少?

输入价格相同,输出价格从每百万 Token 9 美元降到 7.50 美元,输出单价降低约 16.7%。单个任务的实际降幅还取决于输入输出比例、思考 Token、缓存、工具费用、重试次数和模型实际生成长度。

Gemini 3.6 Flash 可以生成图片或语音吗?

标准 gemini-3.6-flash 可以理解图片、视频和音频,但输出模态是文本,不支持图片或音频生成,也不支持 Live API。需要生成媒体或实时语音时,应选择对应的专用模型。

Temperature 参数还能使用吗?

不建议。Google 的最新模型文档说明,temperaturetop_ptop_k 已被废弃并会被忽略,未来还可能返回 400。应使用明确指令、Structured Outputs 和 thinking_level 控制输出方式。

1M 上下文是否意味着可以一次塞入整个知识库?

技术上可以输入非常长的内容,但不代表每个细节都能可靠召回。官方 1M 长上下文基准为 54.0%,明显优于上一代但仍有损失。生产环境应结合检索、分块、引用和人工或程序化校验。

参考资料