7月下旬,Google 正式发布 Gemini 3.6 Flash 与 Gemini 3.5 Flash-Lite 两款新模型,同时宣布 Gemini 4 已开启预训练,而备受关注的 Gemini 3.5 Pro 仍在测试阶段。
相比发布一款旗舰模型,这次 Google 更关注另一件事——如何让 AI Agent 在真实业务中跑得更快、更便宜、更稳定。
对于开发者、企业以及 AI 应用创业者来说,这或许比模型排行榜的变化更值得关注。
Gemini 3.6 Flash 与 3.5 Flash-Lite 有哪些升级?
本次发布主要包含两款面向生产环境的新模型。
| 模型 | 定位 | 适用场景 |
| Gemini 3.6 Flash | 默认工作模型(Workhorse) | 编程、知识处理、多模态、AI Agent |
| Gemini 3.5 Flash-Lite | 极速低成本模型 | 文档处理、搜索、分类、批量推理 Google 官方表示,两款模型都围绕三个关键词进行优化: |
- 更低延迟(Low Latency)
- 更高 Token 效率
- 更低调用成本
其目标并不是挑战高推理能力,而是提升大规模 AI 应用的部署效率。
Gemini 3.6 Flash:不仅更聪明,还更省 Token
过去一年,AI 开发者的成本来源大多已经不是模型价格,而是 Token 消耗。
Google 在 Gemini 3.6 Flash 上进行了大量优化。
官方数据显示:
- 输出 Token 使用量相比 Gemini 3.5 Flash 降低约 17%
- 部分 Agent 工作流中 Token 消耗最高可降低 65%
- 输出价格进一步下降
- 多步任务需要更少 Tool Calls
对于企业来说,这意味着:
假设每天调用 100 万次接口,即使每次节省几个 Token,长期下来都是一笔可观的成本优化。
除此之外,在代码生成、多模态理解以及知识型任务方面,Gemini 3.6 Flash 的整体表现也优于上一代模型。
Gemini 3.5 Flash-Lite:真正适合大规模调用
如果说 3.6 Flash 是主力模型,那么 Gemini 3.5 Flash-Lite 更像是一台"高速流水线"。
Google 将它定位于:
- Agent Search
- 文档解析
- OCR
- 数据分类
- 批量生成
- 高并发 API 服务
官方数据显示,其生成速度可达到 350 Output Tokens/s,并保持极低调用成本,非常适合需要高吞吐量的 AI 服务。
对于 SaaS 产品、AI 办公工具、客服机器人等业务来说,Flash-Lite 很可能成为新的默认选择。
为什么 Google 没有先发布 Gemini 3.5 Pro?
相比新模型发布,更受关注的是:Gemini 3.5 Pro 为什么还没上线?
根据多家媒体报道,由于内部编码能力尚未达到 Google 的预期标准,因此 Gemini 3.5 Pro 的正式发布时间继续推迟。与此同时,Google 已经确认 Gemini 4 的训练工作已经启动。(Reuters)
这也反映出 Google 当前策略发生了一些变化:过去比的是谁模型强?现在比的是谁能够低成本跑更多 AI Agent。
AI Agent 正在成为新的竞争焦点
如果观察近几个月 OpenAI、Anthropic、Google 的产品更新,会发现一个共同趋势:大家都开始围绕 AI Agent 优化模型。
原因很简单。
未来真正消耗 Token 的,不再是聊天机器人。
而是:
- 自动编程 Agent
- 自动搜索 Agent
- 自动办公 Agent
- 自动客服
- 企业工作流
这些任务每天可能调用模型数百万次。
因此模型便宜一点;速度快一点;Token 少一点;都会直接影响企业成本。
Gemini 3.6 Flash 与 3.5 Flash-Lite 的定位,正是围绕这一需求展开。
开发者使用 Gemini API,需要关注哪些问题?
随着越来越多开发者开始接入 Gemini API 和 Google AI Studio,模型性能之外,还有几个容易被忽略的问题。
例如:
- API 请求稳定性;
- 不同地区访问延迟;
- 多账号开发环境管理;
- 自动化测试环境一致性。
对于需要长期调用海外 AI 服务的开发团队来说,一个稳定、持续的网络访问环境,能够减少接口波动带来的影响。
例如 IPFLY 提供覆盖多个国家和地区的住宅代理 IP 资源,可帮助跨境开发、AI 应用测试及全球业务部署团队,根据业务需求构建更加稳定的网络访问环境,在调用 Gemini API、Google AI Studio 等海外开发平台时提升连接稳定性和效率。
Gemini 3.6 Flash 更适合哪些用户?
综合官方介绍来看,可以简单理解为:
适合 Gemini 3.6 Flash
- AI Agent 开发
- 编程助手
- 多模态应用
- 企业知识库
- MCP 工具调用
- RAG 应用
如果你的产品需要更好的质量 + 更低 Token 成本,那么 3.6 Flash 会是首选。
适合 Gemini 3.5 Flash-Lite
如果业务特点是:
- OCR
- 文档解析
- 搜索
- 批量摘要
- 分类
- 自动审核
每天请求量巨大。
那么 Flash-Lite 更具性价比。
它的核心价值不是推理能力,而是速度足够快,成本足够低。
Google AI 正在进入"效率竞争"阶段
过去,大模型行业讨论多是:
- 谁跑分第一?
- 谁推理强?
- 谁上下文长?
但现在,企业更关心的是:
- 一天能跑多少请求?
- Token 成本是多少?
- 延迟是否足够低?
- 是否适合 AI Agent 长时间运行?
Gemini 3.6 Flash 与 3.5 Flash-Lite 的发布,意味着 Google 正试图用"效率"而不是单纯的参数规模来参与下一轮竞争。
总结
此次 Gemini 3.6 Flash 与 Gemini 3.5 Flash-Lite 的推出,并不是一次简单的版本更新,而是 Google AI 战略的一次明显转向。
相比追求单项能力极限,新模型更加注重 成本、速度、Token 效率以及 AI Agent 场景,这也契合当前企业级 AI 应用的发展方向。
对于开发者而言,未来选择模型时,不仅要关注基准测试成绩,更需要结合实际业务需求、调用成本以及部署稳定性进行综合评估。与此同时,在跨境开发、海外 AI 平台接入等场景下,借助 IPFLY 等稳定的代理 IP 服务构建可靠的网络访问环境,也有助于提升开发和测试体验,让 AI 应用更稳定地落地。