别只用GPT写代码了!谷歌Gemini 3.7 Flash上线:1M上下文+Agent原生,价格砍半

别只用GPT写代码了!谷歌Gemini 3.7 Flash上线:1M上下文+Agent原生,价格砍半 封面

第一章 谷歌把”干活模型”的价格打下来了

昨天(8月13日),谷歌一声不响地放出了 Gemini 3.7 Flash。三周前才发 3.6,现在 3.7 又来了。你以为又是挤牙膏?错。这次它直接把”给 AI 干活的模型”的价格砍了一半。

说实话,2026 年做 Agent 的都知道一个痛:你让模型跑一个多步骤任务,一次请求里它可能要调用十几二十次模型——规划一次、调工具一次、校验一次、再规划一次。模型越贵,这套”循环”就越烧钱。谷歌这次的逻辑很狠:我不跟你卷谁最聪明,我卷”便宜、快、还能稳定干活”。

限时到今年年底,输入每百万 token 只要 0.75 美元,输出 3.75 美元,正好是上一代首发价的一半。一句话:现在不上车,更待何时?

第二章 它强在哪:编码和 Agent 是原生能力

别被”Flash”这个名字骗了,以为它是个轻量小模型。3.7 Flash 的定位是”干活主力”,不是”陪你聊天”。它原生就带着一整套 Agent 基建:

  • Function Calling 稳得离谱:这是 Agent 能不能跑起来的命门。模型再聪明,吐出来的 JSON 一旦格式错,整个工作流就崩。3.7 Flash 把工具调用的格式正确性拉到了新高度,比纯比智商更实用。
  • 100万 token 上下文:一整座代码库、一整份长文档,直接塞进上下文,不用再玩切片的脏活。
  • 原生 MCP 支持:通过 Model Context Protocol 直接连你的仓库、数据库、向量库。工具连通性不再是自己焊的胶水。
  • Computer Use(预览):能操作电脑界面,虽然还只是预览,但方向已经亮明。
  • 可配置思考模式:低/中/高三档,简单活儿用低档省 token,难活儿开高档。

编码基准上,DeepSWE 从 49% 飙到 65.3%,FrontierCode 从 34.4% 到 43.6%,直接压过同期的 Claude Sonnet 和 GPT。这不是实验室数字,是真能少返工。

第三章 三分钟上手:三条路都能用

谷歌把入口铺得很全,你挑顺手的来:

  • Google AI Studio:最快试水。拿个 key,浏览器里直接对话,不用搭任何环境。
  • Gemini API:生产集成点。后端直接调,或者塞进 LangGraph 当 LLM 节点。
  • Vertex AI:企业级,带 IAM、VPC、审计日志,合规要求高的团队走这条。

框架层面,官方点名支持 LangChain、LangGraph、CrewAI、LlamaIndex、Vercel AI SDK、Temporal。也就是说,你现有的 Agent 脚手架,换个模型名就能跑。

3.7 Flash 的 Agent 基建:Function Calling + 1M 上下文 + 原生 MCP,工具调用稳到离谱
3.7 Flash 的 Agent 基建:Function Calling + 1M 上下文 + 原生 MCP,工具调用稳到离谱

第四章 实战:把 3.7 Flash 接进你的 Agent 循环

光说没用,上代码。下面这段是 LangGraph 里把 3.7 Flash 当”规划节点”的最小实现:

from langchain_google_genai import ChatGoogleGenerativeAI
from langgraph.graph import StateGraph, END

llm = ChatGoogleGenerativeAI(model='gemini-3.7-flash', temperature=0.2, max_output_tokens=2048)
def planning_node(state):
    plan = llm.invoke(state['messages'])
    return {'plan': plan.content}
graph = StateGraph(dict)
graph.add_node('plan', planning_node)
graph.set_entry_point('plan')
graph.add_edge('plan', END)
app = graph.compile()

注意 temperature 我设了 0.2——工具调用要的是稳,不是天马行空。Flash 便宜,意味着你每请求跑 15~40 次模型都扛得住,于是”规划→调工具→校验→失败再规划”这种重试循环才真正跑得起来。贵的模型你根本不舍得这么造。

价格真相:限时半价到年底,2027 年 1 月直接翻倍——现在不上车更待何时
价格真相:限时半价到年底,2027 年 1 月直接翻倍——现在不上车更待何时

第五章 价格真相:限时半价,年后翻倍

这块必须给你讲清楚,别被”腰斩”冲昏头。

现在到 12 月 31 日是促销价:输入 0.75、输出 3.75 美元/百万 token,上下文缓存 0.075。但从 2027 年 1 月 1 日起,标准价直接翻倍到输入 1.50、输出 7.50,缓存 0.15。

我的建议很直接:趁这半年把你的 Agent 跑起来、跑顺、跑出数据。等它涨价,你已经验证过值不值了。别等到 1 月才来问”还值不值”。

第六章 避坑清单:这些能力它还没有

  • 不支持 Live API、图像生成、音频生成:它是纯文本/多模态输入的”干活”模型,不是文生图工具。
  • 计算机操作(Computer Use)还是预览:别当 GA 用,生产环境先观望。
  • “极简思考”模式不支持:调低档位会报错,老老实实用低/中/高。
  • Gemini 3.5 Pro 仍缺席:谷歌把火力全压在 Flash 线上,要巅峰推理还得等。

一句话:它是”主力劳工”,不是”总设计师”。重推理的活,先别全押它。

第七章 总结:你现在该换吗

如果你在做 AI Agent、自动化流水线、编码助手,3.7 Flash 是我目前最推荐的”干活模型”之一。便宜、快、工具调用稳、上下文够长,框架兼容又全。

现在的正确姿势:把 Flash 放在 Agent 的规划节点和校验节点,贵模型留给真正需要深度推理的环节。用这半年的窗口期,把成本结构跑通。等 1 月涨价那天,你会感谢今天动手的自己。

© 版权声明
THE END
喜欢就支持一下吧
点赞76 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容