跳到主要内容

Gemini 3.8 Flash vs Claude:AI Agent 的新一轮成本与能力竞争

· 阅读需 12 分钟
Claude Dev
Claude Dev

Google 于 2026 年 9 月 2 日发布 Gemini 3.8 Flash,称其为目前最智能的 Flash 模型,并宣布可用于生产环境。Google 同时发布了面向网络安全防御者、需要受信访问的 Gemini 3.8 Flash Cyber

Gemini 3.8 Flash 并不靠“最大模型”取胜,而是把 1M token 上下文、多模态输入、Google grounding、可配置 thinking、快速服务和极低价格组合在一起:2026 年 12 月 31 日之前,API introductory price 为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元

这让它与 Claude 的比较非常直接。长期任务定位最接近的是 Claude Fable 5.1,但它的价格是 10/50 美元;Claude Opus 5 是 5/25 美元;Anthropic 当前模型总览中,Claude Sonnet 5 是 2/10 美元。Gemini 3.8 Flash 的 token 单价明显更低,但比较不能只看价格:Google 明确说明,面对困难任务时,它可能使用更多 reasoning token 和更多 tool call。

早期社区反馈令人鼓舞,但还不能视为定论。用户称 3.8 Flash 比 3.7 更少“偷懒”、更完整;也有人反馈它更慢、更吃 quota,且不同账号和产品的 rollout 不一致。真正的问题不是“Gemini 是否比 Claude 更聪明”,而是:哪个模型能以更低的美元、时间和人工复核成本,交付更好的完整结果?

Google 发布了什么

生产 API 模型是 gemini-3.8-flash,定位是长周期软件工程、autonomous agent 和复杂 enterprise workflow 的 workhorse。

关键 API 规格如下:

  • 输入类型:文本、图片、视频、音频和 PDF。
  • 输出类型:文本。
  • 输入上限:1,048,576 tokens。
  • 输出上限:65,536 tokens,计费输出包含 thinking tokens。
  • Thinking 档位lowmediumhigh,默认 medium;不支持 minimal
  • 工具:Google Search grounding、Google Maps grounding、URL context、file search、code execution、function calling、structured outputs、caching,以及 preview 版 computer use。
  • 服务模式:Standard、Batch、Flex 和 Priority。

Standard API 的 introductory price 到 2026 年底为 $0.75/$3.75;2027 年 1 月 1 日起变为 $1.50/$7.50。Context caching 在 2026 年底前为每百万 token $0.075,另有存储费用。Batch 和 Flex 的 token 价格是 Standard 的一半,Priority 更贵。

Google AI Studio 还提供免费层,但 Google 说明免费层内容可能用于改进产品;付费 API 内容则不会用于产品改进。生产环境的成本比较必须把这项数据政策也算进去。

核心设计:任务越难,Gemini 3.8 Flash 越愿意多做几步

Google 表示,3.8 Flash 相比 3.7 Flash 在软件工程、agentic task、专业领域 reasoning 和 enterprise workflow 上都有改进。关键变化是:它会进行更多 reasoning step,迭代调用工具,并在过程中验证结果。

这是一种有意识的取舍:low 面向 incident pipeline、实时聊天、草稿和快速分析;medium 是复杂 coding 和 agent 使用的推荐档位;high 则用于深度 reasoning、数学和困难的多步骤任务。

它与 Claude 的 effort 控制相似,但暴露方式不同:

  • Gemini 3.8 Flashlow / medium / high,默认 medium
  • Claude Sonnet 5:adaptive thinking + effort,官方定位为快速的日常 agent 模型。
  • Claude Opus 5:adaptive thinking,默认 high,1M context,价格 $5/$25。
  • Claude Fable 5.1:adaptive thinking 始终开启,默认 high,1M context,价格 $10/$50,面向最困难的长周期工作。

因此,token price 不等于 task price。一个便宜模型如果使用两倍 token、发出更多 tool call,或需要人类花更久修复输出,就不一定更便宜。

Gemini 3.8 Flash 与 Claude:规格对比

模型ContextMax outputAPI 输入 / 输出Reasoning 控制最适合
Gemini 3.8 Flash1M64K2026 年底前 $0.75 / $3.75low / medium / high快速、多模态、成本敏感的 agent
Claude Sonnet 51M128K$2 / $10Adaptive + effort日常 coding 和广泛 agent 执行
Claude Opus 51M128K$5 / $25Adaptive + effort复杂工程与企业工作
Claude Fable 5.11M128K$10 / $50Adaptive,始终开启长周期 reasoning、research、困难迁移

这不是质量排行榜。Gemini 的 API 明确提供音频、视频、PDF、Search、Maps、URL context 和 preview computer use;Anthropic 当前总览主要把 Claude 描述为文本/图片输入、文本输出,并提供 vision 和 tool use。如果产品需要同一个模型原生接收音视频,Gemini 的文档化输入面更广。

Claude 的优势则在输出空间和升级路径:Fable 5.1 与 Opus 5 支持 128K 输出,适合大型 artifact、报告和长 agent response;Claude 还提供更细的长会话状态、thinking block、fallback 和迁移规则。Google 的优势是 Search/Maps grounding、多模态 API,以及 Standard、Batch、Flex、Priority 等服务模式。

Gemini 的最大优势,也是最大的陷阱:价格

按 2026 年 introductory Standard 价格计算,Gemini 3.8 Flash:

  • 输入和输出都约为 Sonnet 5 的 37.5%
  • 输入和输出都约为 Opus 5 的 15%
  • 输入和输出都约为 Fable 5.1 的 7.5%

但这里没有计算 Search 请求、Maps 查询、cache storage、tool execution、retry、人工复核或 reasoning overhead。Google 明确提醒,长而复杂的任务可能使用更多 token。更勤奋的推理可能同时是更好的工程质量和更差的交互经济性。

更合理的指标是:

每个被接受结果的成本
= token + tool call + grounding + retry + 人工复核时间

对于高吞吐抽取、草稿生成、小型 sub-agent,Gemini 的价格优势非常强。对于困难迁移,如果它多花一小时工程师复核时间,token 折扣就可能被抵消。Fable 5.1 的高价格正是因为它面向“漏掉根因的代价更高”的工作。

Gemini 更强的地方

1. 多模态输入与 Google grounding

Gemini 3.8 Flash 可以在同一个模型 API 中接收文本、图片、视频、音频和 PDF,并使用 Search、Maps、URL context、file search、code execution。对需要在文档、网页、地图、代码库和工具结果之间切换的助手,这会降低整合成本。

Claude 也支持文本、图片、vision 和 tool use,但 Gemini 的 API 更明确地绑定了 Google 的信息图谱和多模态产品。

2. 成本敏感的 agent routing

Gemini 3.8 Flash 更像高吞吐 workhorse,而非昂贵 reasoning model。日常任务使用 low,常规 agent 用 medium,只有困难任务才切换 high;Batch 与 Flex 还可以用延迟换价格。

Anthropic 的 Sonnet 5 是更直接的日常替代品,但 Gemini 当前 token price 更低。如果 replay eval 的 accepted-task quality 接近,Gemini 的 routing economics 会更有吸引力。

3. 独立的 Cyber 版本

Google 通过 Fairwind Program 向受信防御者提供 Gemini 3.8 Flash Cyber。Anthropic 也有类似分层:Fable 5.1 是带 safeguards 的通用版本,Mythos 5.1 是访问受限、网络安全和生物学限制更少的版本。

两家公司都在把高级 cyber capability 视为访问和 policy 问题,而不仅是模型大小问题。进行防御性安全工作前,要确认 access program、日志、数据保留和允许的任务类别。

Claude 仍然更有说服力的地方

1. 输出空间与长文交付

Claude Opus 5 和 Fable 5.1 的最大输出为 128K,是 Gemini 3.8 Flash 64K 的两倍。并不是每次都需要长回答,但大型代码、复杂 artifact、长报告和需要单次返回大量结构化工作的 agent 会受益。

2. Claude Code 的升级梯度更清晰

Anthropic 的模型梯度很直观:Sonnet 5 负责广泛执行,Opus 5 负责复杂工程,Fable 5.1 负责最难的长周期任务。Anthropic 也明确建议大多数工作先从 Opus 5 开始,只有高 effort 仍失败时才升级到 Fable。

Gemini 3.8 Flash 可能以更低价格覆盖更多中间场景,尤其在 Google Antigravity 和 Gemini Enterprise Agent Platform 中;Claude 的优势是对已有 Claude Code 团队提供更清晰的 premium escalation path。

3. 自定义 agent 的状态契约

Fable 5.1 要求 API 客户端认真处理 thinking block、append-only history、工具调用和 refusal/fallback。这些会增加迁移成本,但也让长会话状态变得可测试。

跨 provider 的 harness 不能因为 model price 很低就假设兼容。必须分别测试 tool call、thinking budget、context compaction、structured output、grounding 和 retry behavior。

早期用户反馈

社区反馈还太新,无法决定模型排名,但方向很有参考价值。

r/GeminiAI 用户称 3.8 Flash 仍然很快,比 3.7 更有事实感、更详细,在严肃 prompt 上更少“偷懒”。也有人觉得它慢、会犯错,或发现不同账号和 app 的 rollout 不一致;部分用户怀疑界面上的模型名称可能对应 A/B test 或更新后的 system prompt。

Google Antigravity 社区的反馈是:3.8 Flash 更愿意认真分析代码库和找问题,但会花更长时间并消耗更多 quota。这和 Google 文档一致:困难任务会触发更多 reasoning token 与 tool call。

一个社区用户在同一套 98 题 MindTrial 上报告:Gemini 3.8 Flash 86/98,Fable 5.1 90/98,Opus 5 88/98;Gemini 3.8 的运行时间约 1 小时 46 分钟,高于 3.7 的约 1 小时 3 分钟,reasoning token 也从约 660K 增加到 1.57M。这只是单人、单 harness、单数据集和 high thinking 配置的结果,不能当成定论。

因此,早期对比可以概括为:Gemini 的优势是低价、快速上手和多模态;Fable 的优势是困难的长周期工作和更强的根因分析感知;二者在计划、工具、验证和恢复时都可能消耗超出预期的 compute。

实用路由策略

任务首先测试升级路径
高吞吐抽取、草稿、简单转换Gemini 3.8 Flash low/mediumSonnet 5
多模态文档、音视频、PDF、地图Gemini 3.8 FlashOpus 5
常规 repo 编辑和测试循环Gemini medium 或 Sonnet 5Opus 5
大型迁移、跨服务 debuggingOpus 5Fable 5.1
长文档 research 和多重决策Opus 5 或 Fable 5.1Fable 5.1
已批准的防御性 cyber 工作Flash Cyber 或 Mythos人工复核

不要把这张表当成永远成立的赢家名单。Google-centric 产品、需要 Search/Maps/多模态文件且成本严格受限时,Gemini 可能更合适;已有 Claude Code、Opus/Fable harness 且根因错误代价高的团队,可能更偏向 Claude。混合路由也可行,但要确认交接不会丢上下文或制造更多人工复核。

评估清单

用同一套任务比较 Gemini 与 Claude,并记录:accepted completion rate、partial credit、wall-clock time、time-to-first-useful-output、输入/输出/reasoning token、tool call、grounding request、retry、refusal、人工修复、失败时 context 长度、每个 accepted result 的成本,以及最终 artifact 是否遵循项目规范。

Gemini 要分别测试三种 thinking level;不要拿 high Gemini 对比 low Claude,也不要拿无工具聊天 prompt 对比启用工具的 agent。Claude 则要测试 Sonnet 5、Opus 5 和 Fable 5.1 在真实付费 effort 下的表现。

结论

Gemini 3.8 Flash 是本次对比中最值得关注的 Flash 发布:它以很低的 token price 提供 reasoning、多模态输入、1M context、Google grounding 和可调 thinking。对高吞吐 agent、Google 集成产品和成本敏感工作流,它是强候选。

Claude 仍有清晰的 premium workflow 优势:Sonnet 5 是日常执行模型,Opus 5 是复杂工程选项,Fable 5.1 则用于“更好的根因结果足以覆盖模型费用”的困难长任务。

早期反馈和规格共同指向同一个结论:Gemini 3.8 Flash 便宜、快且有能力,但可能把成本优势花在更多 reasoning 和 tool call 上;Claude 更贵,却更容易在错误代价高时证明其价值。

不要问抽象意义上谁赢。用自己的 replay set,测量被接受结果,按任务形状路由。2026 年真正的竞争单位不再是“最聪明的模型”,而是 每美元交付的最佳完整工作流

参考来源