8 月 AI 模型决策框架:GPT-5.6 / Claude Fable 5 / Gemini 3.7 / Qwen3.8 四强争霸与选型实战

王争气 ≈ 28 分钟阅读 · 9.7k 字 AI Coding / AI Agent / 选型

前言

2026 年 8 月最后一周,我打开 Anthropic、OpenAI、Google、阿里四家后台,模型版本号全部刷新了一遍。这种「四家同月迭代」的密度,过去两年只在 2024 年 Q4 出现过一次,代价是三个月后三家股价跳水。这次不一样——价格没涨,反而 GPT-5.6 Luna 降了 80%、Gemini 3.6 Flash 降了 65%,Claude Opus 5 直接砍到 Fable 5 一半。这是模型战打到第三阶段才有的信号:头部 AI 公司不再卷 benchmark,开始卷 ROI

我们 CalcGuide 编辑部用了两周时间,在 6 个真实项目里(代码迁移 / 长文档摘要 / 客服 Agent / 多模态客服 / 内部知识库 / 极端 coding benchmark)同时跑 GPT-5.6 Sol/Terra/Luna、Claude Opus 5 / Fable 5、Gemini 3.7 Flash、阿里 Qwen3.8-Max、DeepSeek V4 Pro、智谱 GLM-5.3 Flash 共 8 个模型,得出3 维度决策框架

核心论点:2026 年 8 月之后,模型选型不是选「最好的」,是选「最贴合你预算与场景的三角。同一团队同一个月里,我们用 Claude Opus 5 跑代码迁移、用 GPT-5.6 Luna 跑客服 Agent、用 Gemini 3.7 Flash 跑多模态 —— 不是一棵树,是三棵树。本文把这片「模型森林」如何选、如何配,一次性讲清。


决策框架 3 维度

维度 1:场景 —— 你拿模型做什么

8 月新格局:同一家厂商出 3 个版本(OpenAI Sol/Terra/Luna),就是为了让你按场景挑。

场景类型推荐模型(2026-08)理由
长任务代码迁移 / 极限 SWE-BenchClaude Fable 5SWE-Bench Pro 80.3%,全行业第一
日常 coding / Sub-agent / IDE 集成Claude Opus 5Fable 5 同档实力,半价 ($5/$25)
客服 Agent / 长任务自动化GPT-5.6 SolTerminal-Bench 2.1 91.9%,8 Agent 并行
多模态客服(图片+语音+视频)Gemini 3.7 Flash思考等级可调,视频理解行业领先
企业内网 / 私有部署 / 数据出境严格Qwen3.8-Max2.4T MoE 开源权重,AA 榜 55.4 分登顶
高性价比 RAG / 长 context(1M+)DeepSeek V4 Pro1M context,Harness 框架开源
极致低成本 / 大批量推理GPT-5.6 Luna$0.20/M tokens,降价 80%
国产算力卡 / 信创合规GLM-5.3 Flash(OxAlpha)320B 跑在 10 万张国产卡

维度 2:预算 —— 一个月愿意烧多少

8 月新格局:同样的能力,价格能差 25 倍。

月预算推荐组合备注
$0Qwen3.8-Max / GLM-5.3 / DeepSeek V4-Flash国产三强免费 API + 本地推理
< $50GPT-5.6 Luna + Gemini 3.7 Flash$0.20 + $0.075,跑通 PoC 足够
$50-500Claude Opus 5 + GPT-5.6 Terra主力 Opus 5,Terra 跑批量
$500-5000Claude Opus 5 + Claude Fable 5 混合长任务 Fable 5、日常 Opus 5
$5000+8 模型混部 + 自部署 Qwen3.8-MaxFable 5 + 自建推理集群,长 context 内网跑

维度 3:技术栈 —— 团队能跑什么

技术栈现状推荐理由
纯 JS/TS,刚上 AgentDeepSeek Harness (dsh) + Gemini 3.7 Flashnpx @deepseek-ai/dsh web 5 分钟拉起
Python / LangChain 老用户LangChain + Claude Opus 5生态最大,Opus 5 thinking 默认开
企业 Java / Go,合规严格Qwen3.8-Max 自部署 + Mythos 安全套件全栈国产生态
多模态 / 视频 / 直播Gemini 3.7 Flash + Vertex AI思考等级 + 多模态 SOTA
多 Agent 并行 / 研究类GPT-5.6 Sol「ultra」模式8 Agent 并行,WebMCP 直接调网站结构化工具

8 模型横向对比表(2026-08-28 实测)

数据源:官方发布页 + Artificial Analysis 榜 + 我们 6 个项目实测。所有价格按 input / output 每百万 token 计。

模型厂商Context输出上限定价(USD/M)SWE/Code 基准Agent 基准长文档多模态私有部署
Claude Fable 5Anthropic1M128K$10 / $50SWE-Bench Pro 80.3%Frontier-Bench 33.7%
Claude Opus 5Anthropic1M64K$5 / $25CursorBench 3.2 ≈ Fable-0.5%Frontier-Bench 43.3%
GPT-5.6 SolOpenAI1.05M64K$3 / $15Terminal-Bench 2.1 91.9%WebMCP 8 Agent 并行
GPT-5.6 TerraOpenAI1.05M64K$1.5 / $6平衡档平衡档
GPT-5.6 LunaOpenAI256K16K$0.20 / $0.80速度档简单 Agent一般
Gemini 3.7 FlashGoogle1M64K$0.075 / $0.30Coding 大幅提升思考等级可调
Qwen3.8-Max阿里1M32K开源权重 + APIAA 榜 55.4 分GUI Agent 超 GPT-5.6
DeepSeek V4 ProDeepSeek1M32K$0.55 / $2.2Harness 开源Harness 全套
GLM-5.3 Flash智谱128K8K开源权重国产算力原生信创合规一般

看表 4 个 takeaway

  1. Opus 5 是 8 月最大黑马——Frontier-Bench 43.3% 超过 Fable 5 的 33.7%(Fable 5 在最难长任务 / Mythos 安全任务领先),价格只要一半
  2. Luna 是 8 月最大红利——$0.20/M token 跑通客服 Agent PoC,成本曲线被砸穿
  3. Gemini 3.7 Flash 是多模态唯一选择——思考等级可调(类似 Opus 5 effort),视频理解行业顶
  4. 国产开源首次站到 AA 榜第一——Qwen3.8-Max 55.4 分,超过 GPT-5.6 Sol + Claude Opus 5(综合榜)

决策树:2026 年 9 月起,你的项目该选谁

项目是什么类型?

├─ 写代码 / 重构 / 测试
│   │
│   ├─ 单 repo < 50 万行,普通 IDE 集成
│   │   └─ ✅ Claude Opus 5($5/$25,thinking 默认开)
│   │
│   ├─ 单 repo > 50 万行,要 1M context 全量分析
│   │   └─ ✅ Claude Fable 5(最强,但贵 1 倍)
│   │
│   ├─ 要并行 8 个 sub-agent 跑 terminal task
│   │   └─ ✅ GPT-5.6 Sol(Terminal-Bench 91.9%)
│   │
│   └─ 私有部署 / 内网合规
│       └─ ✅ Qwen3.8-Max(自部署)或 DeepSeek V4 Pro

├─ Agent / 自动化
│   │
│   ├─ 客服 Agent / 长任务(8 小时+)
│   │   └─ ✅ GPT-5.6 Sol(8 Agent 并行 + WebMCP)
│   │
│   ├─ 简单批量 Agent / 成本敏感
│   │   └─ ✅ GPT-5.6 Luna($0.20/M token)
│   │
│   ├─ GUI 自动化(浏览器 / 桌面)
│   │   └─ ✅ Qwen-UI-Agent(阿里开源)+ Claude Opus 5 兜底
│   │
│   └─ 多模态 Agent(看图 / 看视频)
│       └─ ✅ Gemini 3.7 Flash

├─ 长文档摘要 / RAG / 知识库
│   │
│   ├─ 内网 + 数据不能出境
│   │   └─ ✅ Qwen3.8-Max 自部署
│   │
│   ├─ 跨境 + 1M context + 中文为主
│   │   └─ ✅ DeepSeek V4 Pro
│   │
│   └─ 跨境 + 多语言 + 极致成本
│       └─ ✅ Gemini 3.7 Flash

└─ 多模态客服 / 视频 / 直播
    ├─ 视频理解 / 直播字幕
    │   └─ ✅ Gemini 3.7 Flash
    └─ 图片生成 + 文案
        └─ ✅ GPT-5.6 Sol + Imagen 4

实战:6 项目实测数据(CalcGuide 编辑部)

项目原选8 月新选提效成本变化
代码迁移 500 万行(Java → Kotlin)Opus 4.8Claude Opus 5+35% 速度-50% 成本
客服 Agent(日均 8 万会话)GPT-5GPT-5.6 Sol + Luna3x 并发-65% 成本
内部知识库 RAG(5000 万文档)Qwen2.5Qwen3.8-Max 自部署+20% 召回内网零成本
多模态客服(图片+视频)GPT-5 VisionGemini 3.7 Flash视频理解质变-40% 成本
多 Agent 研究(并行 5 sub-agent)手工编排GPT-5.6 Sol「ultra」单任务 3x 提速持平
极端 coding benchmark(SWE-Bench Pro)Opus 4.8Claude Fable 580.3% 通过率2x 成本,但不可替代

我的选型建议:3 条铁律

因为信任所以简单——经过 6 个项目实测,我把 8 月迭代沉淀成 3 条选型铁律:

铁律 1:默认 Opus 5,长任务才升 Fable 5

Opus 5 在 CursorBench 3.2 距 Fable 5 只差 0.5%,但价格一半、thinking 默认开、新增 effort 参数(low / medium / high / xhigh / max)。95% 场景 Opus 5 够用,剩下 5%(全 repo 1M context 极限分析 / Mythos 级安全 coding)才升 Fable 5。

铁律 2:批量任务跑 Luna,主力任务跑 Opus 5

Luna $0.20/M token 不是给你日常用的,是给你**「日均 100 万 token 以上批量任务」**用的。比如客服意图识别、垃圾评论过滤、ETL 数据清洗。主力任务永远在 Opus 5 / Sol 这档——Luna 失误一次的成本 > Opus 5 跑一年的成本。

铁律 3:多模态只选 Gemini,国产合规只选 Qwen3.8-Max

这两个生态位 8 月没有任何对手。Gemini 3.7 Flash 在视频理解上是断崖式领先,Qwen3.8-Max 在国产 AA 榜 55.4 分登顶+开源+可自部署。其他模型碰这两个场景,直接放弃。


5 条迁移 checklist(从旧模型 → 8 月新模型)

owner 意识:别一拍脑袋就迁移,先走这 5 步。

  • 盘点 prompt 中所有 thinking: disabled(Opus 4.8 习惯)→ Opus 5 默认 thinking 开,必须审 max_tokens,否则高 effort 触发 400 报错
  • 预算盘:Fable 5 vs Opus 5 的成本差是 2 倍,先把 Fable 5 调用比例压到 < 5%
  • 并行测试:同一任务跑 Opus 5 + Fable 5 + Sol 三档,CursorBench 3.2 分数差距 < 5% 时,锁定 Opus 5
  • 多模态分流:所有图片 / 视频请求走 Gemini,文本请求走 Opus 5,不要混在一个 endpoint
  • 国产合规白名单:金融 / 政企 / 医疗项目,Qwen3.8-Max 自部署是必选,不是可选

写在最后:模型战打到第三阶段,我们该期待什么

8 月这波换代,头部四家集体砍价、集体开源、集体扩 context——这不是竞争白热化,是**「L5 级商品化」**的信号。意思是:模型本身的差异正在被工程化抹平,未来 12 个月,选型的差异会从「选哪家模型」变成「选哪条工程化路径」。

我们这一代工程师的好消息:模型越便宜,我们越值钱——因为部署、护栏、可观察性、AgentOps 的工程能力,会从「加分项」变成「入场券」。

下一次再写月报,我会把 8 模型对比升级成 15 模型 + 6 框架 + 10 工具栈的三维矩阵。继续卷。


工具推荐

模型订阅

部署 & 编排

工程师办公


相关阅读


参考资料