8 月 AI 模型决策框架:GPT-5.6 / Claude Fable 5 / Gemini 3.7 / Qwen3.8 四强争霸与选型实战
前言
2026 年 8 月最后一周,我打开 Anthropic、OpenAI、Google、阿里四家后台,模型版本号全部刷新了一遍。这种「四家同月迭代」的密度,过去两年只在 2024 年 Q4 出现过一次,代价是三个月后三家股价跳水。这次不一样——价格没涨,反而 GPT-5.6 Luna 降了 80%、Gemini 3.6 Flash 降了 65%,Claude Opus 5 直接砍到 Fable 5 一半。这是模型战打到第三阶段才有的信号:头部 AI 公司不再卷 benchmark,开始卷 ROI。
我们 CalcGuide 编辑部用了两周时间,在 6 个真实项目里(代码迁移 / 长文档摘要 / 客服 Agent / 多模态客服 / 内部知识库 / 极端 coding benchmark)同时跑 GPT-5.6 Sol/Terra/Luna、Claude Opus 5 / Fable 5、Gemini 3.7 Flash、阿里 Qwen3.8-Max、DeepSeek V4 Pro、智谱 GLM-5.3 Flash 共 8 个模型,得出3 维度决策框架。
核心论点:2026 年 8 月之后,模型选型不是选「最好的」,是选「最贴合你预算与场景的三角」。同一团队同一个月里,我们用 Claude Opus 5 跑代码迁移、用 GPT-5.6 Luna 跑客服 Agent、用 Gemini 3.7 Flash 跑多模态 —— 不是一棵树,是三棵树。本文把这片「模型森林」如何选、如何配,一次性讲清。
决策框架 3 维度
维度 1:场景 —— 你拿模型做什么
8 月新格局:同一家厂商出 3 个版本(OpenAI Sol/Terra/Luna),就是为了让你按场景挑。
| 场景类型 | 推荐模型(2026-08) | 理由 |
|---|---|---|
| 长任务代码迁移 / 极限 SWE-Bench | Claude Fable 5 | SWE-Bench Pro 80.3%,全行业第一 |
| 日常 coding / Sub-agent / IDE 集成 | Claude Opus 5 | Fable 5 同档实力,半价 ($5/$25) |
| 客服 Agent / 长任务自动化 | GPT-5.6 Sol | Terminal-Bench 2.1 91.9%,8 Agent 并行 |
| 多模态客服(图片+语音+视频) | Gemini 3.7 Flash | 思考等级可调,视频理解行业领先 |
| 企业内网 / 私有部署 / 数据出境严格 | Qwen3.8-Max | 2.4T MoE 开源权重,AA 榜 55.4 分登顶 |
| 高性价比 RAG / 长 context(1M+) | DeepSeek V4 Pro | 1M context,Harness 框架开源 |
| 极致低成本 / 大批量推理 | GPT-5.6 Luna | $0.20/M tokens,降价 80% |
| 国产算力卡 / 信创合规 | GLM-5.3 Flash(OxAlpha) | 320B 跑在 10 万张国产卡 |
维度 2:预算 —— 一个月愿意烧多少
8 月新格局:同样的能力,价格能差 25 倍。
| 月预算 | 推荐组合 | 备注 |
|---|---|---|
| $0 | Qwen3.8-Max / GLM-5.3 / DeepSeek V4-Flash | 国产三强免费 API + 本地推理 |
| < $50 | GPT-5.6 Luna + Gemini 3.7 Flash | $0.20 + $0.075,跑通 PoC 足够 |
| $50-500 | Claude Opus 5 + GPT-5.6 Terra | 主力 Opus 5,Terra 跑批量 |
| $500-5000 | Claude Opus 5 + Claude Fable 5 混合 | 长任务 Fable 5、日常 Opus 5 |
| $5000+ | 8 模型混部 + 自部署 Qwen3.8-Max | Fable 5 + 自建推理集群,长 context 内网跑 |
维度 3:技术栈 —— 团队能跑什么
| 技术栈现状 | 推荐 | 理由 |
|---|---|---|
| 纯 JS/TS,刚上 Agent | DeepSeek Harness (dsh) + Gemini 3.7 Flash | npx @deepseek-ai/dsh web 5 分钟拉起 |
| Python / LangChain 老用户 | LangChain + Claude Opus 5 | 生态最大,Opus 5 thinking 默认开 |
| 企业 Java / Go,合规严格 | Qwen3.8-Max 自部署 + Mythos 安全套件 | 全栈国产生态 |
| 多模态 / 视频 / 直播 | Gemini 3.7 Flash + Vertex AI | 思考等级 + 多模态 SOTA |
| 多 Agent 并行 / 研究类 | GPT-5.6 Sol「ultra」模式 | 8 Agent 并行,WebMCP 直接调网站结构化工具 |
8 模型横向对比表(2026-08-28 实测)
数据源:官方发布页 + Artificial Analysis 榜 + 我们 6 个项目实测。所有价格按 input / output 每百万 token 计。
| 模型 | 厂商 | Context | 输出上限 | 定价(USD/M) | SWE/Code 基准 | Agent 基准 | 长文档 | 多模态 | 私有部署 |
|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5 | Anthropic | 1M | 128K | $10 / $50 | SWE-Bench Pro 80.3% | Frontier-Bench 33.7% | 顶 | 强 | ❌ |
| Claude Opus 5 | Anthropic | 1M | 64K | $5 / $25 | CursorBench 3.2 ≈ Fable-0.5% | Frontier-Bench 43.3% | 强 | 强 | ❌ |
| GPT-5.6 Sol | OpenAI | 1.05M | 64K | $3 / $15 | Terminal-Bench 2.1 91.9% | WebMCP 8 Agent 并行 | 强 | 中 | ❌ |
| GPT-5.6 Terra | OpenAI | 1.05M | 64K | $1.5 / $6 | 平衡档 | 平衡档 | 中 | 中 | ❌ |
| GPT-5.6 Luna | OpenAI | 256K | 16K | $0.20 / $0.80 | 速度档 | 简单 Agent | 一般 | 弱 | ❌ |
| Gemini 3.7 Flash | 1M | 64K | $0.075 / $0.30 | Coding 大幅提升 | 思考等级可调 | 强 | 顶 | ❌ | |
| Qwen3.8-Max | 阿里 | 1M | 32K | 开源权重 + API | AA 榜 55.4 分 | GUI Agent 超 GPT-5.6 | 强 | 强 | ✅ |
| DeepSeek V4 Pro | DeepSeek | 1M | 32K | $0.55 / $2.2 | Harness 开源 | Harness 全套 | 强 | 中 | ✅ |
| GLM-5.3 Flash | 智谱 | 128K | 8K | 开源权重 | 国产算力原生 | 信创合规 | 一般 | 弱 | ✅ |
看表 4 个 takeaway
- Opus 5 是 8 月最大黑马——Frontier-Bench 43.3% 超过 Fable 5 的 33.7%(Fable 5 在最难长任务 / Mythos 安全任务领先),价格只要一半
- Luna 是 8 月最大红利——$0.20/M token 跑通客服 Agent PoC,成本曲线被砸穿
- Gemini 3.7 Flash 是多模态唯一选择——思考等级可调(类似 Opus 5 effort),视频理解行业顶
- 国产开源首次站到 AA 榜第一——Qwen3.8-Max 55.4 分,超过 GPT-5.6 Sol + Claude Opus 5(综合榜)
决策树:2026 年 9 月起,你的项目该选谁
项目是什么类型?
│
├─ 写代码 / 重构 / 测试
│ │
│ ├─ 单 repo < 50 万行,普通 IDE 集成
│ │ └─ ✅ Claude Opus 5($5/$25,thinking 默认开)
│ │
│ ├─ 单 repo > 50 万行,要 1M context 全量分析
│ │ └─ ✅ Claude Fable 5(最强,但贵 1 倍)
│ │
│ ├─ 要并行 8 个 sub-agent 跑 terminal task
│ │ └─ ✅ GPT-5.6 Sol(Terminal-Bench 91.9%)
│ │
│ └─ 私有部署 / 内网合规
│ └─ ✅ Qwen3.8-Max(自部署)或 DeepSeek V4 Pro
│
├─ Agent / 自动化
│ │
│ ├─ 客服 Agent / 长任务(8 小时+)
│ │ └─ ✅ GPT-5.6 Sol(8 Agent 并行 + WebMCP)
│ │
│ ├─ 简单批量 Agent / 成本敏感
│ │ └─ ✅ GPT-5.6 Luna($0.20/M token)
│ │
│ ├─ GUI 自动化(浏览器 / 桌面)
│ │ └─ ✅ Qwen-UI-Agent(阿里开源)+ Claude Opus 5 兜底
│ │
│ └─ 多模态 Agent(看图 / 看视频)
│ └─ ✅ Gemini 3.7 Flash
│
├─ 长文档摘要 / RAG / 知识库
│ │
│ ├─ 内网 + 数据不能出境
│ │ └─ ✅ Qwen3.8-Max 自部署
│ │
│ ├─ 跨境 + 1M context + 中文为主
│ │ └─ ✅ DeepSeek V4 Pro
│ │
│ └─ 跨境 + 多语言 + 极致成本
│ └─ ✅ Gemini 3.7 Flash
│
└─ 多模态客服 / 视频 / 直播
├─ 视频理解 / 直播字幕
│ └─ ✅ Gemini 3.7 Flash
└─ 图片生成 + 文案
└─ ✅ GPT-5.6 Sol + Imagen 4
实战:6 项目实测数据(CalcGuide 编辑部)
| 项目 | 原选 | 8 月新选 | 提效 | 成本变化 |
|---|---|---|---|---|
| 代码迁移 500 万行(Java → Kotlin) | Opus 4.8 | Claude Opus 5 | +35% 速度 | -50% 成本 |
| 客服 Agent(日均 8 万会话) | GPT-5 | GPT-5.6 Sol + Luna | 3x 并发 | -65% 成本 |
| 内部知识库 RAG(5000 万文档) | Qwen2.5 | Qwen3.8-Max 自部署 | +20% 召回 | 内网零成本 |
| 多模态客服(图片+视频) | GPT-5 Vision | Gemini 3.7 Flash | 视频理解质变 | -40% 成本 |
| 多 Agent 研究(并行 5 sub-agent) | 手工编排 | GPT-5.6 Sol「ultra」 | 单任务 3x 提速 | 持平 |
| 极端 coding benchmark(SWE-Bench Pro) | Opus 4.8 | Claude Fable 5 | 80.3% 通过率 | 2x 成本,但不可替代 |
我的选型建议:3 条铁律
因为信任所以简单——经过 6 个项目实测,我把 8 月迭代沉淀成 3 条选型铁律:
铁律 1:默认 Opus 5,长任务才升 Fable 5
Opus 5 在 CursorBench 3.2 距 Fable 5 只差 0.5%,但价格一半、thinking 默认开、新增 effort 参数(low / medium / high / xhigh / max)。95% 场景 Opus 5 够用,剩下 5%(全 repo 1M context 极限分析 / Mythos 级安全 coding)才升 Fable 5。
铁律 2:批量任务跑 Luna,主力任务跑 Opus 5
Luna $0.20/M token 不是给你日常用的,是给你**「日均 100 万 token 以上批量任务」**用的。比如客服意图识别、垃圾评论过滤、ETL 数据清洗。主力任务永远在 Opus 5 / Sol 这档——Luna 失误一次的成本 > Opus 5 跑一年的成本。
铁律 3:多模态只选 Gemini,国产合规只选 Qwen3.8-Max
这两个生态位 8 月没有任何对手。Gemini 3.7 Flash 在视频理解上是断崖式领先,Qwen3.8-Max 在国产 AA 榜 55.4 分登顶+开源+可自部署。其他模型碰这两个场景,直接放弃。
5 条迁移 checklist(从旧模型 → 8 月新模型)
owner 意识:别一拍脑袋就迁移,先走这 5 步。
- 盘点 prompt 中所有
thinking: disabled(Opus 4.8 习惯)→ Opus 5 默认 thinking 开,必须审max_tokens,否则高 effort 触发 400 报错 - 预算盘:Fable 5 vs Opus 5 的成本差是 2 倍,先把 Fable 5 调用比例压到 < 5%
- 并行测试:同一任务跑 Opus 5 + Fable 5 + Sol 三档,CursorBench 3.2 分数差距 < 5% 时,锁定 Opus 5
- 多模态分流:所有图片 / 视频请求走 Gemini,文本请求走 Opus 5,不要混在一个 endpoint
- 国产合规白名单:金融 / 政企 / 医疗项目,Qwen3.8-Max 自部署是必选,不是可选
写在最后:模型战打到第三阶段,我们该期待什么
8 月这波换代,头部四家集体砍价、集体开源、集体扩 context——这不是竞争白热化,是**「L5 级商品化」**的信号。意思是:模型本身的差异正在被工程化抹平,未来 12 个月,选型的差异会从「选哪家模型」变成「选哪条工程化路径」。
我们这一代工程师的好消息:模型越便宜,我们越值钱——因为部署、护栏、可观察性、AgentOps 的工程能力,会从「加分项」变成「入场券」。
下一次再写月报,我会把 8 模型对比升级成 15 模型 + 6 框架 + 10 工具栈的三维矩阵。继续卷。
工具推荐
模型订阅
- Claude Pro 个人版:Opus 5 默认订阅,月费 $20
- Claude Max 团队版:Fable 5 + Opus 5 全档
- ChatGPT Plus:GPT-5.6 Sol/Terra/Luna 全档
- Google AI Pro:Gemini 3.7 Flash 全档
- Qwen API 套餐:Qwen3.8-Max + Qwen-UI-Agent
部署 & 编排
- DeepSeek Harness (
dsh):插件式 Agent 平台,JS/TS 原生 - LangChain:Python 老牌,Opus 5 thinking 默认开兼容最好
- vLLM:自部署 Qwen3.8-Max 必备
- Cursor Pro:Opus 5 IDE 集成
- Ollama:本机跑 Qwen3.8-Max 量化版
工程师办公
- Anker 100W 充电宝:on-call 不断电
- Keychron 机械键盘:月报写得快
- Logitech MX Master 鼠标:翻 benchmark 数据利器
- 华为 MateBook X Pro:国产生态旗舰
相关阅读
- OpenAI Agent 也越狱了:8.27 联合公开信 + Hugging Face 事件复盘,给开发者的 5 条防御清单
- Harness 全景解读:从 DeepSeek Harness 到主流 Agent 框架对比
- AI 工具选型决策框架:按需求/预算/技术栈 3 维度选最合适的
- Claude Code Skills 系统教程:从零开始自定义 AI 编程助手
参考资料
- Anthropic: Introducing Claude Opus 5
- Brandligo: Claude Opus 5 Launch: What’s New, Pricing and Benchmarks
- Benchlm: Claude Fable 5 vs Claude Opus 5: Benchmarks & Cost
- TechCrunch: OpenAI, Anthropic, Google, and 100 other companies call for action to defend against rogue AI
- 大模型周报第42 周:Agent 走出聊天框,国产开源打穿流量
- 2026 年 8 月全球 AI 大模型前沿洞察:Agent 能力、开源换道与训练数据新基建
- Gemini 3 Flash 全球上线](https://www.fonearena.com/blog?p=471525)