GLM 5.3 vs Claude Opus 4.8:编程与 Agent 能力对比
GLM 5.3 和 Claude Opus 4.8 都面向复杂编程与多步 Agent 任务,但两者的优势并不重合。前者在 Z.AI 公布的多项终端、自动化和持续工程基准中领先,并计划开放模型权重;后者则在代码仓库生成、长程软件任务、计算机使用和成熟的企业接入方面更有优势。
因此,这不是一个简单的“谁更强”问题。选择哪一个,取决于任务主要发生在终端还是代码仓库、是否需要自托管、能否接受新模型发布初期的不确定性,以及一次失败任务的代价。

核心结论
| 问题 | 结论 |
|---|---|
| 哪个模型总体更强? | 没有绝对赢家。GLM 5.3 在多项终端与自动化基准领先,Opus 4.8 在代码仓库生成、长程软件任务和工具综合能力上占优。 |
| 哪个更适合编程 Agent? | 终端密集、长循环和未来自托管优先测试 GLM 5.3;复杂仓库改造、计算机操作和稳健工具执行优先测试 Opus 4.8。 |
| 哪个更便宜? | 暂时无法直接比较。Opus 4.8 已有明确 API 价格,GLM 5.3 发布时尚未公布对应的按量费率。 |
| 应该如何决策? | 用相同任务、工具、时间限制和预算进行并行测试,以任务通过率和完整交付成本为准。 |
规格与定位对比
| 对比项 | GLM 5.3 | Claude Opus 4.8 |
|---|---|---|
| 发布时间 | 2026 年 8 月 14 日 | 2026 年 5 月 28 日 |
| 主要定位 | 终端编程、持续工程、自动化与可控部署 | 代码仓库任务、计算机使用、严谨工具执行与专业输出 |
| 模型形态 | 文本型 Agent 编程模型,权重计划后续开放 | 闭源混合推理模型 |
| 上下文窗口 | 部分官方评测最高使用 1M tokens | 最高 1M tokens |
| 推理设置 | low、high、max,不能关闭 thinking | 默认 high,复杂任务可使用 extra 和 max |
| 已确认 API 价格 | 发布时未列出 | 每百万输入 5 美元、输出 25 美元 |
| 获取方式 | API、GLM Coding Plan;权重计划后续发布 | Claude、Claude Code、API 与主流云平台 |
GLM 5.3 更强调工程执行的灵活性和未来部署控制,Opus 4.8 则提供较成熟的产品生态与企业接入。对生产团队而言,模型能力之外的权限管理、服务稳定性、审计和回滚能力同样会影响最终选择。
GLM 5.3 有哪些变化?
GLM 5.3 没有更换预训练底座,仍基于 GLM 5.2 的基础模型。Z.AI 将主要改进归因于规模化后训练,包括更多任务环境、更丰富的任务类型和更高训练算力。官方称其私有 Code Bench 相比 GLM 5.2 提升 50%,但由于测试集和完整评测流程未公开,这个数字更适合作为早期信号,而不是独立结论。

API 行为也有需要迁移方注意的变化:GLM 5.3 提供 low、high、max 三档 reasoning effort,官方建议编程任务使用 max。thinking 不能关闭,沿用 GLM 5.2 旧参数的请求可能失败。
在 Z.AI 私有 Code Bench 的 high effort 设置下,GLM 5.3 得分为 31.4%,平均每项任务使用约 50K 输出 tokens;表中 Opus 4.8 得分 29.5%,约使用 120K 输出 tokens。这显示 GLM 5.3 可能具有更好的推理效率,但单个私有基准不足以证明它在所有工作负载中成本更低。
Z.AI 同时表示,模型权重计划在发布约两周后、完成额外安全评估与加固后开放。在权重真正发布并明确许可证、硬件需求和推理性能前,自托管仍应视为规划中的能力。
编程与 Agent 基准对比
下表采用 Z.AI 在 GLM 5.3 发布材料中给出的统一对比数据。它避免了直接拼接不同来源的分数,但仍属于模型提供方公布的结果,尚不能替代独立测试。
| 基准 | GLM 5.3 | Opus 4.8 | 领先者 |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 85.0 | GLM 5.3 |
| Terminal-Bench 3.0 | 28.3 | 21.1 | GLM 5.3 |
| FrontierSWE | 78.1 | 66.5 | GLM 5.3 |
| PostTrainBench | 39.8 | 32.9 | GLM 5.3 |
| AutomationBench | 48.2 | 41.0 | GLM 5.3 |
| HLE with tools | 62.5 | 57.9 | GLM 5.3 |
| NL2Repo | 58.0 | 69.7 | Opus 4.8 |
| SWE-Marathon | 42.5 | 48.8 | Opus 4.8 |
| Toolathlon Verified | 73.0 | 76.2 | Opus 4.8 |
GLM 5.3 的领先项目主要集中在终端操作、实验与验证循环,以及长时间维持工程目标。这类能力适合依赖 Shell、测试工具、构建系统和自动化流水线的任务。
Opus 4.8 在 NL2Repo、SWE-Marathon 和 Toolathlon Verified 上领先,说明它在从需求构建代码仓库、长程软件开发和多工具协作方面仍有明确优势。Anthropic 另行公布的 OSWorld-Verified 成绩为 83.4%,也反映出其计算机使用能力,但这项数据不是与 GLM 5.3 在相同设置下的直接对比。
为什么同一个模型会出现不同分数?
基准成绩不仅取决于模型 ID,还会受到 Agent 框架、可用工具、推理强度、上下文限制、超时、最大执行轮数和通过标准影响。
例如,Anthropic 公布的 Opus 4.8 Terminal-Bench 2.1 成绩为 74.6,而 Z.AI 对比表中为 85.0。两者不一定互相矛盾,更可能反映测试框架和配置不同。因此,只有在相同环境中产生的结果才适合横向比较。
价格、访问方式与部署控制
GLM 5.3
GLM 5.3 发布时已向 GLM Coding Plan 用户开放。该计划以点数统计输入、缓存输入和输出 tokens,非高峰时段消耗更低;但发布当天的公开按量价格表尚未列出 GLM 5.3。直接套用 GLM 5.2 的费率,会让成本比较建立在未经确认的假设上。
GLM 5.3 更明确的差异是部署控制。若权重按计划开放,团队可以进一步评估自托管、私有基础设施或第三方推理服务。开放权重并不等于低成本:前沿模型通常需要昂贵硬件、量化与并行优化、监控和持续运维,但它能降低对单一托管 API 的依赖。
Claude Opus 4.8
Opus 4.8 的标准 API 价格为每百万输入 tokens 5 美元、每百万输出 tokens 25 美元;Fast mode 分别为 10 美元和 50 美元。Anthropic 表示,prompt caching 最多可节省 90%,批处理最多可节省 50%,实际节省幅度取决于缓存命中率和任务结构。
它已经可以通过 Claude、Claude Code、Anthropic API、AWS、Google Cloud 和 Microsoft Foundry 使用。对于需要稳定采购、云平台权限控制与企业支持的团队,这种成熟度可能比单项基准领先更重要。
应该选择哪个模型?
优先测试 GLM 5.3,如果任务高度依赖终端,包含较长的优化、构建或自动化循环,并且未来可能需要开放权重与私有部署。团队还需要能够接受新模型早期的价格、兼容性和独立评测尚不充分。
优先测试 Opus 4.8,如果主要任务是复杂代码仓库改造、计算机使用、严格工具执行和高完成度输出,或者生产环境更看重成熟的 API、云平台接入与供应商支持。
按任务组合使用,如果工作负载差异很大。可以让 GLM 5.3 处理长时间终端任务,让 Opus 4.8 负责复杂仓库变更、审查或失败后的恢复。基于任务类型进行路由,通常比为所有任务设置同一个高成本默认模型更合理。
一套可复用的实测方法
- 从真实工作中选择 10 到 30 个任务,覆盖仓库修改、终端操作和多工具流程。
- 固定提示词、文件、工具权限、Agent 框架、超时、最大轮数和预算。
- 为两个模型设置可比的推理强度,但不要假设不同厂商的 effort 名称完全等价。
- 使用测试、静态检查或人工验收清单判断任务是否真正完成。
- 记录通过率、重试次数、耗时、输入与输出 tokens、工具调用和人工修正时间。
- 以“每个验收通过任务的总成本”排序,而不是只比较单项跑分或 token 单价。
最终结论
GLM 5.3 在终端执行、自动化和持续工程任务上展现出很强的早期信号,潜在的开放权重也给部署带来更多选择。Claude Opus 4.8 则在仓库生成、长程软件任务、计算机使用和成熟接入方面保持优势。
如果决策核心是终端能力、长循环和部署控制,应优先评估 GLM 5.3;如果一次失败的代价很高,并且更重视稳健判断、计算机操作和企业级可用性,应优先评估 Opus 4.8。最终默认模型应由同一测试环境下的任务通过率、完整成本和人工清理量决定。


