Back to Research
GLM 5.3 vs Claude Opus 4.8:编程与 Agent 能力对比

GLM 5.3 vs Claude Opus 4.8:编程与 Agent 能力对比

Article Information

51agentic.com
August 16, 2026
AI大模型评测

GLM 5.3 vs Claude Opus 4.8:编程与 Agent 能力对比

GLM 5.3 和 Claude Opus 4.8 都面向复杂编程与多步 Agent 任务,但两者的优势并不重合。前者在 Z.AI 公布的多项终端、自动化和持续工程基准中领先,并计划开放模型权重;后者则在代码仓库生成、长程软件任务、计算机使用和成熟的企业接入方面更有优势。

因此,这不是一个简单的“谁更强”问题。选择哪一个,取决于任务主要发生在终端还是代码仓库、是否需要自托管、能否接受新模型发布初期的不确定性,以及一次失败任务的代价。

GLM 5.3 与 Claude Opus 4.8 模型对比

核心结论

问题结论
哪个模型总体更强?没有绝对赢家。GLM 5.3 在多项终端与自动化基准领先,Opus 4.8 在代码仓库生成、长程软件任务和工具综合能力上占优。
哪个更适合编程 Agent?终端密集、长循环和未来自托管优先测试 GLM 5.3;复杂仓库改造、计算机操作和稳健工具执行优先测试 Opus 4.8。
哪个更便宜?暂时无法直接比较。Opus 4.8 已有明确 API 价格,GLM 5.3 发布时尚未公布对应的按量费率。
应该如何决策?用相同任务、工具、时间限制和预算进行并行测试,以任务通过率和完整交付成本为准。

规格与定位对比

对比项GLM 5.3Claude Opus 4.8
发布时间2026 年 8 月 14 日2026 年 5 月 28 日
主要定位终端编程、持续工程、自动化与可控部署代码仓库任务、计算机使用、严谨工具执行与专业输出
模型形态文本型 Agent 编程模型,权重计划后续开放闭源混合推理模型
上下文窗口部分官方评测最高使用 1M tokens最高 1M tokens
推理设置lowhighmax,不能关闭 thinking默认 high,复杂任务可使用 extramax
已确认 API 价格发布时未列出每百万输入 5 美元、输出 25 美元
获取方式API、GLM Coding Plan;权重计划后续发布Claude、Claude Code、API 与主流云平台

GLM 5.3 更强调工程执行的灵活性和未来部署控制,Opus 4.8 则提供较成熟的产品生态与企业接入。对生产团队而言,模型能力之外的权限管理、服务稳定性、审计和回滚能力同样会影响最终选择。

GLM 5.3 有哪些变化?

GLM 5.3 没有更换预训练底座,仍基于 GLM 5.2 的基础模型。Z.AI 将主要改进归因于规模化后训练,包括更多任务环境、更丰富的任务类型和更高训练算力。官方称其私有 Code Bench 相比 GLM 5.2 提升 50%,但由于测试集和完整评测流程未公开,这个数字更适合作为早期信号,而不是独立结论。

GLM 5.3 发布视觉

API 行为也有需要迁移方注意的变化:GLM 5.3 提供 lowhighmax 三档 reasoning effort,官方建议编程任务使用 max。thinking 不能关闭,沿用 GLM 5.2 旧参数的请求可能失败。

在 Z.AI 私有 Code Bench 的 high effort 设置下,GLM 5.3 得分为 31.4%,平均每项任务使用约 50K 输出 tokens;表中 Opus 4.8 得分 29.5%,约使用 120K 输出 tokens。这显示 GLM 5.3 可能具有更好的推理效率,但单个私有基准不足以证明它在所有工作负载中成本更低。

Z.AI 同时表示,模型权重计划在发布约两周后、完成额外安全评估与加固后开放。在权重真正发布并明确许可证、硬件需求和推理性能前,自托管仍应视为规划中的能力。

编程与 Agent 基准对比

下表采用 Z.AI 在 GLM 5.3 发布材料中给出的统一对比数据。它避免了直接拼接不同来源的分数,但仍属于模型提供方公布的结果,尚不能替代独立测试。

基准GLM 5.3Opus 4.8领先者
Terminal-Bench 2.188.285.0GLM 5.3
Terminal-Bench 3.028.321.1GLM 5.3
FrontierSWE78.166.5GLM 5.3
PostTrainBench39.832.9GLM 5.3
AutomationBench48.241.0GLM 5.3
HLE with tools62.557.9GLM 5.3
NL2Repo58.069.7Opus 4.8
SWE-Marathon42.548.8Opus 4.8
Toolathlon Verified73.076.2Opus 4.8

GLM 5.3 的领先项目主要集中在终端操作、实验与验证循环,以及长时间维持工程目标。这类能力适合依赖 Shell、测试工具、构建系统和自动化流水线的任务。

Opus 4.8 在 NL2Repo、SWE-Marathon 和 Toolathlon Verified 上领先,说明它在从需求构建代码仓库、长程软件开发和多工具协作方面仍有明确优势。Anthropic 另行公布的 OSWorld-Verified 成绩为 83.4%,也反映出其计算机使用能力,但这项数据不是与 GLM 5.3 在相同设置下的直接对比。

为什么同一个模型会出现不同分数?

基准成绩不仅取决于模型 ID,还会受到 Agent 框架、可用工具、推理强度、上下文限制、超时、最大执行轮数和通过标准影响。

例如,Anthropic 公布的 Opus 4.8 Terminal-Bench 2.1 成绩为 74.6,而 Z.AI 对比表中为 85.0。两者不一定互相矛盾,更可能反映测试框架和配置不同。因此,只有在相同环境中产生的结果才适合横向比较。

价格、访问方式与部署控制

GLM 5.3

GLM 5.3 发布时已向 GLM Coding Plan 用户开放。该计划以点数统计输入、缓存输入和输出 tokens,非高峰时段消耗更低;但发布当天的公开按量价格表尚未列出 GLM 5.3。直接套用 GLM 5.2 的费率,会让成本比较建立在未经确认的假设上。

GLM 5.3 更明确的差异是部署控制。若权重按计划开放,团队可以进一步评估自托管、私有基础设施或第三方推理服务。开放权重并不等于低成本:前沿模型通常需要昂贵硬件、量化与并行优化、监控和持续运维,但它能降低对单一托管 API 的依赖。

Claude Opus 4.8

Opus 4.8 的标准 API 价格为每百万输入 tokens 5 美元、每百万输出 tokens 25 美元;Fast mode 分别为 10 美元和 50 美元。Anthropic 表示,prompt caching 最多可节省 90%,批处理最多可节省 50%,实际节省幅度取决于缓存命中率和任务结构。

它已经可以通过 Claude、Claude Code、Anthropic API、AWS、Google Cloud 和 Microsoft Foundry 使用。对于需要稳定采购、云平台权限控制与企业支持的团队,这种成熟度可能比单项基准领先更重要。

应该选择哪个模型?

优先测试 GLM 5.3,如果任务高度依赖终端,包含较长的优化、构建或自动化循环,并且未来可能需要开放权重与私有部署。团队还需要能够接受新模型早期的价格、兼容性和独立评测尚不充分。

优先测试 Opus 4.8,如果主要任务是复杂代码仓库改造、计算机使用、严格工具执行和高完成度输出,或者生产环境更看重成熟的 API、云平台接入与供应商支持。

按任务组合使用,如果工作负载差异很大。可以让 GLM 5.3 处理长时间终端任务,让 Opus 4.8 负责复杂仓库变更、审查或失败后的恢复。基于任务类型进行路由,通常比为所有任务设置同一个高成本默认模型更合理。

一套可复用的实测方法

  1. 从真实工作中选择 10 到 30 个任务,覆盖仓库修改、终端操作和多工具流程。
  2. 固定提示词、文件、工具权限、Agent 框架、超时、最大轮数和预算。
  3. 为两个模型设置可比的推理强度,但不要假设不同厂商的 effort 名称完全等价。
  4. 使用测试、静态检查或人工验收清单判断任务是否真正完成。
  5. 记录通过率、重试次数、耗时、输入与输出 tokens、工具调用和人工修正时间。
  6. 以“每个验收通过任务的总成本”排序,而不是只比较单项跑分或 token 单价。

最终结论

GLM 5.3 在终端执行、自动化和持续工程任务上展现出很强的早期信号,潜在的开放权重也给部署带来更多选择。Claude Opus 4.8 则在仓库生成、长程软件任务、计算机使用和成熟接入方面保持优势。

如果决策核心是终端能力、长循环和部署控制,应优先评估 GLM 5.3;如果一次失败的代价很高,并且更重视稳健判断、计算机操作和企业级可用性,应优先评估 Opus 4.8。最终默认模型应由同一测试环境下的任务通过率、完整成本和人工清理量决定。

Related Tags

GLM 5.3Claude Opus 4.8AI Agent编程模型模型对比

More Articles

Continue with related AI tool news and reviews.