Grok 4.6 评测:价格、基准测试与升级建议
Grok 4.6 是 xAI 面向编程、知识工作和长时间 Agent 任务推出的新模型。它保留了 Grok 4.5 的标准 API 单价与 500K 上下文窗口,同时在厂商公布的多项编程和 Agent 基准中取得明显提升。
不过,新模型并不等于所有场景下都更划算。长上下文会触发整次请求涨价,缓存输入也比 Grok 4.5 更贵;而且发布初期的大部分结果仍来自厂商。真正的选型依据应该是自己的任务完成率、重试次数、延迟和总成本。
核心结论
| 问题 | 结论 |
|---|---|
| 何时发布? | 2026 年 8 月 12 日,已通过 xAI API、Grok Build、Cursor 和部分模型网关提供。 |
| 基础价格是多少? | 低于 200K tokens 时,每百万输入 2 美元、缓存输入 0.50 美元、输出 6 美元。 |
| 相比 Grok 4.5 有何提升? | xAI 公布的数据集中在编程、知识工作和长时间 Agent 执行,DeepSWE 1.1 提升最明显。 |
| 是否是最强编程模型? | 不是所有任务都领先。Terminal-Bench 3.0 成绩仍落后于部分前沿模型。 |
| 是否值得升级? | 值得纳入重点评估,但应先在真实代码库和固定验收标准下做对照测试。 |
发布信息与模型规格
Grok 4.6 于 2026 年 8 月 12 日发布,可通过 xAI API、Grok Build、Cursor,以及 OpenRouter、Vercel、Cloudflare 等渠道访问。不同入口采用各自的额度与计费方式,个人订阅通常不等于 API 额度。

| 规格 | Grok 4.6 |
|---|---|
| 上下文窗口 | 500K tokens |
| 知识截止日期 | 2026 年 2 月 1 日 |
| 输入 | 文本、图像 |
| 输出 | 文本 |
| 推理强度 | low、medium、high、xhigh |
| API 形式 | Responses、Chat Completions |
| 工具能力 | 函数调用、网页搜索、X 搜索、代码执行 |
500K 上下文适合容纳大型代码库、工具结果和长任务轨迹,但内置知识的截止日期不会因为上下文变长而改变。需要最新信息时,仍要显式启用搜索工具并验证来源。
基准测试:提升明显,但证据仍有限
xAI 公布的同代对比数据显示,Grok 4.6 High 在列出的所有项目中都超过 Grok 4.5 High。其中 DeepSWE 1.1 和 Terminal-Bench 3.0 的增幅尤其明显。
| 评估指标 | Grok 4.6 High | Grok 4.5 High | 变化 |
|---|---|---|---|
| AA Intelligence Index | 61 | 56 | +5 |
| GDPVal-AA v2 | 1753 | 1526 | +227 |
| CursorBench 3.2 | 69.9% | 66.7% | +3.2 个百分点 |
| DeepSWE 1.1 | 65.9% | 54.0% | +11.9 个百分点 |
| Terminal-Bench 3.0 | 26.0% | 15.7% | +10.3 个百分点 |
这组数据支持“Grok 4.6 是实质性升级”的判断,但它主要回答了代际进步,而不是跨厂商选型。发布初期的公开证据有限,Agent 表现还会受到系统提示、工具实现、上下文压缩、执行环境和验证循环影响。

编程与 Agent 能力
Grok 4.6 的主要卖点不是短对话,而是持续执行:阅读文件、修改代码、运行测试、处理工具结果,并在失败后恢复。厂商表示训练覆盖了编程、知识工作、网页开发、计算机辅助设计和交互式应用等环境。
需要注意的是,它并未在所有公开对比中领先。Terminal-Bench 3.0 得分为 26.0%,低于同期部分前沿模型的 34% 左右。如果主要工作是复杂终端操作,这项差距比综合智能指数更值得关注。
因此,较准确的说法是:Grok 4.6 为 Agent 化编程提供了很强的早期信号,但目前还不能被视为所有开发任务的通用最优模型。
API 价格:关注 200K 分界线
Grok 4.6 的标准单价颇具竞争力,但“每百万输入 2 美元、输出 6 美元”只适用于提示词低于 200K tokens 的请求。
| 使用类型 | 输入 / 1M | 缓存输入 / 1M | 输出 / 1M |
|---|---|---|---|
| 短上下文,低于 200K tokens | $2.00 | $0.50 | $6.00 |
| 长上下文,达到或超过 200K tokens | $4.00 | $1.00 | $12.00 |
| 优先处理 | 对应费率的 2 倍 | 2 倍 | 2 倍 |
当提示词达到 200K tokens 时,长上下文费率会应用于整次请求,而不只是超出阈值的部分。网页搜索、X 搜索和代码执行还会按工具调用次数另行收费,第三方网关也可能增加服务费用。
为什么要计算每个已完成任务的成本
一个含 100K 未缓存输入和 10K 输出 tokens 的短上下文请求,基础模型成本约为 0.26 美元。一个含 250K 输入和 20K 输出 tokens 的请求,由于整次进入长上下文档位,成本约为 1.24 美元。
Agent 会在多轮操作中重复发送上下文和工具结果,单次 token 价格因而不能代表最终成本。评估时应记录:
- 任务一次完成率与重试次数
- 输入、缓存输入和输出 tokens
- 工具调用次数与失败率
- 总延迟和人工修正时间
- 达到验收标准后的完整成本
如果高单价模型能更快完成任务,它可能反而更省钱;如果模型需要不断重试,再低的标称费率也会失去优势。
Grok 4.6 与 Grok 4.5 对比
| 决策因素 | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 发布时间 | 2026 年 8 月 12 日 | 2026 年 7 月 8 日 |
| 主要定位 | 长时间 Agent、编程、知识和视觉任务 | 快速且强调性价比的工程与 Agent 任务 |
| 上下文窗口 | 500K | 500K |
| 标准输入 / 输出价 | 每 1M 为 $2 / $6 | 每 1M 为 $2 / $6 |
| 短上下文缓存输入价 | 每 1M 为 $0.50 | 每 1M 为 $0.30 |
| 官方同代基准 | 列出的项目均更高 | 较低,但已有更多使用经验 |
长周期编程、研究和应用构建任务更值得优先测试 Grok 4.6,因为标准输入输出费率没有上涨,公开数据又显示能力增强。但 Grok 4.5 并未失去价值:在能大量命中缓存的稳定工作流里,它较低的缓存价格可能带来更好的总成本。
迁移时不要只替换模型名称。应保持任务、系统提示、推理强度、工具和验收标准一致,再比较两个模型的成功率、上下文增长和完整账单。
谁适合使用 Grok 4.6?
以下工作负载值得优先评估:
- 多文件编程、缺陷修复和测试驱动任务
- 需要连续多步工具调用的 Agent
- 技术研究、原型设计和知识分析
- 同时处理文本、图像、文件和工具结果的流程
- 对前沿能力有要求,但仍需要控制 API 成本的团队
如果生产环境难以回滚、主要依赖复杂终端操作,或大量重复请求依赖低价缓存,则应保留现有模型作为对照。在独立测试更充分之前,也不宜仅根据发布基准完成全量迁移。
实用评测方法
- 选择 10 到 30 个来自真实工作流的任务,覆盖简单、常规和困难样本。
- 固定系统提示、工具权限、推理强度、超时和验收条件。
- 让 Grok 4.6 与当前模型分别运行相同任务,必要时重复多次。
- 记录正确性、工具调用轮数、重试、延迟、token 使用和人工清理时间。
- 以“通过验收的任务成本”排序,而不是只比较模型单价或单项基准。
最终结论
Grok 4.6 是一款价格有竞争力、面向 Agent 和编程执行的重要升级。500K 上下文、工具支持以及同代基准提升,使它很适合进入开发团队的模型候选池。
它的限制同样清楚:长上下文价格会翻倍,缓存比 Grok 4.5 更贵,部分终端基准没有领先,而且发布初期的独立证据仍然不足。最稳妥的策略不是立即替换所有模型,而是用真实任务验证可靠性与每个已完成任务的成本,再决定是否扩大使用范围。


