Grok 4.6 发布快评 2026:61分追平GPT-5.6 Sol,API价格砍掉六成,与DeepSeek V4 Pro同夜撞车
海外梯子

北京时间 8 月 13 日凌晨,马斯克旗下 SpaceXAI 正式发布新一代大模型 Grok 4.6。官方口径很直接:Artificial Analysis Intelligence Index 综合 61 分,与 OpenAI 的 GPT-5.6 Sol 持平;GDPval-AA v2 拿到 1753 Elo,反超 Claude Fable 5 的 1741。

更狠的是价格。API 每百万 token 输入 2 美元、输出 6 美元——对比 GPT-5.6 Sol 的 5/30 美元,输出价直接砍到五分之一。同一夜,DeepSeek V4 Pro 正式版(0813)也悄然上线,价格纹丝不动。一场”凌晨模型大战”就此开打。

太长不看版

维度结论
发布2026-08-12(美东)/ 8-13 凌晨(北京时间),SpaceXAI
定位Grok 4.5 的升级版,主打长时间运行的智能体任务和复杂的交互、视觉工作
综合成绩AA Intelligence Index 61 分,与 GPT-5.6 Sol 打平;仅次于 Claude Fable 5(62)和 Opus 5(63)
亮点基准GDPval-AA v2 1753 分超 Fable 5;CursorBench 3.2 达 69.9%,超 GPT-5.6 Sol
定价API $2/$6 每百万 token(输入/输出),约为 GPT-5.6 Sol 的三分之一
上线渠道grok.com、X、iOS/Android、Cursor、Grok Build(首周 2x 用量)、API + OpenRouter/Vercel/Cloudflare
注意点DeepSWE(65.9%)和 Terminal-Bench(26%)仍落后 GPT-5.6 Sol,纯编码终端场景不是最强

一、凌晨两点,两款模型同时开枪

8 月 12 日深夜到 13 日凌晨,AI 圈连着炸了两颗雷:

  1. SpaceXAI 发布 Grok 4.6——相比 Grok 4.5,重点强化长时间运行的智能体(agent)、多步骤复杂任务,以及”把一个想法变成能跑的应用”这类交互式和视觉工作。
  2. DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813)悄然上线——API 文档里的模型版本从预览版切到正式版,价格没涨,多项智能体测试逼近 Claude Fable 5。

两个主打”高性价比打第一梯队”的模型撞在同一个晚上,这不是巧合,是 2026 年大模型价格战的典型节奏。上一轮是 Qwen3.8-Max 开源(8/10),这一轮轮到 Grok 和 DeepSeek 正面刚。

二、Grok 4.6 强在哪:基准数据逐项拆

官方公告给出了与 GPT-5.6 Sol Max、Claude Fable 5 Max 的对比表(均为各家公布的 system card / 榜单数据):

基准Grok 4.6Grok 4.5GPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPval-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.1 (Extended)61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
APEX-SWE56.4%53.6%58.8%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%

读这张表要抓住三条线:

① 综合智能打平第一梯队。 AA Intelligence Index 是 9 项基准的复合分,Grok 4.6 拿到 61,和 GPT-5.6 Sol 并列,只差 Fable 5 的 62。从 Grok 4.5 的 56 直接涨 5 分,在”挤牙膏”成风的行业里算大步。

② 知识工作/代理任务反超。 GDPval-AA v2(真实计算机知识工作)1753 分,超过 GPT-5.6 Sol Max 的 1728 和 Fable 5 Max 的 1741;AA-Briefcase(公文/商务场景)1577 也排第一。媒体实测里有个细节很能说明问题:完成同样的复杂任务,Grok 4.6 大约需要 53 步,Claude Opus 5 需要 103 步——步骤减半意味着规划更高效、中途出错概率更低、调用成本也更低。

③ 纯编码终端仍不是最强。 DeepSWE v1.1(65.9%)和 Terminal-Bench v3.0(26%)明显落后 GPT-5.6 Sol(73% / 34.6%)。所以它的定位是”知识工作 + 长程智能体 + 从想法到成品”,不是无脑吹”最强代码模型”。写代码重度用户,Grok 4.6 可以当第二选择,主力还是看 GPT-5.6 或 Claude 系。

三、价格战:2/6 美元意味着什么

Grok 4.6 的 API 定价维持 Grok 4.5 的水平:

模型输入($/百万token)输出($/百万token)
Grok 4.626
GPT-5.6 Sol530
Claude Opus 5525
DeepSeek V4 Pro0.4350.87
Qwen3.8-Max(国内)约 1.7(¥12)约 5(¥36)

三个观察:

  • 对标 GPT-5.6 Sol,输出价砍掉 80%。 性能打平、价格只有对手三分之一——这就是 SpaceXAI 打开发者市场的逻辑。对成本敏感的中小团队,这是用前夜价格体验前沿模型的机会。
  • 打不过 DeepSeek 的绝对低价。 DeepSeek V4 Pro 输出只要 0.87 美元,是 Grok 4.6 的七分之一。所以 Grok 的”便宜”是相对美国同行,国产模型的价格底线它够不着。
  • 首周双倍用量是实打实的福利。 Cursor 和 Grok Build 里首周 2x included usage,想测 4.6 的趁这周。

四、同夜主角:DeepSeek V4 Pro 正式版

DeepSeek 这次很低调:没有发布会,只是 API 文档把 deepseek-v4-pro 对应的版本切到了 DeepSeek-V4-Pro-0813,调用方式和模型名都不用改。规格:100 万 token 上下文、单次最大输出 38.4 万 token、思考模式默认开启,支持 JSON 输出、工具调用、Responses API 和 Anthropic API。

价格维持:缓存命中输入 0.003625 美元、缓存未命中输入 0.435 美元、输出 0.87 美元(每百万 token)。官方此前预告过 API 要整体涨价,所以现在这波可能是”过渡定价”——想锁定低价 API 的团队,窗口期值得留意。

社群流出的评测对比显示:V4-Pro-0813 相比预览版,九项智能体测试平均提升约 25.7 分,终端操作能力接近 Kimi K3 和 Fable 5;但通用推理、复杂软件工程还没全面领先。HLE 测试里,不借助工具得分 42.7,用上工具后跳到 60.0——工具调用依赖度明显。

五、4 种方式用上 Grok 4.6

方式门槛说明
grok.com / X / App免费网页端、iOS/Android 直接选模型,零配置
Cursor订阅编辑器内选 Grok 4.6,首周 2x 用量
Grok BuildSuperGrok 订阅终端里的编码 agent,首周 2x 用量
API开发者console.x.ai 申请,或走 OpenRouter / Vercel / Cloudflare 平台

普通用户最省事的是 grok.com 网页版或 App;程序员想试编码能力,Cursor 里切模型就行;要把它接进自己的产品,API 起价 2 美元/百万 token,成本压力很小。

六、和 Qwen3.8-Max / DeepSeek / Kimi K3 怎么选

这几天的新模型密度很高,简单给个选型方向:

需求优先考虑理由
综合智能 + 知识工作Grok 4.6 / GPT-5.6 SolAA 指数第一梯队,知识工作基准反超
预算敏感的长程 agentDeepSeek V4 Pro输出 0.87 美元,九项 agent 测试逼近 Fable 5
中文生态 + 开源权重Qwen3.8-Max2.4T 参数首次开源,国内 API 接入方便
长上下文 + 开源Kimi K32.8T 参数开源,百万 token 上下文
纯编码终端GPT-5.6 Sol / Claude 系DeepSWE、Terminal-Bench 仍领先

一句话:想要”性能追平+价格砍半”的海外模型,这周就是 Grok 4.6 的窗口;追求绝对低价、且能接受工具调用依赖,DeepSeek V4 Pro 性价比更极端。

FAQ

Q1:Grok 4.6 免费能用吗? 能。grok.com 网页版、X 平台、iOS/Android App 都可以直接用,不需要订阅。SuperGrok 订阅则解锁更高额度和 Grok Build。

Q2:Grok 4.6 和 Grok 4.5 差多少? 综合指数从 56 涨到 61,GDPval 从 1526 涨到 1753,Terminal-Bench 从 15.7% 涨到 26%。提升集中在长程智能体、知识工作、交互式开发,不是挤牙膏式小改。

Q3:API 价格真比 GPT-5.6 Sol 便宜那么多? 是。输入 2 vs 5 美元,输出 6 vs 30 美元,输出价是对方的五分之一。另外还有速度翻倍的更高档位,价格相应翻倍。

Q4:DeepSeek V4 Pro 正式版涨价了吗? 没有。0813 版维持缓存命中 0.003625 / 未命中 0.435 / 输出 0.87 美元。不过官方预告过近期会整体上调 API 价格,当前可能是过渡定价。

Q5:编程用 Grok 4.6 还是 GPT-5.6 Sol? 重度编码、要跑 DeepSWE/Terminal-Bench 这类终端场景,GPT-5.6 Sol 仍领先;做知识工作、长程 agent、从想法到成品的原型开发,Grok 4.6 性价比更高,Cursor 里两个都试试再定。

Q6:国内能直接访问 grok.com 吗? grok.com 和 xAI API 属于境外服务,直接访问需要跨境网络环境。国内开发者可优先选已接入的国产平台(如千问、DeepSeek),或通过 API 中转平台(OpenRouter 等)调用——具体接入方式见文末推荐。

写在最后

Grok 4.6 这一枪,把”第一梯队性能”和”半价”两个词焊在了一起。DeepSeek 同夜跟进,Qwen3.8 前脚开源——2026 年下半年的模型竞争,已经从”谁更强”变成”谁更划算”。对普通用户和开发者来说,这是好事:选择更多,价格更低。

用上 Grok 4.6、DeepSeek V4 Pro 或任何海外 AI 服务,稳定的跨境网络是前提。推荐几个长期在用的方案:

服务商适合场景特点
光速云多设备、长期使用IEPL 专线 + IEPL专线 多路复用,性价比主力
飞猫云入门体验IEPL 专线,经济型套餐起步
SS-ID流媒体 + 办公IEPL 专线,流媒体解锁,5 设备
MESL稳定备用IEPL 专线,中转入门,月付灵活

相关教程:Qwen3.8 Max 上手教程 2026 · DeepSeek V4 Flash 指南 · Kimi K3 上手指南 · GPT-5.6 完整指南