北京时间 8 月 13 日凌晨,马斯克旗下 SpaceXAI 正式发布新一代大模型 Grok 4.6。官方口径很直接:Artificial Analysis Intelligence Index 综合 61 分,与 OpenAI 的 GPT-5.6 Sol 持平;GDPval-AA v2 拿到 1753 Elo,反超 Claude Fable 5 的 1741。
更狠的是价格。API 每百万 token 输入 2 美元、输出 6 美元——对比 GPT-5.6 Sol 的 5/30 美元,输出价直接砍到五分之一。同一夜,DeepSeek V4 Pro 正式版(0813)也悄然上线,价格纹丝不动。一场”凌晨模型大战”就此开打。
太长不看版
| 维度 | 结论 |
|---|---|
| 发布 | 2026-08-12(美东)/ 8-13 凌晨(北京时间),SpaceXAI |
| 定位 | Grok 4.5 的升级版,主打长时间运行的智能体任务和复杂的交互、视觉工作 |
| 综合成绩 | AA Intelligence Index 61 分,与 GPT-5.6 Sol 打平;仅次于 Claude Fable 5(62)和 Opus 5(63) |
| 亮点基准 | GDPval-AA v2 1753 分超 Fable 5;CursorBench 3.2 达 69.9%,超 GPT-5.6 Sol |
| 定价 | API $2/$6 每百万 token(输入/输出),约为 GPT-5.6 Sol 的三分之一 |
| 上线渠道 | grok.com、X、iOS/Android、Cursor、Grok Build(首周 2x 用量)、API + OpenRouter/Vercel/Cloudflare |
| 注意点 | DeepSWE(65.9%)和 Terminal-Bench(26%)仍落后 GPT-5.6 Sol,纯编码终端场景不是最强 |
一、凌晨两点,两款模型同时开枪
8 月 12 日深夜到 13 日凌晨,AI 圈连着炸了两颗雷:
- SpaceXAI 发布 Grok 4.6——相比 Grok 4.5,重点强化长时间运行的智能体(agent)、多步骤复杂任务,以及”把一个想法变成能跑的应用”这类交互式和视觉工作。
- DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813)悄然上线——API 文档里的模型版本从预览版切到正式版,价格没涨,多项智能体测试逼近 Claude Fable 5。
两个主打”高性价比打第一梯队”的模型撞在同一个晚上,这不是巧合,是 2026 年大模型价格战的典型节奏。上一轮是 Qwen3.8-Max 开源(8/10),这一轮轮到 Grok 和 DeepSeek 正面刚。
二、Grok 4.6 强在哪:基准数据逐项拆
官方公告给出了与 GPT-5.6 Sol Max、Claude Fable 5 Max 的对比表(均为各家公布的 system card / 榜单数据):
| 基准 | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPval-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
读这张表要抓住三条线:
① 综合智能打平第一梯队。 AA Intelligence Index 是 9 项基准的复合分,Grok 4.6 拿到 61,和 GPT-5.6 Sol 并列,只差 Fable 5 的 62。从 Grok 4.5 的 56 直接涨 5 分,在”挤牙膏”成风的行业里算大步。
② 知识工作/代理任务反超。 GDPval-AA v2(真实计算机知识工作)1753 分,超过 GPT-5.6 Sol Max 的 1728 和 Fable 5 Max 的 1741;AA-Briefcase(公文/商务场景)1577 也排第一。媒体实测里有个细节很能说明问题:完成同样的复杂任务,Grok 4.6 大约需要 53 步,Claude Opus 5 需要 103 步——步骤减半意味着规划更高效、中途出错概率更低、调用成本也更低。
③ 纯编码终端仍不是最强。 DeepSWE v1.1(65.9%)和 Terminal-Bench v3.0(26%)明显落后 GPT-5.6 Sol(73% / 34.6%)。所以它的定位是”知识工作 + 长程智能体 + 从想法到成品”,不是无脑吹”最强代码模型”。写代码重度用户,Grok 4.6 可以当第二选择,主力还是看 GPT-5.6 或 Claude 系。
三、价格战:2/6 美元意味着什么
Grok 4.6 的 API 定价维持 Grok 4.5 的水平:
| 模型 | 输入($/百万token) | 输出($/百万token) |
|---|---|---|
| Grok 4.6 | 2 | 6 |
| GPT-5.6 Sol | 5 | 30 |
| Claude Opus 5 | 5 | 25 |
| DeepSeek V4 Pro | 0.435 | 0.87 |
| Qwen3.8-Max(国内) | 约 1.7(¥12) | 约 5(¥36) |
三个观察:
- 对标 GPT-5.6 Sol,输出价砍掉 80%。 性能打平、价格只有对手三分之一——这就是 SpaceXAI 打开发者市场的逻辑。对成本敏感的中小团队,这是用前夜价格体验前沿模型的机会。
- 打不过 DeepSeek 的绝对低价。 DeepSeek V4 Pro 输出只要 0.87 美元,是 Grok 4.6 的七分之一。所以 Grok 的”便宜”是相对美国同行,国产模型的价格底线它够不着。
- 首周双倍用量是实打实的福利。 Cursor 和 Grok Build 里首周 2x included usage,想测 4.6 的趁这周。
四、同夜主角:DeepSeek V4 Pro 正式版
DeepSeek 这次很低调:没有发布会,只是 API 文档把 deepseek-v4-pro 对应的版本切到了 DeepSeek-V4-Pro-0813,调用方式和模型名都不用改。规格:100 万 token 上下文、单次最大输出 38.4 万 token、思考模式默认开启,支持 JSON 输出、工具调用、Responses API 和 Anthropic API。
价格维持:缓存命中输入 0.003625 美元、缓存未命中输入 0.435 美元、输出 0.87 美元(每百万 token)。官方此前预告过 API 要整体涨价,所以现在这波可能是”过渡定价”——想锁定低价 API 的团队,窗口期值得留意。
社群流出的评测对比显示:V4-Pro-0813 相比预览版,九项智能体测试平均提升约 25.7 分,终端操作能力接近 Kimi K3 和 Fable 5;但通用推理、复杂软件工程还没全面领先。HLE 测试里,不借助工具得分 42.7,用上工具后跳到 60.0——工具调用依赖度明显。
五、4 种方式用上 Grok 4.6
| 方式 | 门槛 | 说明 |
|---|---|---|
| grok.com / X / App | 免费 | 网页端、iOS/Android 直接选模型,零配置 |
| Cursor | 订阅 | 编辑器内选 Grok 4.6,首周 2x 用量 |
| Grok Build | SuperGrok 订阅 | 终端里的编码 agent,首周 2x 用量 |
| API | 开发者 | console.x.ai 申请,或走 OpenRouter / Vercel / Cloudflare 平台 |
普通用户最省事的是 grok.com 网页版或 App;程序员想试编码能力,Cursor 里切模型就行;要把它接进自己的产品,API 起价 2 美元/百万 token,成本压力很小。
六、和 Qwen3.8-Max / DeepSeek / Kimi K3 怎么选
这几天的新模型密度很高,简单给个选型方向:
| 需求 | 优先考虑 | 理由 |
|---|---|---|
| 综合智能 + 知识工作 | Grok 4.6 / GPT-5.6 Sol | AA 指数第一梯队,知识工作基准反超 |
| 预算敏感的长程 agent | DeepSeek V4 Pro | 输出 0.87 美元,九项 agent 测试逼近 Fable 5 |
| 中文生态 + 开源权重 | Qwen3.8-Max | 2.4T 参数首次开源,国内 API 接入方便 |
| 长上下文 + 开源 | Kimi K3 | 2.8T 参数开源,百万 token 上下文 |
| 纯编码终端 | GPT-5.6 Sol / Claude 系 | DeepSWE、Terminal-Bench 仍领先 |
一句话:想要”性能追平+价格砍半”的海外模型,这周就是 Grok 4.6 的窗口;追求绝对低价、且能接受工具调用依赖,DeepSeek V4 Pro 性价比更极端。
FAQ
Q1:Grok 4.6 免费能用吗? 能。grok.com 网页版、X 平台、iOS/Android App 都可以直接用,不需要订阅。SuperGrok 订阅则解锁更高额度和 Grok Build。
Q2:Grok 4.6 和 Grok 4.5 差多少? 综合指数从 56 涨到 61,GDPval 从 1526 涨到 1753,Terminal-Bench 从 15.7% 涨到 26%。提升集中在长程智能体、知识工作、交互式开发,不是挤牙膏式小改。
Q3:API 价格真比 GPT-5.6 Sol 便宜那么多? 是。输入 2 vs 5 美元,输出 6 vs 30 美元,输出价是对方的五分之一。另外还有速度翻倍的更高档位,价格相应翻倍。
Q4:DeepSeek V4 Pro 正式版涨价了吗? 没有。0813 版维持缓存命中 0.003625 / 未命中 0.435 / 输出 0.87 美元。不过官方预告过近期会整体上调 API 价格,当前可能是过渡定价。
Q5:编程用 Grok 4.6 还是 GPT-5.6 Sol? 重度编码、要跑 DeepSWE/Terminal-Bench 这类终端场景,GPT-5.6 Sol 仍领先;做知识工作、长程 agent、从想法到成品的原型开发,Grok 4.6 性价比更高,Cursor 里两个都试试再定。
Q6:国内能直接访问 grok.com 吗? grok.com 和 xAI API 属于境外服务,直接访问需要跨境网络环境。国内开发者可优先选已接入的国产平台(如千问、DeepSeek),或通过 API 中转平台(OpenRouter 等)调用——具体接入方式见文末推荐。
写在最后
Grok 4.6 这一枪,把”第一梯队性能”和”半价”两个词焊在了一起。DeepSeek 同夜跟进,Qwen3.8 前脚开源——2026 年下半年的模型竞争,已经从”谁更强”变成”谁更划算”。对普通用户和开发者来说,这是好事:选择更多,价格更低。
用上 Grok 4.6、DeepSeek V4 Pro 或任何海外 AI 服务,稳定的跨境网络是前提。推荐几个长期在用的方案:
| 服务商 | 适合场景 | 特点 |
|---|---|---|
| 光速云 | 多设备、长期使用 | IEPL 专线 + IEPL专线 多路复用,性价比主力 |
| 飞猫云 | 入门体验 | IEPL 专线,经济型套餐起步 |
| SS-ID | 流媒体 + 办公 | IEPL 专线,流媒体解锁,5 设备 |
| MESL | 稳定备用 | IEPL 专线,中转入门,月付灵活 |
相关教程:Qwen3.8 Max 上手教程 2026 · DeepSeek V4 Flash 指南 · Kimi K3 上手指南 · GPT-5.6 完整指南