Grok 4.5 是 xAI(SpaceXAI)于 2026 年 7 月 8 日发布的编程、智能体与知识工作旗舰。公司称其为迄今最强模型,在科学/工程/数学数据上训练,并与 Cursor 联合训练;同时作为 Grok Build 的默认模型,并在 Cursor 全套餐上线。
实际卖点不只是峰值分数,还有效率:xAI 宣称约 80 tokens/second 的服务吞吐,以及在同类任务上相对可比前沿模型约 2× 的 token 效率——更少步数、更低墙钟成本,API 价为每 100 万 token $2 / $6(输入/输出)。
规格速览
| 规格 | 数值 |
|---|---|
| 模型 ID | grok-4.5(别名:grok-4.5-latest、grok-build-latest) |
| 上下文 | 500K token |
| 模态 | 文本 + 图像入 → 文本出 |
| 知识截止 | 2026-02-01(文档);预训练截止 2026-01(模型卡) |
| 推理强度 | Low / medium / high(默认) |
| 工具 | 函数调用、结构化输出、web 搜索、X 搜索、代码执行 |
| 吞吐(厂商) | 约 80 tok/s |
组织级实时限额见 模型详情页。
定价
基础 API 单价(每 100 万 token),带 20 万 prompt 长上下文加价——当提示达到 20 万 token 时,该请求中的全部 token 按更高档计费:
| 提示 < 20 万 | 提示 ≥ 20 万 | |
|---|---|---|
| 输入 | $2.00 | $4.00 |
| 缓存输入 | $0.50 | $1.00 |
| 输出 | $6.00 | $12.00 |
xAI 强烈建议设置 prompt_cache_key(Responses API)或 x-grok-conv-id 头(Chat Completions),让会话打到同一台缓存热服务器;否则常会在冷节点上付全价输入费。
若需要更便宜、更长窗口的兄弟型号,路由表里保留 Grok 4.3($1.25 / $2.50,1M 上下文)。
基准(厂商自报——请先读 caveat)
xAI 发布稿与模型卡侧重编程 / 智能体 harness。下表数字除非另注均为厂商自报(常配合提供方 harness / AA 或 Cursor 跑分)。括号内为报告所用 effort 档。
| 基准 | Grok 4.5 | 同卡/同帖中的主要对照 |
|---|---|---|
| DeepSWE 1.0(pass@1) | 62.0%(high) | Fable 5 max 66.1%、GPT-5.5 xhigh 64.3%、Opus 4.8 max 55.8% |
| DeepSWE 1.1 | 53.0%(high) | Fable 5 max 70.0%、GPT-5.5 xhigh 67.0%、Opus 4.8 max 59.8% |
| SWE-Bench Pro | 64.7%(high) | Fable 5 max 80.3%、Opus 4.8 max 69.2%、GPT-5.5 xhigh 58.6% |
| SWE-Marathon | 29.0%(high) | Opus 4.8 max 26.0%、Fable 5 max 24.0% |
| Terminal-Bench 2.1 | 83.3%(high) | Fable 5 max 84.3%、GPT-5.5 xhigh 83.4%、Opus 4.8 max 78.9% |
| ApexSWE | 51.2%(high) | Fable 5 max 65.5%、Opus 4.8 max 47.3% |
重要 caveat: harness 选择会拉动分数;「high/max/xhigh」并非免费;SWE-Marathon 属超长程、绝对通过率仍低;DeepSWE 1.0 与 1.1 说明尺子变化很快。切换生产路由前,优先看独立的 Artificial Analysis / 社区复现。全景见 2026 LLM 指南。
可用性与接入
按发布公告:
- xAI API —
console.x.ai,模型grok-4.5 - Grok Build — 默认编程智能体模型(CLI + API);发布时提供限时免费用量
- Cursor — 全套餐
- Office 插件 — Word / PowerPoint / Excel 默认模型
- 网关 — OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic
- 消费级 Grok / X — 列为后续,非首日
欧盟说明: 发布时 Grok 4.5 在欧盟各产品与 API 控制台均不可用,预计「7 月中旬」开放。面向欧盟上线前请先确认实时区域支持。
最小 Responses API 示例:
curl -s https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.5",
"input": "Find and fix the bug, then explain it: function median(a){a.sort();return a[a.length/2]}"
}'
横向对比
- vs Grok 4.3: 4.5 是更高单价、500K 窗口的编程/智能体旗舰;4.3 仍是预算档 / 1M 工作马。难智能体回路走 4.5,成本敏感的长 RAG 可走 4.3。
- vs Claude Opus 4.8: 同卡中 Opus 仍在若干 SWE-Pro / DeepSWE 分项领先;Grok 4.5 在 SWE-Marathon 与价效叙事上反击。
- vs GPT-5.5 / GPT-5.6: GPT 在终端套件仍强;Grok 4.5 以低于 Sol 档的定价,并通过 Build + Cursor 分发争夺编程智能体份额。
- vs Gemini 3.1 Pro: Gemini 仍是多模态 / 性价比路线;Grok 4.5 更窄(文本+图像 → 文本)、更偏编程智能体。
限制与未知
- 发布时 4.5 无公开 batch 折扣(4.3 有 20%)。
- 消费级聊天面非首日上线。
- 安全评测见模型卡(网络、生物、越狱、心理健康等)——敏感域上线前请自行阅读;本页不逐条复述拒答数字。
- 截至 2026 年 7 月中旬,面向 4.5 的独立、厂商中立智能指数仍在收敛——稳定 AA / 社区数字出来后我们会更新。
相关阅读:Grok Build 开源(默认挂载本模型的 harness)与 2026 LLM 全景。
适用场景
- 在 Grok Build / Cursor 中做智能体编程
- 多步软件工程与终端工作流
- Word / PowerPoint / Excel 插件中的知识工作
- 重视 token 效率的成本敏感前沿编程
优缺点
优势
- 长程 SWE(SWE-Marathon)与编程智能体上厂商自报分数较强
- API 定价 $2/$6 有竞争力,并宣称相对同级约 2× token 效率
- 作为 Grok Build 默认模型,且在 Cursor 全套餐可用
- 可配置推理强度(low / medium / high),支持 web/X 搜索与代码执行工具
局限
- 上下文(500K)仅为 Grok 4.3 的 1M 的一半
- 头条基准多为厂商自报,独立评测仍在跟进
- 发布时欧盟不可用(目标 mid-July);上线前请核对当前区域状态
- 长上下文提示(≥20 万 token)单价翻倍
常见问题
Grok 4.5 的 API 模型 ID 是什么?
使用 `grok-4.5`(别名包括 `grok-4.5-latest` 与 `grok-build-latest`)。可在 `https://api.x.ai/v1` 上走 Responses API 或 Chat Completions。
Grok 4.5 定价和 Grok 4.3 比如何?
Grok 4.5 为每 100 万 token $2 输入 / $6 输出(缓存输入 $0.50),Grok 4.3 为 $1.25 / $2.50(缓存 $0.20)。4.5 定位更强的编程旗舰;4.3 仍是更便宜、更长上下文(1M)的选项。提示达到 20 万 token 时,两款模型都会按更高档计费。
欧盟能用 Grok 4.5 吗?
2026 年 7 月 8 日发布时,xAI 称 Grok 4.5 在欧盟的任何 SpaceXAI 产品与 API 控制台均不可用,预计「7 月中旬」开放。面向欧盟上线前请先核对控制台 / 文档的实时区域支持。
现在可以在哪里用 Grok 4.5?
xAI API 控制台、作为 Grok Build(CLI/API)默认模型、Cursor 全套餐、Word/PowerPoint/Excel 插件默认模型,以及 OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic 等网关。消费级 Grok 应用 / X 列为后续。
Grok 4.5 是和 Cursor 一起训练的吗?
是。xAI 公告与模型卡写明该模型与 Cursor 联合训练,并用匿名化的 Cursor 工作流数据做补充训练以提升编程与智能体表现。把 Cursor 的公开称赞视为厂商相邻背书,而非中立第三方评测。