如果你正在评估 2026 年夏末的前沿模型 API 选型,Grok 4.6 的时间表值得单独盯一眼:马斯克 7 月 28 日在 X 上回复 Vercel CEO Guillermo Rauch 时透露,xAI 将于 8 月 7 日前后发布参数规模达 1.5 万亿的 Grok 4.6,随后几周内还会推出 2.1 万亿参数的 Grok 4.7——但 xAI 官方尚未公布基准分数与定价。本文按时间线、核心数据、SFT/RL 升级逻辑、竞品对比与争议点五个维度整理,并明确标注哪些仍是「马斯克一句话」级别的未证实信息。

为什么开发者此刻应该关心 Grok 4.6 时间表

这起发布预告看似只是巨头公关,但对一线工程团队有三层直接影响:

  • 选型窗口被压缩:Grok 4.5 7 月 8 日才上线,若 8 月 7 日 Grok 4.6 跟进,旗舰模型的「有效货架期」可能只有一个月——与 7 月 Hugging Face 入侵与 GPT-6 监管赛跑叠加后,多模型编排的成本模型需要按月重算。
  • 信息源极度单一:目前 Grok 4.6/4.7 的参数规模、SFT/RL 升级幅度均来自马斯克一条 X 回复,没有 accompanying 模型卡——这与 Grok 4.5 发布时 15 项基准齐发的做法形成反差,集成前必须预留「日期滑移 + 规格变更」缓冲。
  • 开源冲击已落地:Kimi K3 7 月 26 日全面开源 2.8 万亿权重后,Frontend Code Arena 编程榜单 1679 分登顶;xAI 若按 Musk time 节奏连推三款前沿模型,竞争焦点会从「参数规模」转向 token 效率与 Agent 后训练质量。

先说边界:下文 Grok 4.6/4.7 的日期与参数来自马斯克 7 月 28 日 X 帖子,xAI 官方博客与产品页尚未同步公告。业内所称「Musk time」意味着实际发布可能比预告晚几天到两周——发布前请以 xAI 官方渠道为准。

时间线:从 Grok 4.5 到 4.6、4.7,节奏有多快

日期事件
2026 年 7 月 8 日xAI 正式发布 Grok 4.5,定位为编程与智能体任务旗舰,与 Cursor 合作、使用真实开发者会话数据训练,50 万 token 上下文,定价每百万 token 输入 2 美元/输出 6 美元
2026 年 7 月 16 日Moonshot AI 的 Kimi K3 以托管服务形式上线
2026 年 7 月 26 日Kimi K3 提前一天放出完整开源权重,2.8 万亿参数、100 万 token 上下文
2026 年 7 月 28 日马斯克在回复 Rauch 的帖子中首次公开 Grok 4.6 和 4.7 路线图与大致时间表;同日 OpenAI、Anthropic 等 1200 余名员工联署「Pacing the Frontier」公开信
约 2026 年 8 月 7 日(目标)Grok 4.6 计划发布,1.5 万亿参数,重点在 SFT 与 RL 层面升级
约 2026 年 8 月末至 9 月初(预估)Grok 4.7 计划跟进,2.1 万亿参数,马斯克称其除推理速度稍慢外全面优于 4.6,且 token 效率更高

核心数据一览与竞品横向对比

下表汇总 Grok 系列与同期竞品已知规格;Grok 4.6、Claude Fable 5.1 相关行均为预告或传闻,不构成正式基准对比。

模型发布/目标时间参数规模上下文定价(输入/输出,每百万 token)状态
Grok 4.52026 年 7 月 8 日未公开50 万 token$2 / $6已发布
Grok 4.6(预告)约 8 月 7 日1.5 万亿未公开未公开官方预告,未发布
Grok 4.7(预告)约 8 月末–9 月初2.1 万亿未公开未公开官方预告,未发布
Kimi K32026 年 7 月 26 日开源2.8 万亿(MoE)100 万 token$0.30(缓存命中)/$3(未命中)输入,$15 输出已发布
Claude Fable 5.1(传闻)传闻 8 月未公开未公开传闻维持 Fable 5($10/$50)Anthropic 未确认
GPT-5.6 Sol已发布未公开未公开未公开已发布

深度拆解:升级重点不是「更大」,而是「更会学」

监督微调(SFT)用人工标注或精选高质量样本纠正模型输出习惯;强化学习(RL)用奖励信号让模型在多步骤智能体任务中学会正确动作序列。马斯克强调 Grok 4.6 的升级重点在「SFT & RL」而非单纯堆参数——这与 Grok 4.5 的打法延续:Grok 4.5 凭借与 Cursor 合作的真实开发者会话后训练,在 Terminal-Bench 2.1 拿到 83.3%、SWE-Bench Pro 64.7%,处理同类任务输出 token 约 1.9 万,远低于 Claude Opus 4.8 的约 6.7 万。

Grok 4.6 的 1.5 万亿参数是明显规模跃升,但马斯克对 Grok 4.7 的表述——更大(2.1 万亿)却「推理稍慢」——暗示 xAI 会用两款不同定位的 SKU 分别满足「更强」与「更快」,而非一个模型通吃所有场景。Grok 4.6 目标日期落在 Kimi K3 全面开源约 10 天后;马斯克曾在 Kimi K3 评测帖下留言称「令人印象深刻」,业内普遍解读 xAI 加快节奏与 OpenAI、Anthropic 及中国厂商竞争烈度上升直接相关。

发布前开发者可执行的五步核对清单

在 Grok 4.6 正式模型卡落地前,建议按以下步骤管理集成风险,避免把「预告参数」写进生产依赖:

  1. 锁定信息源层级:将马斯克 X 帖子标记为「方向性预告」,Grok 4.5 官方模型卡与 xAI 新闻稿标记为「已验证基线」,二者不可混用于 SLA 或成本测算。
  2. 设定日期缓冲:按「Musk time」惯例在 8 月 7 日目标上额外预留 7–14 天滑移窗口,关键发布路径准备 Grok 4.5 或 Kimi K3 回退方案。
  3. 重算 token 效率而非只看跑分:Grok 4.5 的优势在 Agent 任务输出 token 更少;若 4.6 延续此路径,API 账单可能比「智商指数更高但输出更长」的模型更省——需等官方披露 per-task token 数据后再定。
  4. 隔离评测环境:新模型预览期常在共享沙箱或本机跑基准,状态污染与凭据残留风险上升;敏感 Agent 链路应在可重置的隔离硬件上验证。
  5. 跟踪 8 月扎堆发布:传闻 Claude Fable 5.1 亦指向 8 月,与 Grok 4.6/4.7 同月登场时,对比评测应固定同一 prompt 集与同一硬件环境,避免跨周结果不可比。

争议点与需要注意的细节

  • 时间表未经第三方验证:唯一信息源是马斯克 X 回复,xAI 官方尚未同步公告,日期可能提前或推迟。
  • 基准分数与定价全部空白:与 Grok 4.5 发布时详细模型卡不同,Grok 4.6 目前无独立测评或官方模型卡佐证能力。
  • xAI 内容安全争议:7 月 xAI 起诉一名用户涉嫌利用 Grok 绕过安全限制生成 CSAM,系公司首次就 AI 生成深度伪造内容起诉用户;Common Sense Media 1 月报告曾将 Grok 评为未成年人保护最差的 AI 产品之一——不影响技术能力评价,但涉及企业安全合规投入。
  • 与行业「减速」呼吁的错位:7 月 28 日马斯克发布路线图同日,OpenAI 与 Anthropic 以公司名义背书「Pacing the Frontier」公开信;xAI 未出现在签署名单,「一边呼吁减速、一边加速迭代」的行业分裂值得持续观察。

可引用核心数据与来源

  • Grok 4.6 目标日期:约 2026 年 8 月 7 日——马斯克 7 月 28 日 X 回复 @rauchg,非 xAI 官方公告。
  • Grok 4.6 参数规模:1.5 万亿——同上单一社交帖子来源,未经第三方验证。
  • Grok 4.5 定价:每百万 token 输入 $2、输出 $6;上下文 50 万 token——xAI 官方《Introducing Grok 4.5》与模型卡。
  • Grok 4.5 Agent 基准:Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%;输出 token 效率优于 Opus 4.8——xAI 模型卡与第三方整理(eesel.ai、felloai.com 等)。

参数、定价与基准分数可能随正式发布调整,请以官方页面为准。以下为可核验来源:

xAI 官方博客《Introducing Grok 4.5》

xAI Grok 4.5 官方模型卡(media.x.ai)

Moonshot AI Kimi K3 开源仓库(GitHub)

The Verge(Pacing the Frontier 公开信报道)

常见问题

Grok 4.6 具体是哪天发布?

马斯克表示「大约 8 月 7 日」,但这是非正式表态,并非 xAI 官方确认的发布日期,实际时间可能提前或延后。

Grok 4.6 和 Grok 4.7 有什么区别?

Grok 4.6 为 1.5 万亿参数,重点是 SFT 与 RL 后训练升级;Grok 4.7 为 2.1 万亿参数,预计在 4.6 发布后几周跟进,马斯克称其能力全面优于 4.6,但推理速度略慢,token 效率更高。

Grok 4.6 会比 Kimi K3 或 Claude Fable 5.1 更强吗?

目前无法判断。Grok 4.6 没有任何公开基准分数,Kimi K3 已有实测数据且在部分编程榜单表现突出,Claude Fable 5.1 本身尚未被 Anthropic 官方确认发布,三者暂无法直接对比。

Grok 4.6 大概会怎么定价?

官方未公布。可参考 Grok 4.5 的定价(输入 $2/输出 $6,每百万 token)作为大致区间,但新一代模型定价可能调整,务必以正式发布信息为准。

普通用户届时能在哪里用上 Grok 4.6?

按 Grok 4.5 的分发路径推测,大概率会先上线 Grok Build、xAI 官方 API 和控制台,随后逐步接入更多第三方平台,但具体入口以正式发布公告为准。

前沿模型发布密度越来越高,本地或共享环境里跑多模型 Agent 评测的状态污染、凭据残留和意外横向移动风险也在上升——每次换模型都重装环境既费时又难复现。若你需要一台可随时重置、整机独享、支持 SSH 与 VNC 双通道接入的 Apple Silicon 物理主机来隔离 Grok 与开源模型的对比测试,VMSPIN 按天起租的云端 Mac mini通常是更稳妥的落点;长期算力成本可参考购机 vs 租赁盈亏平衡测算。Grok 4.6 是否按 8 月 7 日落地仍是未知数,但你的实验环境不必跟着赌时间表。