xAI 发布 Grok 4.6,长流程智能体成新战场
8 月 12 日,马斯克旗下 xAI(并入 SpaceX 后更名为 SpaceXAI)发布新一代旗舰模型 Grok 4.6,距离上一代 Grok 4.5 亮相仅一个多月,迭代速度明显快于此前的季度节奏。官方公告把新模型的定位从"回答问题"转向"完成任务":重点提升长时间运行的智能体任务、复杂交互和视觉工作的表现,官方用一句话概括——让模型"把一个想法变成能用的产品"。
一、独立评测显示,性能重回第一梯队
第三方评测机构 Artificial Analysis 的智能指数显示,Grok 4.6 得 61 分,与 OpenAI 的 GPT-5.6 Sol 持平,仅次于 Anthropic 的 Claude Fable 5(62 分),比上一代高出 5 分,该机构据此认为 SpaceXAI 重新回到前沿模型行列。在知识工作评测 GDPVal 上,它得 1753 分,高于 GPT-5.6 Sol 的 1728 和 Fable 5 的 1741。不过官方公布的基准中,部分指标仍落后竞品:终端操作 Terminal-Bench 得 26%,低于 GPT-5.6 Sol 的 34.6%;深度软件工程 DeepSWE 65.9%,低于 GPT-5.6 Sol 的 73%。在 Artificial Analysis 的智能体长任务私有基准 AA-Briefcase 上,Grok 4.6 以 1577 的 Elo 领先 GPT-5.6 Sol 的 1502。综合看,它不是全面领先,而是明显偏科于智能体与知识工作方向。
二、主打长流程智能体,自主完成整条任务链
Grok 4.6 的核心卖点是"长时间运行的 Agent":让它开发一个软件,它可以自己理解需求、编写代码、运行测试、发现问题再修改,而不是每步都等人下指令。官方数据显示,其在智能体编程基准 DeepSWE 上从上一代的 54% 提升到 65.9%,上下文窗口达到 50 万 token,足够容纳大型代码库和长文档。训练上,xAI 用更长的补充训练数据强化推理,用上一代 Grok 4.5 重新生成监督微调轨迹,再经过覆盖内核优化、网页开发、计算机辅助设计等场景的强化学习。模型还加强了自我校验——长任务中会先检查自己的工作再继续。
三、同价发布,生态快速铺开
价格方面,Grok 4.6 与上一代持平:每百万输入 Token 2 美元、输出 6 美元,属于"同价更强",另有价格翻倍的快速版可选。发布节点也颇有戏剧性:几乎同一时间,国产大模型 DeepSeek 推出 V4 Pro 正式版,两款聚焦智能体赛道的前沿模型正面同台,被国内媒体称为"撞车"。消息公布后,SpaceX 股价隔日一度涨超 9%。发布第一周在 Cursor 和 Grok Build 提供双倍免费用量,并通过 OpenRouter、Vercel、Cloudflare 等渠道开放 API;8 月 14 日起又进入 GitHub Copilot 的八个开发环境。马斯克同时放话,下一代 Grok 4.7 将超越现有所有模型。头部厂商的迭代节奏,已经从"季度级"压缩到"月度级",企业选型时"等等再看"的成本越来越高。
四、从"会回答"到"会干活",企业的信息位变了
Grok 4.6 释放的信号很明确:前沿模型的竞争点,正在从对话问答转向自主执行。当 AI 替用户完成调研、比价、预约这类任务时,它需要的不是华丽的品牌文案,而是准确、结构化、可核验的事实信息。对企业官网来说,能不能被这类 Agent 正确读取和引用,会直接影响它会不会出现在"任务结果"里。把关键信息位做扎实,比任何时候都更值得投入。落到实操上,企业可以先做三件事:把官网上描述业务的关键段落改写成事实陈述,而不是口号;给产品、服务、价格、联系方式配上机器可读的结构化数据;定期检查主流 AI 引擎引用你的内容时用的是不是最新版本。这几步做完,被 Agent"选中"的概率会明显上升。
信息来源
- xAI 官方公告《Introducing Grok 4.6》,2026-08-12,访问链接
- Datanorth《xAI releases Grok 4.6》,2026-08-12,访问链接
- 澎湃新闻《AI 智能体赛道同台竞技,Grok 4.6 亮相"撞车"DeepSeek V4 Pro 正式版》,2026-08-13,访问链接
- 腾讯新闻《Grok 4.6 发布:同价更强,马斯克:4.7 将超越所有现有模型》,2026-08-13,访问链接
- Unite.ai《Grok 4.6 Arrives in GitHub Copilot Across Eight Development Surfaces》,2026-08-14,访问链接

