xAI 用 Grok 4.6 叫板 GPT-5.6,长任务智能体会自查工作

BiyaNews
Grok 4.6 以长任务智能体和可视化项目能力为主攻方向,在综合智能指数上追平 GPT-5.6 Sol,并维持极具竞争力的 API 定价。

今天我们发布 Grok 4.6。Grok 4.6 基于 Grok 4.5 构建,特别专注于长运行智能体和更具雄心的交互与视觉工作。它能在多个步骤中持续处理复杂任务,无论是研究主题、分析信息、跨代码库工作,还是将想法转化为完善的应用程序或作品。

Grok 4.6 在多个智能体编码和知识工作基准上达到前沿水平。它在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平,该指数是九项基准的综合评分。

xAI 用 Grok 4.6 叫板 GPT-5.6,长任务智能体会自查工作

图:来源:xAI;竞品数据取自各家开发者公开发布的系统卡或基准排行榜。

Grok 4.6 今日已在 Cursor 和 Grok Build 中可用。第一周内,我们在 Grok Build 和 Cursor 中提供 2 倍包含用量,方便你立即开始试用 4.6。

训练 Grok 4.6

Grok 4.6 比 Grok 4.5 经历了更长的补充训练,使用了经过筛选的模型生成数据,用于推理和高级技术概念,以及高质量工程数据,并改进了优化器和训练配方。这为后续的 SFT 和 RL 阶段奠定了更强基础。

随后,我们使用 Grok 4.5 重新生成 SFT 轨迹,覆盖推理工作、智能体框架以及 STEM、软件工程和知识工作等领域,并通过基于模型的检查过滤掉有问题的轨迹。由此得到的 SFT 检查点表现出强劲性能和更好的行为。

Grok 4.6 在广泛的智能体强化学习任务上训练,包括知识工作、通用编码,以及针对内核优化、网页开发、计算机辅助设计等领域的特定环境。

把宏大想法变成可用项目

我们在旨在扩展其范围和长时间工作能力的项目上测试了 Grok 4.6。我们发现,该模型特别擅长将宽泛的产品想法转化为可用的初版。它能研究陌生领域、构建应用结构、实现核心交互,并通过多轮反馈持续优化结果。

在更长的任务轨迹中,我们还开始看到更多自测和验证行为,模型会在继续之前检查自己的工作。

在视觉和交互项目上,Grok 4.6 的首次产出比我们通常在 Grok 4.5 上看到的更强。给定一个具体的产品想法,它能一次性为应用建立结构和视觉语言。这使得它在那些最快获得好结果的方式是先做出实质内容再循环迭代的项目中特别有用。

安全与能力

Grok 4.6 的安全防护已根据模型能力进行了改进和校准。

我们的安全栈旨在在合法用例中最大化实用性和安全性,使 Grok 4.6 在漏洞修补、加速工程设计周期和增强 AI 研究等领域既有用又安全。

我们的安全防护评估工作反映了 Grok 4.6 扩展的能力,包括我们有史以来最广泛的能力和安全防护校准部署前测试,以及广泛的部署后和第三方测试。

基准评测

xAI 用 Grok 4.6 叫板 GPT-5.6,长任务智能体会自查工作

图:Grok 4.6 与竞品在主要基准上的得分对比。来源:xAI;每项评测最高分加粗显示,第三方模型分数取自其自行报告或公开可获取的最佳结果。

从公开数据来看,Grok 4.6 在 CursorBench v3.2(69.9%)、GDPVal-AA v2(1753)、AA-Briefcase(1577)APEX-Agents(57.5%) 上追平或超过 GPT-5.6 Sol Max,但在 Terminal-Bench v3.0(26%)DeepSWE v1.1(65.9%) 上仍有差距;Fable 5 Max 则在多数项目保持微弱领先。

开始使用 Grok 4.6

Grok 4.6 今日已在 Cursor 和 Grok Build 中可用。它也可通过 API 以及其他合作伙伴使用,如 OpenRouter、Vercel 和 Cloudflare。

定价为每百万输入代币 2 美元起,每百万输出代币 6 美元起。此外,还有一个快速版本,价格是标准版的两倍。

第一周内,我们在 Grok Build 和 Cursor 中提供 2 倍包含用量,方便你立即开始试用 4.6。

创建 API 密钥

立即通过 SpaceXAI API 开始使用 Grok 4.6 进行构建。

阅读文档并将 Grok 4.6 集成到你的技术栈中。

在 Grok Build 中免费试用

立即前往 x.ai/build 开始使用。

发布于
免责声明:市场有风险,投资需谨慎,本文不构成投资建议