Grok 4.6正式发布:强化长周期智能体任务与多步骤知识工作能力
SmartHey8月13日消息,北京时间12日晚间,Grok 4.6正式发布。该版本在Grok 4.5基础上进一步提升长时间运行的智能体任务处理能力,以及复杂交互与视觉任务表现。
据官方信息,Grok 4.6可稳定执行包含数十乃至上百步骤的复杂任务,涵盖深度资料调研、跨领域信息整合、大型代码库分析与重构,以及将抽象产品构想端到端转化为可运行原型或完整交付成果。
在基准测试中,Grok 4.6在多项智能体编程与专业知识工作评测中达到当前业界前沿水平。其在综合9项指标的Artificial Analysis Intelligence Index(AAII)评估中,与GPT-5.6 Sol并列榜首。
目前,Grok 4.6已上线Cursor与Grok Build平台。首周内,两项服务用户将享双倍内置配额权益。
训练层面,Grok 4.6经历了比前代更长周期的增量训练。数据集经严格筛选,涵盖高质量模型生成推理轨迹、高阶技术概念语料及顶尖工程实践数据,并采用升级版优化器与训练调度策略,为后续监督微调(SFT)与强化学习(RL)奠定坚实基础。
团队还基于Grok 4.5重新生成覆盖多强度推理、多样化智能体框架(如ReAct、Plan-and-Execute),以及STEM、软件工程与知识工作等垂直领域的SFT训练轨迹,并引入基于模型的自动质量校验机制,剔除逻辑矛盾、事实错误或结构失效的低质样本。

此外,Grok 4.6开展了大规模智能体强化学习训练,任务场景覆盖知识密集型工作、通用编程、系统内核优化、Web全栈开发及计算机辅助设计(CAD)等高复杂度领域。
在真实项目压力测试中,模型重点验证了长流程、多阶段任务的稳定性与自主性。结果显示:Grok 4.6能高效将模糊的产品需求转化为可执行初版,完整覆盖领域调研、架构设计、核心功能实现及基于多轮用户反馈的迭代优化。
在超长任务链中,模型展现出更强的自主验证意识——会在推进下一步前主动复核已完成模块的正确性与完整性。视觉类与交互式项目初稿质量亦显著提升:面对明确产品定义,可一次性构建出结构合理、界面语义清晰的应用雏形。
安全体系同步升级,适配模型能力边界的拓展。本次安全评估覆盖部署前能力红队测试、防护策略动态校准、上线后持续监控及第三方独立审计,整体规模创历史之最。安全机制在保障漏洞修复、工程协作、AI科研等合法应用场景实用性的同时,有效抑制越界行为与潜在风险。
除Cursor与Grok Build外,Grok 4.6已全面开放API接口,并接入OpenRouter、Vercel与Cloudflare等主流开发者平台。定价为:每百万输入Token 2美元(约合人民币13.5元),每百万输出Token 6美元(约合人民币40.6元);高速响应版本价格为标准版的两倍。
首周内,Cursor与Grok Build用户仍可享受双倍内置使用额度。

