共计 1174 个字符,预计需要花费 3 分钟才能阅读完成。
📌 核心升级: 长任务与智能体能力
根据官方发布信息,Grok 4.6 能够持续处理包含大量步骤的复杂任务, 涵盖资料研究、信息分析、大型代码库处理, 以及将产品构想转化为完整应用或工作成果。在实际项目测试中, 新模型重点接受了长流程、多步骤任务的考验, 表现出擅长把宽泛的产品构想转化为可运行初版的能力, 包括研究陌生领域、规划应用结构、实现核心交互, 以及根据多轮反馈持续完善结果。
在更长的任务流程中,Grok 4.6 还展现出更多的自主测试和验证行为, 会在继续执行任务前检查已完成的工作。视觉和交互式项目的初版成果较 Grok 4.5 有所提升, 面对明确的产品构想时, 可以一次建立应用的基本结构和视觉语言。
🔍 基准测试: 与 GPT-5.6 Sol 持平
围绕“剑指 GPT-5.6 Sol,SpaceXAI 发布 G”,这一部分可从背景、现状与影响三个角度理解其关键信息。结合已公开内容来看,核心结论是趋势已较为明确,但细节仍需结合后续进展持续观察。
💡 训练与安全: 更长的补充训练与全面评估
训练方面,Grok 4.6 经历了比 Grok 4.5 更长的补充训练。训练数据包括经过筛选的模型生成推理数据、高级技术概念数据以及高质量工程数据, 并配合改进后的优化器和训练方案, 为后续监督微调 (SFT) 和强化学习 (RL) 提供基础。训练团队利用 Grok 4.5 重新生成 SFT 轨迹, 覆盖不同推理强度、智能体运行框架, 以及 STEM、软件工程和知识工作等领域, 并使用基于模型的检查剔除存在问题的轨迹。此外,Grok 4.6 还接受了广泛的智能体强化学习训练, 任务覆盖知识工作、通用编程、内核优化、Web 开发和计算机辅助设计等领域。
安全方面,Grok 4.6 根据扩展后的模型能力调整了安全防护机制。此次安全评估覆盖部署前能力测试、安全防护校准, 以及部署后和第三方测试, 规模为历来最大。安全体系面向漏洞修补、工程设计和 AI 研究等合法使用场景, 在提高实用性的同时控制安全风险。
📊 上线与定价: 多平台开放, 首周额度翻倍
Grok 4.6 已在 Cursor 和 Grok Build 上线, 首周两项服务将向用户提供两倍的内含使用额度。除这两项服务外,Grok 4.6 也已通过 API 开放, 并登陆 OpenRouter、Vercel 和 Cloudflare 等合作平台。价格为每 100 万个输入 Token 2 美元(现汇率约合 13.5 元人民币)、每 100 万个输出 Token 6 美元(现汇率约合 40.6 元人民币), 速度更快的版本价格为普通版本的两倍。
🚀 行业观察: 智能体竞赛加速
- 长流程任务处理能力成为新焦点, 多步骤复杂工作成为衡量模型实力的重要标尺。
- 训练策略上, 补充训练、SFT 轨迹重生成与智能体强化学习的组合, 或将成为后续模型迭代的常见路径。
- 定价策略显示, 高性能模型的商业化竞争已进入精细运营阶段, 速度与成本的平衡成为关键。