Grok 4.7是不是一次单纯的速度升级?从SpaceXAI公布的信息看,不是。新模型重点面向编程和知识工作,变化集中在更大基座、更长强化学习训练、复杂任务持续处理、自我检查与长上下文管理。
据IT之家9月22日消息,SpaceXAI将Grok 4.7称为公司目前最强的编码和知识处理模型。官方宣称,其速度达到同类模型的两倍,价格只有一半;这项表述的比较对象是同类模型。
与上一代Grok 4.6比较时,官方给出了另一组口径。Grok 4.7的运行速度和定价与Grok 4.6相同,但能够在困难任务上持续更长时间,并加强对自身输出结果的检查能力。
因此,两组宣传不能混在一起理解。编辑建议,判断升级幅度时应分别看同类模型比较和Grok 4.6代际比较。现有资料支持的代际变化主要是任务持续时间、验证能力及模型和训练规模,而非基础价格下降。
训练方向也解释了这种侧重点。SpaceXAI表示,Grok 4.7使用了比Grok 4.6更大的基座模型,接受了更长时间的强化学习训练,训练数据更加偏向需要数小时才能完成的复杂任务。
模型还针对自我验证和长上下文管理进行了优化,并接受了面向Grok Bot harness的原生训练。按照官方描述,这部分训练改善了对话和一般知识工作任务表现,文档与演示文稿生成能力也有所改进。
编程表现方面,官方引用CursorBench 4.0称,Grok 4.7针对长时间运行的编程任务,在价格与性能方面处于同类模型前列。该结果对应特定基准和长时间任务,来源没有给出更多实际项目数据。
专业知识工作的证据来自GDPval和AA Briefcase。两项测试覆盖律师、护士、金融分析师等专业人士日常工作中的相关任务。Grok 4.7均较Grok 4.6提升,官方称其表现已接近其他前沿模型。
安全机制同样发生变化。SpaceXAI称其采用全新的安全防护体系,在拒答和抵抗越狱攻击方面达到公司目前测试中的最高水平,并尝试兼顾双重用途场景中的合法任务可用性和危险任务拒答。
已公布的具体成绩包括LatchBio生物安全基准62.4%。在HackerBench v0.3中,官方称模型仅允许3.3%的高风险双重用途提示通过,同时较少阻止合法安全工作。部分网络安全合作伙伴已获得邀请制访问,用于红队能力和防御研究。
可用范围已经明确。Grok 4.7目前通过Cursor和Grok Build提供,同时开放Grok API,并支持第三方编程工具、模型路由服务及云平台。资料没有列出这些渠道之间的具体功能差异。
价格为每百万词元输入2美元起,约合13.4元人民币;输出6美元起,约合40.2元人民币。SpaceXAI还提供输出速度翻倍的高速版本,价格也翻倍。对读者而言,此次升级的核心不是Grok 4.6基础定价变化,而是长任务处理、自检和知识工作能力的扩展。
