原文内容概括缩写:OpenAI一向对技术细节讳莫如深,但近日罕见发布了一篇被称为“goblin-level”的博客,披露了其最新模型(暂称GPT-5.6)在ARC-AGI-3基准测试上的惊人进展。ARC-AGI(Abstract Reasoning Corpus for Artificial General Intelligence)是一个专门测试AI抽象推理能力的挑战,被认为是衡量模型向AGI靠近的关键指标。OpenAI仅改变了两个设置——具体包括推理时计算预算控制(如增加思维链深度)和提示策略优化(如多轮自洽性采样),就使模型得分从之前的约20%提升至60%以上,实现3倍增长。该结果意味着模型不再依赖单纯的参数规模扩展,而是通过更高效的推理机制获得质变。OpenAI强调,这一发现可能颠覆现有的大模型训练范式,即“规模定律”可能被“推理效率定律”所补充甚至替代。博客中还提到,这些设置已在实际部署中验证,成本增加有限但性能提升显著。Altman在社交媒体上表示,这是通往AGI道路上“被低估的钥匙”。尽管具体技术细节(如超参数)未完全公开,但业界普遍认为推理时计算(inference-time compute)的合理分配是核心。该成果也引发了对“下一个Token预测”之外新范式的讨论。