原文内容概括缩写:8月2日,OpenAI联合创始人安德烈·卡帕西在X平台发布推文,提出一项新的AI基准测试思路。卡帕西指出,此前业内习惯使用生成“鹈鹕骑车图”的SVG图片方式,来评估大语言模型在空间推理、几何逻辑和复杂代码生成方面的真实水平。然而,随着模型能力不断提升,这类简单任务已不再具有挑战性。因此,他提出让模型根据文学文本构建可交互的3D场景,以观察模型在代码生成、场景设计与多媒体制作方面的综合表现。具体测试方案为:向模型提供《指环王》开篇首段文字,要求模型使用three.js创建3D世界,并设置100万Tokens的额度限制。卡帕西要求Claude Opus 5执行该任务,输入内容为《指环王》的首段文字。该测试不仅考验模型对文本的理解和空间想象能力,还考验其生成three.js代码的准确性、场景设计的合理性以及交互功能的实现程度。卡帕西认为,这样的基准测试更能反映AI模型在复杂、多模态任务上的真实能力,也为未来AI应用场景的拓展提供了新思路。