Vals AI 发布的 CUA-bench 用真实商业游戏测试模型以屏幕、键盘和鼠标完成任务的能力,在首轮结果中 GPT-6 Astra 以 19.17% 得分领先,但测试为单次三小时限定试验,不能直接等同于通用代理能力。评测突出速度、空间推理和隐藏游戏迁移能力的差异,强调更多重复与第三方复测以验证结论。
Vals AI 发布了一项名为 CUA-bench 的新评测,试图回答一个与传统模型测试不同的问题:人工智能代理能否只依靠屏幕画面、键盘和鼠标,在真实商业游戏中持续完成任务?
在 Vals 公布的首轮结果中,GPT-6 Astra 以 19.17% 的总体准确率排名第一,Claude Fable 5.1 为 13.17%,Claude Opus 5 为 9.00%,GPT-5.6 Sol 为 8.33%,Gemini 3.8 Flash 为 4.17%。完整结果和测试方法见 Vals AI 的 CUA-bench 页面。
不过,这些数字更适合被理解为一次受限条件下的电脑操作实验,而不是模型通用能力的综合排名。每个模型在每款游戏中只有一次最长三小时的试验,Vals也明确表示,结果没有统计误差范围。
测试让模型面对“像人一样操作”的限制
CUA-bench包含六款商业游戏,其中公开了 Minecraft、SUPERHOT 和 eFootball,另外三款游戏属于未公开的同类测试项目。公开游戏分别对应一个隐藏的沙盒游戏、第一人称反应游戏和体育游戏,Vals没有披露隐藏游戏的名称,以降低模型针对特定测试项目训练的可能性。
在测试中,代理只能看到游戏画面,并通过键盘和鼠标输入指令。它不能调用游戏 API,也不能读取存档、内存或网络接口。每款游戏的运行时间上限为三小时,期间包括学习控制方式、尝试、失败和重试的时间。
这套设计与许多通过文本界面、网页 DOM、软件 API或结构化游戏状态进行的代理评测不同。Vals希望把测试重点放在“屏幕输入、动作输出”的电脑操作本身,而不是模型是否能够适配某个专门设计的接口。
Vals还采用了按里程碑计分的方式。例如,Minecraft的任务从获取木材、制作工作台和木镐开始,一直到进入下界;SUPERHOT按照完成关卡计分;eFootball则按照逐步提高难度的比赛结果计分。六款游戏的得分取平均值,形成总体成绩。
GPT-6 Astra在空间推理和隐藏测试中表现突出
Vals表示,空间推理是不同模型拉开差距的重要因素。GPT-6 Astra是唯一一个在隐藏沙盒游戏中取得分数的模型,也是SUPERHOT中推进最远的模型,完成了25个关卡中的5个。
在公开游戏的单独表现中,GPT-6 Astra在SUPERHOT中完成5个关卡;在eFootball的Beginner难度下赢得两场比赛,但没有在Regular难度下获胜。Vals同时公布的对照数据显示,GPT-6 Astra在三个公开游戏上的平均成绩为26.7%,在三个隐藏游戏上的平均成绩为11.7%。
这组差距也是CUA-bench设计的一部分。公开游戏给模型开发者留下了准备空间,隐藏游戏则用来观察模型能否把在相同类型环境中学到的能力迁移到没有见过的对象上。Vals强调,隐藏游戏与公开游戏在类型上配对,但不公布具体名称和任务阶梯。
速度仍是模型操作电脑的主要瓶颈
Vals称,没有一个受测模型达到了人类操作速度。模型平均每15至59秒采取一次动作,中位数约为34秒;每分钟输入次数为2至19次,而人类通常可以在一秒内完成多次输入。
在实时游戏中,这种延迟会直接影响结果。eFootball的比赛不会因为模型正在思考而暂停,球员和球仍在继续移动。模型不仅需要识别画面和制定下一步计划,还必须在足够短的时间内持续发出方向键或其他动作。
Vals的记录显示,GPT-6 Astra在CUA-bench中的平均动作间隔为32.09秒,Claude Fable 5.1为37.44秒,Claude Opus 5为24.84秒,GPT-5.6 Sol为18.91秒,Gemini 3.8 Flash为37.41秒。更快的动作频率并不自动转化为更高分数,但延迟会限制代理处理动态环境的能力。
评测结果与通用代理能力之间仍有距离
CUA-bench的价值,在于它把视觉理解、空间记忆、连续控制和时间压力放进了同一个任务中。但它测量的仍然是特定游戏环境里的受限能力,不能直接等同于现实世界中的通用代理能力。
首先,每个模型和每款游戏只有一次三小时试验,无法据此估计稳定的平均表现,也不足以建立带有统计误差范围的模型排名。其次,测试覆盖的游戏数量有限,模型在沙盒、射击和体育游戏中的表现,也不一定能代表它在办公软件、浏览器、编程环境或企业系统中的行为。
此外,Vals的结果属于评测机构自行运行并发布的数据,原始页面没有显示独立机构复测。测试记录、评分规则和方法说明为读者提供了核验线索,但外界仍需要更多重复试验和第三方评估,才能判断这些差异是否能够跨运行、跨任务稳定复现。
这也是当前AI基准测试面临的更大问题之一。TechCrunch在9月19日的报道中指出,Vals成立于2024年,目标是通过更贴近实际工作的任务改进传统模型评测。公司此前关注法律、金融、编程和网络安全等领域,并在2026年8月完成由Andreessen Horowitz领投的4000万美元A轮融资。TechCrunch 对 Vals AI 的报道也将其放在“传统基准逐渐落后于模型进步”的行业背景下讨论。
从“能否完成”转向“如何完成”
CUA-bench最值得关注的地方,可能不是GPT-6 Astra暂时领先,而是评测对象发生了变化。传统基准往往关注模型能否给出正确答案;游戏中的电脑操作则要求模型持续观察环境、记住空间关系、控制动作节奏,并在失败后调整策略。
这类评测也让“完成任务”和“可靠完成任务”之间的区别更加明显。模型可能在某一次运行中完成特定关卡,却仍然存在较高延迟、动作不连续或对新环境适应不足的问题。对于真正的计算机代理而言,速度、稳定性、权限边界和错误恢复能力,往往与最终结果同样重要。
AIFlux此前关于 Google Agent Anomaly Detection的报道显示,企业已经开始从最终答案转向审计代理的工具调用和运行轨迹;而 DeepSeek Harness 对智能体工作区和插件的更新则体现了代理正在获得更多文件、浏览器和多智能体工作区能力。CUA-bench所测试的视觉操作能力,可能成为这些系统继续扩展时需要补足的一层基础能力。
但目前还不能据此得出“GPT-6 Astra已经具备通用电脑代理能力”的结论。更稳妥的判断是:在一次由Vals设计的、以六款商业游戏为载体的三小时单次试验中,GPT-6 Astra取得了最高总体得分,并在空间推理和隐藏沙盒测试中表现出相对优势。它能否在更多环境、更快速度和可重复的测试中保持优势,仍需要后续评测回答。
来源: