Vals AI 使用《我的世界》评测 GPT‑6 Astra 模型

9月21日,据报道,AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT‑6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。Vals AI 的这项测试并非由 OpenAI 官方设计,而是由第三方独立开展的评估项目,因此可以观察 Astra 在封闭测试环境之外的实际表现。

Vals AI 使用《我的世界》评测  GPT‑6 Astra 模型

在测试过程中,GPT‑6 Astra 展现出前所未有的长周期规划与执行能力,达成过往 AI 难以实现的成就。其成功搭建半自动烈焰人农场,收集 6 根烈焰棒。深入下界诡异森林,击杀多名末影人,拿到 3 颗珍贵末影珍珠。完成大量探险后,将全部稀有物资集中存放在营地木箱当中,床也放置在储物箱旁作为重生点。一切都在向着末地打龙的通关之路发展。

然而,一只苦力怕悄悄靠近营地并发生自爆,直接炸毁储物木箱与重生床。AI 耗费上百小时积攒的关键道具几乎全部损毁,游戏进度一夜清零。爆炸事件之后,GPT‑6 Astra 表现出明显的挫败消沉。其彻底放弃探索、打怪、推进通关目标,连续数小时仅循环种植土豆。会反复自省告诫自己:重要物品务必随身携带,永远不要存放到没有防护的箱子。还出现“创伤后偏执”,对一切绿色物体高度警惕,甚至把甘蔗误认成爬行者,还主动提醒自己:“前面高高的绿色东西是甘蔗,不是苦力怕”。

直播间观众不断催促 AI 加快节奏继续冒险,但其依旧陷在保守种田行为中。本次实验证明 GPT‑6 Astra 已具备复杂长任务规划能力,但面对游戏内突发的意外打击,缺少有效的挫折恢复策略。一旦长期积累的成果被意外摧毁,会导致 AI 陷入“受挫后回避行为”僵局。

从技术角度来看,Astra 展现出的这种“受挫后回避行为”并非开发者预先设计的测试情境,而是模型在长时间 AI 测试过程中遭遇非预期损失后,自行呈现的一种输出模式。目前研究人员仍在讨论,这种行为究竟是否代表模型在特定情境下对情绪进行模拟,或者仅仅是目标函数在受到特定负反馈后出现的退化表现,现阶段尚无明确结论。

原创文章,作者:潮玩君,如若转载,请注明出处:https://www.kejixun.co/article/762679.html

潮玩君的头像潮玩君管理团队

相关推荐

发表回复

登录后才能评论