ARC PRIZE 2026 · ARC-AGI-3 · OFFICIAL PUBLIC SCORECARD
恭喜无限威阿信息技术有限公司(GXWX8) ARC Prize 2026 · ARC-AGI-3 官方公开成绩卡
三关世界第一ls20 · tr87 · ft09 · 被低估的挑战者 · 仍在上升期
一人公司 · 三个世界第一 · 全部成绩可在官方成绩卡逐项核对 · 同等预算,拿到同一竞争档位的执行力
在 ARC-AGI-3 的 25 个公开环境里,我们有三个环境的通关步数优于全世界全部公开成绩卡: ls20 333 步、tr87 129 步、ft09 75 步——这不是运气:我们在完全陌生的环境里 自己摸清规则,并把动作压到最少;也说明这套能力仍有上升空间。
2026 年 9 月 21 日发布的官方公开成绩卡记录了整体成绩 43.39%、84 / 183 关、 10 / 25 环境全清与 3310 动作,任何人都可以点开官方地址逐项核对。 我们可以打满 100%:凡是我们决定打到底的环境,全部 100% 全清。这次停在 43.39%, 原因是赛期内可用的机器环境不足以把剩余环境全部跑完,加上主动止损控制成本。
官方模型榜 ARC-AGI-3 列的当前最高档是 GPT-6 Astra(Max 62.7%)。在我们拿下第一的 ls20、tr87、ft09 三关上,公开可核对的数据里没有任何条目拿到比我们更高的分数—— 单点任务上我们已经站到最强模型前面,是可以和当前世界第一模型掰手腕的挑战者。
01 · WHAT IS ARC-AGI-3
这是什么
先说清楚比赛本身,再看成绩。
ARC-AGI-3 是 ARC Prize Foundation 的交互式推理基准:面对完全没见过的游戏环境, 参与者只能靠观察、试错和推理,自己搞清规则并一路通关,不靠背题库,也不靠提前见过同类题目。
ARC Prize 同时是 Kaggle 官方竞赛,奖金 $850,000,其中进度奖 $150,000。 换句话说,这是一场给全新问题当场上手的公开比赛。
02 · WHAT THE SCORE PROVES
这成绩证明什么
四个数字都来自同一张官方公开成绩卡。
官方公开成绩卡总分
通关关卡数 / 总关卡数
全清环境数 / 总环境数
成绩卡记录的动作总数
一句话总结:25 个环境打通 10 个完整环境,说明面对全新问题是能跑通的通用能力,不是只会做见过的东西。
03 · STEP COUNT · THREE ENVIRONMENTS
三关世界第一:ls20 · tr87 · ft09 代表什么水平
在世界范围的公开成绩卡里逐环境比步数复算,非官方颁发名次。
这关考什么:7 个关卡连续推进,状态要一路带到终局;靠重开试错会直接记进步数与重置数。
逐关步数:13 · 45 · 49 · 47 · 46 · 78 · 55,每一关都低于官方基线(22 · 123 · 73 · 84 · 96 · 192 · 186)。
第一代表什么能力:长程规划与状态记忆。跨 7 个阶段一次跑通、0 重置、全程不返工,比人类基线少约 57%——对应长流程自动化、旧系统迁移这类必须一次做对的陌生工程。
这关考什么:纯方向键动作空间,规则逐级递进,官方基线从 54 步一路抬到 146 步;考的是学会一次之后能不能继续压缩。
逐关步数:14 · 25 · 21 · 21 · 19 · 29,每一关都低于官方基线(54 · 58 · 40 · 45 · 71 · 146);最后一关基线 146 步,我们 29 步。
第一代表什么能力:精确建模与规则复用。规则一旦学会,在逐级放大的关卡里仍以最少动作解决,比人类基线少约 69%、比全世界次优的 141 步少 12 步——对应重复流程自动化与低成本迭代。
这关考什么:6 个关卡按动作数计分,任何多余试探都会留在步数里;步数曲线从 4 步一路加到 21 步。
逐关步数:4 · 7 · 14 · 16 · 21 · 13,与并列第一的两位对手逐关相同,且每一关都低于官方基线(43 · 12 · 23 · 28 · 65 · 37)。
第一代表什么能力:零浪费执行。不做无效尝试、用最少动作拿到同样结果,比人类基线少约 64%——直接对应更低的算力、时间与 token 成本。
以上比较按公开成绩卡逐环境比步数复算,非官方颁发名次;与社区榜 14 家公开成绩卡同口径复算,约处第 10/15,已超过 5 家。
纯键盘环境 · 4 个
100.00%
29 关全部通过。代表能力:纯键盘动作空间下的规则推理与长程规划——这一类我们全部打满。
键盘 + 点击环境 · 13 个
30.67%
35 关通过。代表能力:混合动作空间下的探索、操作映射与状态跟踪。
纯点击环境 · 7 个
13.65%
14 关通过。代表能力:纯点击交互环境的规则发现与长程探索。
环境按官方成绩卡的动作类型标签分组,分值 / 关卡数 / 动作数均为成绩卡现读数据。
10 个全清环境(关卡数 · 动作数):ls20 7/7 · 333、tr87 6/6 · 129、ft09 6/6 · 75、cn04 6/6 · 218、dc22 6/6 · 455、g50t 7/7 · 285、ka59 7/7 · 337、r11l 6/6 · 110、re86 8/8 · 525、wa30 9/9 · 640。
04 · 100% · WHY WE STOPPED AT 43.39%
我们可以打满 100%,这次为什么停在 43.39%
对照 ARC Prize 官方模型榜 ARC-AGI-3 列的公开分值,仅作定位参考,非官方评级。
官方模型榜 ARC-AGI-3 列
官方模型榜 ARC-AGI-3 列
这次的停手点,不是能力上限;已完成环境全部 100% 全清
官方模型榜 ARC-AGI-3 列
能不能到 100%:能。目标就是 25 个环境、183 个关卡全部打满;凡是我们决定打到底的环境,全部 100% 全清(10 个环境、68 关),没有一个是打了一半放弃的。43.39% 是这次的停手点,不是能力封顶。
这次没有打到 100% 的两个原因:① 机器环境不足——赛期内可用的机器环境数量不足以在期限内把 25 个环境全部跑完,剩余环境没有再继续开;② 主动止损——剩余关卡需要成倍的时间、算力与成本, 公司判断继续投入不划算,因此收手。两者都与模型能力无关。
和当前世界第一模型档的对照:官方模型榜 ARC-AGI-3 列的当前最高档是 GPT-6 Astra(Max 62.7%)。 我们拿第一的 ls20、tr87、ft09 三关,在公开可核对的数据里没有任何条目拿到比我们更高的分数—— 没有任何模型或公开成绩卡在这三关跑到过比我们更少的步数,单点任务上我们已经站到最强模型前面。
需要说清的边界:官方模型榜的 GPT-6 Astra 档只公布整体分值,不公布逐环境步数, 所以这三关的对比口径是"公开数据里没有更高记录",不是与它的逐关直接对局记录。 结论仍然成立:我们有和当前世界第一模型掰手腕的实力,继续打下去有很大机会超过它。
05 · WHY WE STOPPED HERE
没打满 100%,但能力没有见顶
这是我们的主动选择,也是公开可核对的事实。
我们主动收手:一方面赛期内可用的机器环境不足以把剩余环境全部跑完, 另一方面也没有必要为剩下的关卡继续投入成倍的时间、算力与成本;剩余环境按流拍放过,没有再继续开。
这不代表做不到、也不代表不想拿完:凡是我们决定打到底的环境,全部 100% 全清(10 个环境、68 关)。 43.39% 是受限条件下的停手点,不是我们的上限——我们仍然可以继续往上打,只是选择停在这里。
从客户视角看,关键在潜力:三关第一已经证明这套能力在全世界公开成绩卡范围内能打, 43.39% 只是我们停手的点位。继续投入,榜单还会往上走——这是一支仍在上升期的团队。
还要说清一件事:ARC Prize 2026 是我们第一次参加这一级别的公开竞赛——没有大规模算力预算, 也没有专职竞赛团队,公司负责人带着这套能力跑完了我们选择保留的那部分。这是一次小试身手, 不是我们的上限;黑马不等于终点,成长才刚刚开始。
06 · WHAT THIS MEANS FOR YOU
这对客户意味着什么
成绩不是奖状,是交付能力的证据。
三个世界第一对应三种可以直接迁移到业务里的能力:面对完全陌生的系统,能自己摸清规则(长程规划与状态记忆); 能把问题建模到最短路径(精确建模);能不浪费动作一次做对(零浪费执行)。它们对应的正是陌生旧系统改造、 流程自动化,以及没有现成方案可抄的定制项目。
在最强模型云集的榜单上,我们以远小于对手的体量拿下三关第一。对客户来说,这意味着不必为品牌溢价买单, 就能拿到同一竞争档位的执行力——这是尚被市场低估的一方才能给出的性价比,也是选择我们最主要的理由。
更直接一点:一支刚出道的团队已经能在世界级基准上拿到三关第一,而它的投入规模还在起步阶段。 现在合作,是在成长曲线最陡的一段上车——同样的交付能力,更低的品牌溢价,以及一个还会继续变强的伙伴。
07 · OFFICIAL VERIFICATION
权威在哪
每条地址说明它验证什么,点开即可核对;本页不宣称任何收录位次。
GXWX8 官方公开成绩卡
它验证本页的全部数字:43.39% 总分、84/183 关、10/25 环境全清、3310 动作、标签 GXWX8 与发布日期。
https://arcprize.org/scorecards/1da9c9b5-a63f-4d6c-9c4e-e30e2c1a38c6ARC Prize Community 榜
它验证社区榜的公开成绩卡与步数统计方式,本页三关步数比较的数据源就在这里。
https://arcprize.org/leaderboard/communityKaggle ARC Prize 2026 竞赛榜
它验证 Kaggle 官方竞赛的提交与排名规则:本项目目前没有在隐藏测试集竞赛提交。
https://www.kaggle.com/competitions/arc-prize-2026-arc-agi-3/leaderboard两个榜是验证 / 策展收录制。我们的成绩以官方公开成绩卡形式发布,任何人都可以点开核对;本页不宣称任何榜单名次,也不使用夸大称号。
三个世界第一——43.39% 只是我们这次的停手点位;我们可以打满 100%,也能和当前世界第一模型掰手腕。欢迎每一位访客点开上面的官方地址,自己核对这张成绩卡的每一个数字。