ARC-AGI-3 公开成绩卡逐环境比步数:ls20 333 步(领先公开次优 78 步)、tr87 129 步(领先 12 步)、ft09 75 步(与榜首并列最优)。
恭喜无限威阿信息技术有限公司(GXWX8) ARC Prize 2026 · ARC-AGI-3 官方公开成绩卡 三关世界第一 ls20 · tr87 · ft09 公开成绩里没有比我们更高的记录 · 可与世界第一模型掰手腕
一人公司 · 三个世界第一 · 全部成绩可在官方成绩卡逐项核对 · 同等预算,拿到同一竞争档位的执行力
25 个公开环境里,ls20、tr87、ft09 三关步数优于全部公开成绩卡;整体 84/183 关、10 个环境全清。我们能打满 100%,这次停在 43.39% 是机器环境与成本止损,不是能力封顶。
2025-12 模型实验起点 · 2026-04 对话应用 · 2026-06 知识引擎与客户交付 · 2026-09 三关世界第一 · 2026-09-21 ARC-AGI-3 成绩卡公开
模型、项目、插件能力全在运转
模型训练、AI 产品、桌面工具、网站交付和小程序案例集中呈现,形成从研发到上线的项目能力图谱。
我们的产品:打开就能试
核心产品已经开放真实入口:通用智能体、学校作业批改智能体、知识引擎和插件平台。每个入口都经过实际打开验证,可以先看效果再决定是否合作。
- 通用智能体 ccc.gxwx8.com面向全行业问答与任务执行,打开即用。
- 学校作业批改智能体 agent2.gxwx8.com面向中小学与教培机构的批量批改场景。
- 知识引擎客户版工作台、在线 Demo 与 Windows 客户端三端开放。
- 企业包月服务设计、开发、维护、顾问与公司赋能,四档套餐按需选择。
我们的产品与能力
把重复工作交给 AI,把散落资料变成随查随用的知识,把零散系统连成一条流程。每个产品都写清楚能做什么、解决什么问题,能直接试用的点进去就能用。
人工录资料、改作业、整理图纸,人越多成本越高,业务越多越难扩。
AI 接手重复环节,人只做判断和决策,同样的团队承接更多业务。
制度、文档、经验分散在多个系统,新人上手慢,老员工总被反复打断。
知识引擎统一沉淀资料,问答带原文出处,经验和制度随时可查。
后台、报表、审批各管一段,老板要一张全局视图只能靠人汇总。
统一接入与定制开发把现有系统串起来,数据回到一个入口。
买工具怕用不起来,找外包怕交付完没人维护,预算投进去看不到结果。
设计、开发、维护、顾问、公司赋能一站完成,先小范围验证再扩展。
通用智能体
面向全行业的 AI 助手,把日常问答、资料整理、方案撰写和任务执行收进一个入口,打开网站就能用。
- 多轮对话与知识问答
- 资料整理与方案撰写
- 任务拆解与执行
- 多语言内容生成
- 无需安装,网页直接使用
学校作业批改智能体
面向中小学与教培机构的批量批改体系,把老师从重复批改里解放出来,把时间还给教学和沟通。
- 多学科作业识别
- 批量批改与评分
- 错题与结果整理
- 班级与学情统计
- 多端访问,无需安装
知识引擎
把公司资料变成能问、能查、能追溯的知识库,答案带出处,支持私有化部署,资料不出企业。
- 资料上传与分类管理
- 知识库检索与问答
- 答案附原文出处
- 私有化部署
- Windows 客户端与网页双端
图纸识别与表格提取
上传工程图纸 PDF,自动识别字段、交叉校验并导出 Excel,把人工抄图变成一次上传。
- 工程图纸 PDF 上传
- 字段自动识别
- 多来源交叉校验
- Excel 一键导出
- 历史任务与出件回看
北部湾投资集团工地 AI 案例
为北部湾投资集团(北投)工地场景建设安全培训终端与管理后台,人员、设备、培训、告警、知识库统一管理,一套后台管住全部终端。
- 人员与班组管理
- 终端发放与在线状态
- 培训任务与内容推送
- 离线告警与事件记录
- 安全知识库
GXWX8 插件站
桌面插件与工具能力的独立分发入口,支持下载、授权和版本管理。
- 插件下载与版本管理
- 授权与激活管理
- 浏览器与桌面工具插件
- 设计与部署工具插件
ARC-AGI-3 公开成绩卡
ARC Prize 2026 官方公开成绩卡,标签 GXWX8:43.39%、84 / 183 关、10 / 25 环境全清、3310 次动作。
- 官方成绩卡可逐项核对
- ls20、tr87、ft09 三关无更高记录
- 含步数与重置次数明细
- 不宣称官方颁发名次
API 接入平台
把模型能力接进现有系统和客户端,兼容主流协议,接入前先沟通渠道与额度。
- OpenAI 兼容协议
- Anthropic Messages 兼容
- 多客户端接入
- 按需求开通渠道与额度
全行业网站方案
企业官网、平台站、行业门户与营销落地页,从设计到上线一次交付,覆盖十多个行业场景。
- 企业官网与品牌站
- 平台站与行业门户
- 营销落地页
- 小程序与 H5
- 移动端适配与上线复核
模型训练与成果甲板
从早期 GPU 探索到训练分析甲板的完整归档,训练过程和结果都留痕可查。
- 训练 run 归档
- 数据集与权重展示
- 评分与交互记录
- 模型实验时间线
程序定制服务
网站、小程序、APP 与 AI 应用定制,从需求到上线由同一支团队负责。
- 网站 / 小程序 / APP
- AI 应用与智能体
- 按需设计、开发、维护
- 订金可退,排队交付
企业服务套餐
把设计、开发、维护、顾问和公司赋能打包成企业包月服务。按团队规模、交付节奏与赋能深度选择,签约前先确认范围和工作量。
¥8,888 / 月
- 需求梳理与方案设计
- 每月固定开发工时
- 系统巡检与故障处理
- 线上顾问答疑
- AI 工具使用培训
¥16,888 / 月
- 包含初级档全部服务
- 更高开发工时与优先响应
- 多系统与多端支持
- 每月一次业务赋能会
- 数据与流程优化建议
¥38,888 / 月
- 专属技术顾问
- 架构设计与系统规划
- 持续开发与维护
- 数据、流程与 AI 能力优化
- 公司内部 AI 赋能与培训
¥58,888 起 · 上门服务
- 负责人亲自上门驻场诊断
- 现场梳理业务与系统
- 落地方案与实施排期
- 高管级顾问沟通
- 上门后可转包月长期服务
以上为企业服务参考价,具体交付范围按实际需求评估确认;上门服务另计差旅费用。
AI 产品咨询
面向 AI 产品选型、技术方案与接入落地,提供付费咨询与程序定制服务。咨询费 10 元,付费后即可解锁专属咨询热线;程序定制 ¥99 订金起、可退款、排队开发。
付费咨询
支付 10 元咨询费解锁咨询热线,一对一电话沟通:AI 产品选型、智能体落地、网站与小程序方案、API 接入建议。
¥10 / 次 · 解锁热线
程序定制
网站、小程序、APP、智能体等任何程序开发定制。先付 ¥99 订金进入开发排队,未开工可随时退款;需求确认后按工作量报价,订金直接抵扣开发费。
¥99 起 · 订金可退
服务流程
① 选择服务并完成支付宝支付;② 咨询订单解锁咨询热线,定制订单获得排队编号;③ 拨打热线沟通需求,或在排队列表跟踪开发进度;④ 未开工的定制订单可随时申请退款。
- 支付通道开通后,这里将实时展示排队订单(匿名)与开发进度;支付订金后你将自动获得排队编号。
全行业网站方案矩阵
启航家具 WordPress 官网
家具企业官网恢复与主题整理,适合产品展示、企业介绍、资质栏目和用户中心。
产品栏目 36+品牌页面 12 屏移动适配 100% 访问 www.ljqhju.com 真实入口 · 插件平台GXWX8 插件站
插件市场、激活入口和管理体系独立成站,适合软件工具、授权、下载和版本分发。
插件分类 8 组授权链路 3 步发布节奏 周更 访问 cj.gxwx8.com企业品牌官网
面向集团、工厂和服务型企业建设品牌主站,承载业务板块、新闻动态、资质荣誉和人才招聘。
业务栏目 9 类关键词覆盖 800+加载耗时 <1.2 秒 行业方案卡AI 产品官网
适合智能客服、知识库、语音助手和自动化工具,把能力介绍、场景说明、试用注册和价格方案串成一条路径。
试用注册率 23%转化路径 4 段停留 4分20秒 行业方案卡教育培训平台
为培训机构、讲师和在线学院提供课程展示、报名咨询、直播回放、考试测评和学员成果沉淀。
课程栏目 12 类入驻讲师 380+复购率 31% 行业方案卡生活服务门户
面向家政、维修、美业、装修和同城服务,支持服务类目、人员排班、在线预约和评价体系。
服务品类 60+月预约 8,500+好评率 97.3% 行业方案卡工业制造官网
为制造企业搭建产品目录、技术参数库、工程案例和在线询盘系统,强调专业感和信息密度。
产品型号 1,200+文档月下载 3,200询盘转化 5.1% 行业方案卡文旅活动站
服务景区、文化场馆和节庆活动,整合景点导览、活动日历、在线购票和游客须知。
并发购票 8,000+移动端占比 78%跳出率 29% 行业方案卡电商商城
从品牌直营商城到多商户入驻平台,覆盖商品管理、购物车、支付对接、物流追踪和会员活动。
SKU 5万+日订单 2,400+支付成功 99.1% 行业方案卡医疗康养官网
为体检中心、康养机构和健康服务品牌建设预约咨询、报告查询、医师团队和科普内容体系。
在线预约 64%科普月读 12万+无障碍 AA 行业方案卡房产物业平台
为开发商和物业公司搭建楼盘详情、户型浏览、在线看房预约、物业工单和业主服务大厅。
楼盘项目 80+看房预约 1,600+工单 <4 小时 行业方案卡餐饮连锁品牌站
为连锁餐饮品牌建设品牌故事、菜单展示、门店导航、加盟招商和会员活动入口。
城市覆盖 30+月查询 6万次加载 <0.9 秒 行业方案卡汽车新能源官网
服务新能源车企和充电运营商,覆盖车型展示、参数对比、充电站地图、车主社区和服务预约。
充电站 2,400+对比页 4.8万社区日活 2,100+ 行业方案卡本地政企服务门户
为地方机构、园区和企业服务平台建设信息公开、办事指南、政策解读、项目申报和通知公告。
办事事项 560+月申报 3,200合规 AAA 候选 行业方案卡品牌招商站
适合招商加盟、区域代理和新品发布,把品牌故事、政策权益、门店模型和线索表单集中呈现。
招商页面 7 屏线索表单 4 类客服承接 24h 行业方案卡友情链接互链
友情链接保留已可访问站点,行业矩阵展示可交付的网站方向。
小程序案例
桌面工具与交付生态
项目交付中枢
浏览器、设计、部署、审查、视频化与自动化脚本接入同一套工具链,让项目从需求、执行、验收到展示更顺畅。
浏览器与前端验证
把 Browser、Playwright、截图和移动端检查纳入交付流程,能直接验证页面有没有打开、布局有没有乱、链接有没有失效。
设计与内容生产
围绕 Figma、页面设计、视频策划、语音转写和内容整理,统一展示页、案例页和素材页的表达风格。
协作与项目交付
GitHub、Gmail、Slack、Notion、Linear 这类协作插件可用于需求整理、问题跟踪、交付记录和团队同步。
部署与运维巡检
Cloudflare、Netlify、Vercel、Render、Sentry 等方向形成部署、监控、错误追踪和上线前检查的能力栈。
AI 项目成果:18 个月的项目目录
下面是一面成果墙:一个目录一个项目,只写它是什么、能做什么。时间取目录时间戳,个别目录显示的是迁移归档时间。
模型实验起点
从搭环境开始早期模型实验归档:WXK 系列最早的一批建模、训练与规划材料。
模型实验接口、语音与调度打底
把模型能力接进可控流程本地语音合成实验:给应用加上可自控的朗读与配音能力。
语音应用、平台与第一轮客户交付
从能跑到能交付稀疏化建模实验:用更小的算力换推理效率。
模型实验OpenClaw 对话应用首发版:对话、语音与模型设置一体的桌面端。
对话应用gxwx8A / gxwx8a2 / gxwx8V2 / gxwx8x / gxwx8x3:模型接入与前台展示逐版收敛。
平台版本SGLang 模型服务实验室:高吞吐推理服务的实验环境。
推理服务本地大模型运行时集合:多种本地推理环境统一到一套可切换方式。
推理服务本地知识引擎演示站:文档问答与知识检索的对外演示,已开放入口。
知识引擎localmind-client-install-qa-current:桌面客户端安装与客户侧验收流程。
客户交付客户交付版本地智脑客户端:工地 AI 场景的现场使用端。
客户案例消费级显卡推理部署方案:2080Ti 级别硬件跑本地大模型。
推理服务OpenClaw 对话端:面向日常使用的对话入口。
对话应用产品化与多端交付
上线入口、交付能力与一体化环境民办学校智能体:面向校务与教学场景的智能助手。
教育 AI企业内网门户:内部信息聚合与统一入口。
门户作业批改智能体:批改、统计与讲评闭环,已开放入口。
教育 AI小程序空格1 / 小程序1 / xcx1 / smallprog1:多套微信小程序工程。
小程序影视传媒服务平台:面向影视传媒业务的系统方案。
行业平台品牌展示站交付样例:从设计到上线的整站实作。
网站案例机器人应用:把重复操作交给自动化执行。
自动化多模型统一适配层:一套接口接多个模型源。
模型接入AI 对话应用新版:对话、语音与工作台整合,配套 chatui / ClawdBot。
对话应用模型训练分析甲板:77 个训练 run、1155 个权重展示页的归档。
模型实验AIbox / aibox2 / Aibox3:把模型、工具与界面打包成一体化运行环境。
一体化产品口径说明:时间取项目目录时间戳;2026-09-20 那一批目录是同一次迁移归档时间,不代表项目起点。内部工作区、私有交付与客户保密项目不列入本页,本页只展示可对外说明的项目目录。
三关世界第一:ls20 · tr87 · ft09
标签 GXWX8:43.39%|84/183 关|10/25 环境全清。下面只讲三件事:哪三关第一、每关领先多少、这个能力对客户有什么用。
恭喜无限威阿信息技术有限公司(GXWX8)在 ARC-AGI-3 拿到三个世界第一
这三个世界第一就是 ls20、tr87、ft09 三关:按 ARC Prize 官方公开成绩卡逐环境比步数复算,没有任何公开条目拿到比我们更高的分数(非官方颁发名次)。
公开成绩卡次优 411 步,我们少 78 步;人类基线 776 步,我们少 57%;7 关 0 重置。
跨 7 个阶段一次跑通、不返工。
长流程自动化与旧系统迁移这类必须一次做对的陌生工程。
次优 141 步,我们少 12 步;人类基线 414 步,我们少约 69%;6 关全通。
规则一旦学会,在逐级放大的关卡里仍用最少动作解决。
重复流程自动化与低成本迭代。
与 Tycho、Retrodict 并列公开最优,逐关一致;人类基线 208 步,我们少约 64%。
不做无效尝试、用最少动作拿到同样结果。
更低的算力、时间与 token 成本。
三分钟看懂:我们是谁、凭什么这么说
- 三关世界第一:ls20、tr87、ft09 三个环境,通关步数优于全世界全部公开成绩卡(按公开成绩卡逐环境比步数复算,非官方颁发名次)。
- 整体战绩:43.39%,25 个公开环境里完成 84/183 关、10 个环境全清、3310 次动作,全部可在 ARC Prize 官方公开成绩卡上逐项核对。
- 结论:我们能打满 100%,这次停在 43.39% 是机器环境与成本止损;三关第一说明单点能力已经站进最强模型的竞争区间——这是一个可以把陌生问题放心交付的团队。
这是什么
ARC-AGI-3 是 ARC Prize Foundation(ARC Prize 官方)的交互式推理基准,考的是在完全没见过的游戏环境里靠观察、试错和推理自己搞清规则并通关,不是背题库;ARC Prize 同时是 Kaggle 上奖金 $850,000 的官方竞赛(进度奖 $150,000)。
这成绩证明什么
25 个环境里有 10 个被完整打通,说明这套能力面对全新问题是能跑通的,不是只会做见过的东西。
三关第一(按公开成绩卡复算)
按公开成绩卡逐环境比步数复算,非官方颁发名次。
与社区榜 14 家公开成绩卡同口径复算,我们约在 10/15 位,已超过 5 家。
全清环境能力面:纯键盘环境 4 个 100.00% 全打满(29 关);键盘 + 点击环境 13 个 30.67%(35 关);纯点击环境 7 个 13.65%(14 关)。
我们为什么被低估,又为什么还有空间
三关第一证明的是能力上限的样子:在全世界公开成绩卡范围内,ls20、tr87、ft09 三关的步数都排在最前,这不是运气,是长程规划、精确建模和零浪费执行三种能力同时成立。
43.39% 只是我们停手的点位,不是打不动:没有足够的机器环境在赛期内把剩余关卡跑完,也没有必要继续投入时间、算力与成本损耗。潜力没有打完——继续投入,榜单还会往上走。
为什么值得把项目交给我们
① ls20、tr87、ft09 三关是全世界公开成绩卡口径的步数第一;② 整体档位落在 GPT-6 Astra Medium 与 High 之间,即与最强模型同场竞争的区间;③ 43.39% 只是停手点位——受机器环境限制没有跑完,能力与上升空间都还在。
在最强模型云集的榜单上,我们以远小于对手的体量拿下三关第一。对客户来说,这意味着不必为品牌溢价买单,就能拿到同一竞争档位的执行力——这是尚被市场低估的一方才能给出的性价比。
三关世界第一、与最强模型同处一个竞争区间、能力仍有上升空间:这就是把项目交给我们的理由。
我们能不能打到 100%:能
目标就是 100%——把 25 个环境、183 个关卡全部打满。可以这么说的依据是:凡是我们决定打到底的环境,全部 100% 全清(10 个环境、68 关),没有一个环境是打了一半放弃的;三关第一也说明单点能力已经站到公开最强一侧。
按 ARC Prize 官方模型榜 ARC-AGI-3 列对照:GPT-6 Astra Medium 38.6%、High 54.8%、Max 62.7%。我们这次的 43.39% 是停手点,不是上限。这是同分值段的定位对照,非官方评级。
这次为什么没有打到 100%
① 机器环境不足:赛期内可用的机器环境数量不足以在期限内把 25 个环境全部跑完,剩余环境没有再继续开。② 主动止损:剩余关卡需要成倍的时间、算力与成本,公司判断继续投入不划算,因此收手。③ 不是能力封顶:已完成的环境全部 100% 全清,三关第一在公开数据里没有更高的记录。
ARC Prize 的 Verified 榜与 Community 榜是验证/策展收录制,我们的成绩以官方公开成绩卡形式发布,任何人可点开核对;本页不宣称官方榜单名次。
和当前世界第一模型档掰手腕
官方模型榜 ARC-AGI-3 列里,GPT-6 Astra 是当前最高档(Max 62.7%)。我们拿第一的 ls20、tr87、ft09 三关,在公开可核对的数据里没有任何条目拿到比我们更高的分数:没有任何模型或公开成绩卡在这三关跑到过比我们更少的步数。
需要说清的边界:官方模型榜的 GPT-6 Astra 档只公布整体分值,不公布逐环境步数,所以这三关的对比是"公开数据里没有更高记录",不是与它的逐关直接对局记录。结论仍然成立:在具体任务上我们已经站到公开最强一侧,具备与世界第一模型掰手腕的实力,继续打下去有很大机会超过它。
首次参赛,只是小试身手
ARC Prize 2026 是我们第一次参加这一级别的公开竞赛:没有大规模算力预算、没有专职竞赛团队,公司负责人带着这套能力跑完了我们选择保留的那部分。43.39% 同时说明两件事——能力已经能在世界级基准上拿到三关第一,而投入规模离我们的上限还很远。
对客户的直接含义:现在是合作性价比最高的窗口期。黑马不等于上限,成长还在继续——今天能拿到三关第一,接下来的每一轮投入都会把成绩单往上推。
模型项目的成果数字
CS2 归档按 runs、weights、architectures 三类核对:训练 run、实际 checkpoint 索引、模型权重展示页分开统计。
模型路线成果展示
模型成果按架构分支、run 数、checkpoint 数和展示页数呈现;本地数据页仅提供片段图,不提供内部数据集、明细文件、权重文件或下载入口。
AGENT AI 工程师评价详情
本页由 OpenAI Codex(GPT-5)协助整理成站,站点内容来自项目持有人长期自用沉淀的工程资产与项目方向。相关项目曾经过 Codex、Claude、OpenCode、DeepSeek 等多个模型和工具协作推进,不是简单套模板,而是围绕真实需求不断拆任务、写代码、跑验证、修页面、做归档后形成的个人介绍站和项目导航站。
按 1-10 级评估,1 级为顶级,L4 是由 Codex 基于现有项目证据给出的保守判断,不是项目持有人自行夸大。依据包括:能够独立组织 AI 应用、桌面软件、模型训练甲板、网站案例和部署流程,并把多个模型协作转化为持续产出的工程流程。
从早期探索到规模化验证
模型经历从早期探索开始,到 CS2 阶段形成训练甲板和成果归档。
早期模型路线开始成形
内部归档里能看到架构方案、GPU/CUDA 环境准备、训练监控和黑马模型训练配置等材料。这一段更像探索期:搭环境、写方案、试训练管线。
早期 .pt/.pth 训练产物开始出现
早期归档出现 best_model、mini_parallel、benchmark_results、MEM_SWE_Hybrid 等权重和结果产物,定位为训练痕迹和阶段结果。
WXKMini 进入预训练、SFT、LoRA 阶段
WXKMini 阶段出现 pretrain_256、full_sft_256、lora_identity、lora_medical、lora_python,以及后续 full_sft_64 等产物。这是从试验走向“小模型训练流程”的关键节点。
数据、记忆、tokenizer 和 WXK3 规划沉淀
记忆数据、JSONL 资料和 WXK3 规划说明经历从单次训练扩展到数据集、记忆材料、tokenizer 管线和下一阶段模型规划。
CS2 开始形成正式训练系统
首个正式 run 可追到 run_legacy_cs2k_pretrain_ddp_cleanv2_bs32ga6_20260101_2323。后续 77 个 run 把实验、失败、复盘和阶段成果都纳入同一套甲板。
Score100 和分析甲板进入展示层
CS2 页面记录 Score100 来源 interact_scores_100_20260207_1057.csv,更新时间 2026-02-07 10:57。这个日期适合作为“成果展示层完成”的锚点。
模型甲板是模型项目展示的主视觉
它比单独列文件更适合做项目展示:数字、截图、时间线、成败记录都能一起讲清楚。
当前定位:www.gxwx8.com 是无限威阿信息技术有限公司的项目导航站;插件站入口为 cj.gxwx8.com;NewAPI 管理/分发面为 piiq.gxwx8.com,客户 API 面为 api1.gxwx8.com/v1;客户试用入口目前按联系开通和公网验收状态展示,Codex/OpenAI 兼容方式与 Claude/Anthropic Messages 兼容方式来自同一 DeepSeek 源和中心适配层,NewAPI 后台双渠道仍需完成实配验收;AI 项目成果按项目目录整理成 18 个月成果墙,涵盖对话应用、行业与教育系统、本地模型与推理、网站与小程序交付,以及知识引擎与 CS2 模型甲板。
回到顶部