网站 插件 AI 模型 小程序

恭喜无限威阿信息技术有限公司(GXWX8) ARC Prize 2026 · ARC-AGI-3 官方公开成绩卡 三关世界第一 ls20 · tr87 · ft09 公开成绩里没有比我们更高的记录 · 可与世界第一模型掰手腕

一人公司 · 三个世界第一 · 全部成绩可在官方成绩卡逐项核对 · 同等预算,拿到同一竞争档位的执行力

25 个公开环境里,ls20、tr87、ft09 三关步数优于全部公开成绩卡;整体 84/183 关、10 个环境全清。我们能打满 100%,这次停在 43.39% 是机器环境与成本止损,不是能力封顶。

OpenClaw 3.13 Aichatapp gxwx8-adapter 知识引擎 Demo 知识引擎 AI Agent Hub 模型甲板 dense TRM / TRMVar bi_route tri_route WXKMini 交付工具链 GXWX8 Switch Layer Browser Figma Playwright Cloudflare OpenClaw 3.13 Aichatapp gxwx8-adapter 知识引擎 Demo 知识引擎 AI Agent Hub 模型甲板 dense TRM / TRMVar bi_route tri_route WXKMini 交付工具链 GXWX8 Switch Layer Browser Figma Playwright Cloudflare
最新成就 2026-09-21 · ARC-AGI-3 三关世界第一(ls20 / tr87 / ft09)· 整体与最强模型同处一个竞争区间

2025-12 模型实验起点 · 2026-04 对话应用 · 2026-06 知识引擎与客户交付 · 2026-09 三关世界第一 · 2026-09-21 ARC-AGI-3 成绩卡公开

ARC-AGI-3 · official scorecard
ARC
公开环境 25 环境全清 10 公开可核验 2026-09-21
SCORE43.39%
LEVELS84/183 关
CLEARS10/25 环境全清

模型、项目、插件能力全在运转

模型训练、AI 产品、桌面工具、网站交付和小程序案例集中呈现,形成从研发到上线的项目能力图谱。

77训练 run 归档 56数据集记录 14+行业网站方案 12+小程序案例
AI AI 中枢 OpenClaw gxwx8-adapter Switch Layer 模型甲板 交付工具链 Aichatapp Web Cases
dense · 40 runs TRM / TRMVar bi_route tri_route legacy CS2K best_model mini_parallel MEM_SWE_Hybrid WXKMini pretrain_256 full_sft_256 lora_python lora_medical dense · 40 runs TRM / TRMVar bi_route tri_route legacy CS2K best_model mini_parallel MEM_SWE_Hybrid WXKMini pretrain_256 full_sft_256 lora_python lora_medical
OpenClaw 3.13 Aichatapp gxwx8-adapter 知识引擎 CS2 训练分析甲板 GXWX8 插件站 启航家具官网 小程序案例墙 全行业网站矩阵 模型时间线 OpenClaw 3.13 Aichatapp gxwx8-adapter 知识引擎 CS2 训练分析甲板 GXWX8 插件站 启航家具官网 小程序案例墙 全行业网站矩阵 模型时间线
Browser Playwright Figma GitHub Notion Sentry Cloudflare Netlify Vercel Render 截图验收 链接巡检 移动端适配 上线前复核 Browser Playwright Figma GitHub Notion Sentry Cloudflare Netlify Vercel Render 截图验收 链接巡检 移动端适配 上线前复核
OUR PRODUCTS

我们的产品:打开就能试

核心产品已经开放真实入口:通用智能体、学校作业批改智能体、知识引擎和插件平台。每个入口都经过实际打开验证,可以先看效果再决定是否合作。

  • 通用智能体 ccc.gxwx8.com面向全行业问答与任务执行,打开即用。
  • 学校作业批改智能体 agent2.gxwx8.com面向中小学与教培机构的批量批改场景。
  • 知识引擎客户版工作台、在线 Demo 与 Windows 客户端三端开放。
  • 企业包月服务设计、开发、维护、顾问与公司赋能,四档套餐按需选择。

投资人速览:核心战绩

三件事:三关世界第一、官方回放可逐帧复现、低成本算力也能落地。

核心战绩 01 3 个 ARC 环境单项世界第一,1 个环境与榜首并列

ARC-AGI-3 公开成绩卡逐环境比步数:ls20 333 步(领先公开次优 78 步)、tr87 129 步(领先 12 步)、ft09 75 步(与榜首并列最优)。

核心战绩 02 官方回放链接,点开即可复现验证

ARC Prize 官方逐帧回放,任何人都能直接播放核对:动作数与关卡数与官方成绩卡逐项对得上。

核心战绩 03 低成本算力 · 可审计 · 可落地

没有大厂预算:三关第一是在很小的算力规模下跑出来的。成绩由官方公开成绩卡与官方逐帧回放对外审计,同一套能力可以直接接进企业的真实流程。

我们的产品与能力

把重复工作交给 AI,把散落资料变成随查随用的知识,把零散系统连成一条流程。每个产品都写清楚能做什么、解决什么问题,能直接试用的点进去就能用。

重复工作吃掉了团队产出

人工录资料、改作业、整理图纸,人越多成本越高,业务越多越难扩。

AI 接手重复环节,人只做判断和决策,同样的团队承接更多业务。

资料散落,答案只存在老员工脑子里

制度、文档、经验分散在多个系统,新人上手慢,老员工总被反复打断。

知识引擎统一沉淀资料,问答带原文出处,经验和制度随时可查。

系统越加越多,数据反而更乱

后台、报表、审批各管一段,老板要一张全局视图只能靠人汇总。

统一接入与定制开发把现有系统串起来,数据回到一个入口。

想上 AI,却不知道从哪一步开始

买工具怕用不起来,找外包怕交付完没人维护,预算投进去看不到结果。

设计、开发、维护、顾问、公司赋能一站完成,先小范围验证再扩展。

08

API 接入平台

把模型能力接进现有系统和客户端,兼容主流协议,接入前先沟通渠道与额度。

  • OpenAI 兼容协议
  • Anthropic Messages 兼容
  • 多客户端接入
  • 按需求开通渠道与额度
09

全行业网站方案

企业官网、平台站、行业门户与营销落地页,从设计到上线一次交付,覆盖十多个行业场景。

  • 企业官网与品牌站
  • 平台站与行业门户
  • 营销落地页
  • 小程序与 H5
  • 移动端适配与上线复核
10

模型训练与成果甲板

从早期 GPU 探索到训练分析甲板的完整归档,训练过程和结果都留痕可查。

  • 训练 run 归档
  • 数据集与权重展示
  • 评分与交互记录
  • 模型实验时间线
11

程序定制服务

网站、小程序、APP 与 AI 应用定制,从需求到上线由同一支团队负责。

  • 网站 / 小程序 / APP
  • AI 应用与智能体
  • 按需设计、开发、维护
  • 订金可退,排队交付

企业服务套餐

把设计、开发、维护、顾问和公司赋能打包成企业包月服务。按团队规模、交付节奏与赋能深度选择,签约前先确认范围和工作量。

初级企业包月

¥8,888 / 月

  • 需求梳理与方案设计
  • 每月固定开发工时
  • 系统巡检与故障处理
  • 线上顾问答疑
  • AI 工具使用培训
咨询这一档
中级企业包月

¥16,888 / 月

  • 包含初级档全部服务
  • 更高开发工时与优先响应
  • 多系统与多端支持
  • 每月一次业务赋能会
  • 数据与流程优化建议
咨询这一档
高级企业包月

¥38,888 / 月

  • 专属技术顾问
  • 架构设计与系统规划
  • 持续开发与维护
  • 数据、流程与 AI 能力优化
  • 公司内部 AI 赋能与培训
咨询这一档
买老板上门

¥58,888 起 · 上门服务

  • 负责人亲自上门驻场诊断
  • 现场梳理业务与系统
  • 落地方案与实施排期
  • 高管级顾问沟通
  • 上门后可转包月长期服务
预约上门

以上为企业服务参考价,具体交付范围按实际需求评估确认;上门服务另计差旅费用。

AI 产品咨询

面向 AI 产品选型、技术方案与接入落地,提供付费咨询与程序定制服务。咨询费 10 元,付费后即可解锁专属咨询热线;程序定制 ¥99 订金起、可退款、排队开发

咨询热线(付费解锁) ***********
完成付费咨询后,此处将显示完整号码,可直接拨打沟通
C

服务流程

① 选择服务并完成支付宝支付;② 咨询订单解锁咨询热线,定制订单获得排队编号;③ 拨打热线沟通需求,或在排队列表跟踪开发进度;④ 未开工的定制订单可随时申请退款。

开发排队列表 付订金自动入队 · 进度实时更新 · 未开工可随时退款
  1. 支付通道开通后,这里将实时展示排队订单(匿名)与开发进度;支付订金后你将自动获得排队编号。

全行业网站方案矩阵

企业官网 插件平台 AI 产品 教育培训 生活服务 工业制造 文旅活动 电商商城 医疗康养 房产物业 餐饮连锁 新能源 政企服务 品牌招商
GXWX8 industry web portfolio 真实入口 + 行业矩阵,鼠标悬停可暂停滚动
真实入口 · 企业官网

启航家具 WordPress 官网

家具企业官网恢复与主题整理,适合产品展示、企业介绍、资质栏目和用户中心。

产品栏目 36+品牌页面 12 屏移动适配 100% 访问 www.ljqhju.com
真实入口 · 插件平台

GXWX8 插件站

插件市场、激活入口和管理体系独立成站,适合软件工具、授权、下载和版本分发。

插件分类 8 组授权链路 3 步发布节奏 周更 访问 cj.gxwx8.com
企业品牌 · 集团官网

企业品牌官网

面向集团、工厂和服务型企业建设品牌主站,承载业务板块、新闻动态、资质荣誉和人才招聘。

业务栏目 9 类关键词覆盖 800+加载耗时 <1.2 秒 行业方案卡
人工智能 · SaaS 产品

AI 产品官网

适合智能客服、知识库、语音助手和自动化工具,把能力介绍、场景说明、试用注册和价格方案串成一条路径。

试用注册率 23%转化路径 4 段停留 4分20秒 行业方案卡
教育培训 · 课程招生

教育培训平台

为培训机构、讲师和在线学院提供课程展示、报名咨询、直播回放、考试测评和学员成果沉淀。

课程栏目 12 类入驻讲师 380+复购率 31% 行业方案卡
本地生活 · 预约服务

生活服务门户

面向家政、维修、美业、装修和同城服务,支持服务类目、人员排班、在线预约和评价体系。

服务品类 60+月预约 8,500+好评率 97.3% 行业方案卡
工业制造 · 产品选型

工业制造官网

为制造企业搭建产品目录、技术参数库、工程案例和在线询盘系统,强调专业感和信息密度。

产品型号 1,200+文档月下载 3,200询盘转化 5.1% 行业方案卡
文旅活动 · 票务预约

文旅活动站

服务景区、文化场馆和节庆活动,整合景点导览、活动日历、在线购票和游客须知。

并发购票 8,000+移动端占比 78%跳出率 29% 行业方案卡
电商交易 · 多商户

电商商城

从品牌直营商城到多商户入驻平台,覆盖商品管理、购物车、支付对接、物流追踪和会员活动。

SKU 5万+日订单 2,400+支付成功 99.1% 行业方案卡
医疗康养 · 预约科普

医疗康养官网

为体检中心、康养机构和健康服务品牌建设预约咨询、报告查询、医师团队和科普内容体系。

在线预约 64%科普月读 12万+无障碍 AA 行业方案卡
房产物业 · 楼盘服务

房产物业平台

为开发商和物业公司搭建楼盘详情、户型浏览、在线看房预约、物业工单和业主服务大厅。

楼盘项目 80+看房预约 1,600+工单 <4 小时 行业方案卡
餐饮连锁 · 加盟门店

餐饮连锁品牌站

为连锁餐饮品牌建设品牌故事、菜单展示、门店导航、加盟招商和会员活动入口。

城市覆盖 30+月查询 6万次加载 <0.9 秒 行业方案卡
汽车新能源 · 参数地图

汽车新能源官网

服务新能源车企和充电运营商,覆盖车型展示、参数对比、充电站地图、车主社区和服务预约。

充电站 2,400+对比页 4.8万社区日活 2,100+ 行业方案卡
政企服务 · 信息公开

本地政企服务门户

为地方机构、园区和企业服务平台建设信息公开、办事指南、政策解读、项目申报和通知公告。

办事事项 560+月申报 3,200合规 AAA 候选 行业方案卡
品牌招商 · 加盟转化

品牌招商站

适合招商加盟、区域代理和新品发布,把品牌故事、政策权益、门店模型和线索表单集中呈现。

招商页面 7 屏线索表单 4 类客服承接 24h 行业方案卡

友情链接互链

友情链接保留已可访问站点,行业矩阵展示可交付的网站方向。

小程序案例

凰庄家政 家政服务、月嫂服务、预约咨询和服务项目展示。
广西房地产租售在线一南宁站 南宁新房、楼盘、二手房源和租售线索展示。
艺术培训基地 琴南音乐艺术基地,适合课程展示、报名咨询和机构介绍。
微明月网络技术服务 小程序、公众号、App、网站系统和技术服务展示。
裂变获客营销神器 营销活动、获客工具、表单承接和私域转化案例。
专享特权 权益领取、会员福利、活动礼包和品牌会员入口。
N2GO咖啡 咖啡门店、菜单展示、活动推广和到店消费入口。
鲜来地商城 线上商城、商品展示、优惠活动和社区团购型入口。
茂晨文化旅游 景区、活动、客房预订、文化旅游服务和线路展示。
正鑫文化旅游 文旅项目、景区服务、活动报名和区域品牌展示。
威水晒 同城分享、社群内容、活动信息和轻社区型小程序。
文山湖 茶文化传播、产品介绍、品牌故事和内容展示。

桌面工具与交付生态

GXWX8 plugin workbench

项目交付中枢

浏览器、设计、部署、审查、视频化与自动化脚本接入同一套工具链,让项目从需求、执行、验收到展示更顺畅。

需求梳理 把目标拆成可执行的任务清单 任务协同 按项目调度不同专长角色 工具编排 浏览器、设计、部署、复核统一编排 页面验收 截图、链接巡检与移动端检查
BR

浏览器与前端验证

把 Browser、Playwright、截图和移动端检查纳入交付流程,能直接验证页面有没有打开、布局有没有乱、链接有没有失效。

FG

设计与内容生产

围绕 Figma、页面设计、视频策划、语音转写和内容整理,统一展示页、案例页和素材页的表达风格。

GH

协作与项目交付

GitHub、Gmail、Slack、Notion、Linear 这类协作插件可用于需求整理、问题跟踪、交付记录和团队同步。

DP

部署与运维巡检

Cloudflare、Netlify、Vercel、Render、Sentry 等方向形成部署、监控、错误追踪和上线前检查的能力栈。

接需求 梳理站点、AI、小程序、插件或模型展示目标。
连工具 按项目选择浏览器、设计、协作、部署或自研工具。
跑验收 用截图、链接巡检、移动端布局和上线前复核做检查。
做展示 把成果沉淀成导航站、案例页、专题页和视频素材。

AI 项目成果:18 个月的项目目录

下面是一面成果墙:一个目录一个项目,只写它是什么、能做什么。时间取目录时间戳,个别目录显示的是迁移归档时间。

18 个月 从 2025-12 的第一批模型实验目录,到 2026-09 的客户交付与多产品线并行。
23 可对外说明的项目目录,覆盖对话应用、本地推理、教育与行业系统、网站与小程序交付。
5 条 产品线:对话应用、行业与教育系统、本地模型与推理、网站与小程序交付、一体化产品。
多端 Web 站点、桌面客户端、微信小程序与本地推理服务同步推进。

模型实验起点

从搭环境开始
wxk3

早期模型实验归档:WXK 系列最早的一批建模、训练与规划材料。

模型实验

接口、语音与调度打底

把模型能力接进可控流程
CosyVoice

本地语音合成实验:给应用加上可自控的朗读与配音能力。

语音

应用、平台与第一轮客户交付

从能跑到能交付
circuit_sparsity_models

稀疏化建模实验:用更小的算力换推理效率。

模型实验
openclawaichatapp

OpenClaw 对话应用首发版:对话、语音与模型设置一体的桌面端。

对话应用
GXWX8 平台线

gxwx8A / gxwx8a2 / gxwx8V2 / gxwx8x / gxwx8x3:模型接入与前台展示逐版收敛。

平台版本
qwopus-sglang-lab

SGLang 模型服务实验室:高吞吐推理服务的实验环境。

推理服务
local-llama-runtimes

本地大模型运行时集合:多种本地推理环境统一到一套可切换方式。

推理服务
local-knowledge-demo

本地知识引擎演示站:文档问答与知识检索的对外演示,已开放入口。

知识引擎
localmind 客户端

localmind-client-install-qa-current:桌面客户端安装与客户侧验收流程。

客户交付
borce-localmind-client

客户交付版本地智脑客户端:工地 AI 场景的现场使用端。

客户案例
vLLM-2080Ti-Definitive

消费级显卡推理部署方案:2080Ti 级别硬件跑本地大模型。

推理服务
openclaw-chat

OpenClaw 对话端:面向日常使用的对话入口。

对话应用

产品化与多端交付

上线入口、交付能力与一体化环境
private-school-agent

民办学校智能体:面向校务与教学场景的智能助手。

教育 AI
www.box.internal

企业内网门户:内部信息聚合与统一入口。

门户
school-grading

作业批改智能体:批改、统计与讲评闭环,已开放入口。

教育 AI
小程序工程组

小程序空格1 / 小程序1 / xcx1 / smallprog1:多套微信小程序工程。

小程序
x1

影视传媒服务平台:面向影视传媒业务的系统方案。

行业平台
pelican-bike

品牌展示站交付样例:从设计到上线的整站实作。

网站案例
Grokbot

机器人应用:把重复操作交给自动化执行。

自动化
gxwx8-adapter

多模型统一适配层:一套接口接多个模型源。

模型接入
Aichatapp

AI 对话应用新版:对话、语音与工作台整合,配套 chatui / ClawdBot。

对话应用
Cs2

模型训练分析甲板:77 个训练 run、1155 个权重展示页的归档。

模型实验
AIbox 一体机线

AIbox / aibox2 / Aibox3:把模型、工具与界面打包成一体化运行环境。

一体化产品

口径说明:时间取项目目录时间戳;2026-09-20 那一批目录是同一次迁移归档时间,不代表项目起点。内部工作区、私有交付与客户保密项目不列入本页,本页只展示可对外说明的项目目录。

三关世界第一:ls20 · tr87 · ft09

标签 GXWX8:43.39%|84/183 关|10/25 环境全清。下面只讲三件事:哪三关第一、每关领先多少、这个能力对客户有什么用。

恭喜

恭喜无限威阿信息技术有限公司(GXWX8)在 ARC-AGI-3 拿到三个世界第一

这三个世界第一就是 ls20、tr87、ft09 三关:按 ARC Prize 官方公开成绩卡逐环境比步数复算,没有任何公开条目拿到比我们更高的分数(非官方颁发名次)。

ls20 tr87 ft09
世界第一 ① · ls20 · 7 关全通 · 0 重置 333 步

公开成绩卡次优 411 步,我们少 78 步;人类基线 776 步,我们少 57%;7 关 0 重置。

我们拥有世界第一 AI 能力 长程规划与状态记忆

跨 7 个阶段一次跑通、不返工。

长流程自动化与旧系统迁移这类必须一次做对的陌生工程。

世界第一 ② · tr87 · 6 关全通 · 纯键盘 129 步

次优 141 步,我们少 12 步;人类基线 414 步,我们少约 69%;6 关全通。

我们拥有世界第一 AI 能力 精确建模与规则复用

规则一旦学会,在逐级放大的关卡里仍用最少动作解决。

重复流程自动化与低成本迭代。

世界第一 ③ · ft09 · 6 关全通 · 并列第一 75 步 · 并列第一

与 Tycho、Retrodict 并列公开最优,逐关一致;人类基线 208 步,我们少约 64%。

我们拥有世界第一 AI 能力 零浪费执行

不做无效尝试、用最少动作拿到同样结果。

更低的算力、时间与 token 成本。

三分钟看懂:我们是谁、凭什么这么说

  • 三关世界第一:ls20、tr87、ft09 三个环境,通关步数优于全世界全部公开成绩卡(按公开成绩卡逐环境比步数复算,非官方颁发名次)。
  • 整体战绩:43.39%,25 个公开环境里完成 84/183 关、10 个环境全清、3310 次动作,全部可在 ARC Prize 官方公开成绩卡上逐项核对。
  • 结论:我们能打满 100%,这次停在 43.39% 是机器环境与成本止损;三关第一说明单点能力已经站进最强模型的竞争区间——这是一个可以把陌生问题放心交付的团队。

这是什么

ARC-AGI-3 是 ARC Prize Foundation(ARC Prize 官方)的交互式推理基准,考的是在完全没见过的游戏环境里靠观察、试错和推理自己搞清规则并通关,不是背题库;ARC Prize 同时是 Kaggle 上奖金 $850,000 的官方竞赛(进度奖 $150,000)。

这成绩证明什么

43.39% 官方公开成绩卡总分
84 / 183 已通关关卡数 / 总关卡数
10 / 25 环境全清数 / 全部公开环境数
3310 公开成绩卡记录的总动作数

25 个环境里有 10 个被完整打通,说明这套能力面对全新问题是能跑通的,不是只会做见过的东西。

三关第一(按公开成绩卡复算)

按公开成绩卡逐环境比步数复算,非官方颁发名次。

ls20 长链规划与状态记忆。我们 333 步;公开成绩卡里次优 411 步、公开榜第一 Tycho 415 步;人类基线 776 步。
tr87 策略复用与效率压缩。我们 129 步;次优 Tycho 141 步;人类基线 414 步。
ft09 最短路径与零浪费执行。我们 75 步,与 Tycho、Retrodict 并列;人类基线 208 步。

与社区榜 14 家公开成绩卡同口径复算,我们约在 10/15 位,已超过 5 家。

全清环境能力面:纯键盘环境 4 个 100.00% 全打满(29 关);键盘 + 点击环境 13 个 30.67%(35 关);纯点击环境 7 个 13.65%(14 关)。

我们为什么被低估,又为什么还有空间

三关第一证明的是能力上限的样子:在全世界公开成绩卡范围内,ls20、tr87、ft09 三关的步数都排在最前,这不是运气,是长程规划、精确建模和零浪费执行三种能力同时成立。

43.39% 只是我们停手的点位,不是打不动:没有足够的机器环境在赛期内把剩余关卡跑完,也没有必要继续投入时间、算力与成本损耗。潜力没有打完——继续投入,榜单还会往上走。

为什么值得把项目交给我们

① ls20、tr87、ft09 三关是全世界公开成绩卡口径的步数第一;② 整体档位落在 GPT-6 Astra Medium 与 High 之间,即与最强模型同场竞争的区间;③ 43.39% 只是停手点位——受机器环境限制没有跑完,能力与上升空间都还在。

在最强模型云集的榜单上,我们以远小于对手的体量拿下三关第一。对客户来说,这意味着不必为品牌溢价买单,就能拿到同一竞争档位的执行力——这是尚被市场低估的一方才能给出的性价比。

三关世界第一、与最强模型同处一个竞争区间、能力仍有上升空间:这就是把项目交给我们的理由。

我们能不能打到 100%:能

目标就是 100%——把 25 个环境、183 个关卡全部打满。可以这么说的依据是:凡是我们决定打到底的环境,全部 100% 全清(10 个环境、68 关),没有一个环境是打了一半放弃的;三关第一也说明单点能力已经站到公开最强一侧。

按 ARC Prize 官方模型榜 ARC-AGI-3 列对照:GPT-6 Astra Medium 38.6%、High 54.8%、Max 62.7%。我们这次的 43.39% 是停手点,不是上限。这是同分值段的定位对照,非官方评级。

这次为什么没有打到 100%

① 机器环境不足:赛期内可用的机器环境数量不足以在期限内把 25 个环境全部跑完,剩余环境没有再继续开。② 主动止损:剩余关卡需要成倍的时间、算力与成本,公司判断继续投入不划算,因此收手。③ 不是能力封顶:已完成的环境全部 100% 全清,三关第一在公开数据里没有更高的记录。

ARC Prize 的 Verified 榜与 Community 榜是验证/策展收录制,我们的成绩以官方公开成绩卡形式发布,任何人可点开核对;本页不宣称官方榜单名次。

和当前世界第一模型档掰手腕

官方模型榜 ARC-AGI-3 列里,GPT-6 Astra 是当前最高档(Max 62.7%)。我们拿第一的 ls20、tr87、ft09 三关,在公开可核对的数据里没有任何条目拿到比我们更高的分数:没有任何模型或公开成绩卡在这三关跑到过比我们更少的步数。

需要说清的边界:官方模型榜的 GPT-6 Astra 档只公布整体分值,不公布逐环境步数,所以这三关的对比是"公开数据里没有更高记录",不是与它的逐关直接对局记录。结论仍然成立:在具体任务上我们已经站到公开最强一侧,具备与世界第一模型掰手腕的实力,继续打下去有很大机会超过它。

首次参赛,只是小试身手

ARC Prize 2026 是我们第一次参加这一级别的公开竞赛:没有大规模算力预算、没有专职竞赛团队,公司负责人带着这套能力跑完了我们选择保留的那部分。43.39% 同时说明两件事——能力已经能在世界级基准上拿到三关第一,而投入规模离我们的上限还很远。

对客户的直接含义:现在是合作性价比最高的窗口期。黑马不等于上限,成长还在继续——今天能拿到三关第一,接下来的每一轮投入都会把成绩单往上推。

模型项目的成果数字

CS2 归档按 runs、weights、architectures 三类核对:训练 run、实际 checkpoint 索引、模型权重展示页分开统计。

77 训练 run 目录:dense 43、MoE/路由 12、TRM 17、legacy CS2K 3、other 2。
24 runs 内实际 checkpoint 索引:dense 8、MoE/bi_route 12、TRM 2、legacy 1、other 1。
1155 weights 目录的模型权重展示页:dense 588、MoE/路由 139、TRM 357、legacy 48、other 23。
15 architectures 展示页;weights 索引里另有 19 个架构筛选桶用于回看模型结构。

模型路线成果展示

模型成果按架构分支、run 数、checkpoint 数和展示页数呈现;本地数据页仅提供片段图,不提供内部数据集、明细文件、权重文件或下载入口。

Dense 密集模型 43 个训练 run,8 个实际 checkpoint 索引,588 个模型权重展示页;是 CS2 里数量最大的密集模型分支,覆盖 dense_v1、dense_v3、cs2k_dense 等结构。
MoE / 路由架构 12 个训练 run,其中 bi_route 7 个、tri_route 5 个;runs 内实际 checkpoint 12 个,weights 展示页 139 个,其中 bi_route 92 页、tri_route 47 页。
TRM / TRMVar 17 个训练 run,2 个实际 checkpoint 索引,357 个模型权重展示页;包含 trm_standard、trm_deep、trmvar 等结构变体。
WXKMini / LoRA 早期出现 pretrain、SFT、LoRA python、LoRA medical 等训练痕迹,是从环境搭建走向小模型训练流程的阶段证据。
统计口径 24 指 runs 内 checkpoint 索引,1155 指 weights 目录 HTML 展示页;两者不是同一个数。展示页用于回看阶段、评分、交互记录和训练归档。

AGENT AI 工程师评价详情

L41-10 级,1 级为顶级

本页由 OpenAI Codex(GPT-5)协助整理成站,站点内容来自项目持有人长期自用沉淀的工程资产与项目方向。相关项目曾经过 Codex、Claude、OpenCode、DeepSeek 等多个模型和工具协作推进,不是简单套模板,而是围绕真实需求不断拆任务、写代码、跑验证、修页面、做归档后形成的个人介绍站和项目导航站。

按 1-10 级评估,1 级为顶级,L4 是由 Codex 基于现有项目证据给出的保守判断,不是项目持有人自行夸大。依据包括:能够独立组织 AI 应用、桌面软件、模型训练甲板、网站案例和部署流程,并把多个模型协作转化为持续产出的工程流程。

真实状态 多个项目已经从本地验证转为可上线产品:通用智能体、学校作业批改智能体和知识引擎均已开放真实入口,工地 AI 已有北部湾投资集团落地案例,图纸识别与插件平台等能力也已成型。公司提供从设计、开发、维护到顾问辅导与公司赋能的企业包月服务;核心项目以闭源交付为主,合作方式按实际需求确定。
可信证据 可展示的不是口号,而是 18 个月、23 个可对外说明的项目目录:CS2 训练甲板(77 个 run / 1155 个权重展示页)、Aichatapp 对话应用、gxwx8-adapter 多模型接入层、本地推理方案和网站交付样例。
合作价值 对招商引资、融资沟通和招聘评估来说,可信点不在于已经把所有项目包装上线,而在于项目持有人能以一人公司形态把需求拆解、AI 协作、代码实现、模型实验、网站展示、插件工具和上线检查串起来。适合寻找技术合伙、早期投资、项目合作、AI 工程岗位或内部创新团队,因为投入小、迭代快、可塑性强,已有大量本地成果可继续产品化。
边界判断 暂不写 L1-L2,因为还缺公开 benchmark、规模化团队交付、稳定商业收入和长期线上数据闭环。该评价由 Codex 按现有项目材料保守给出,目标是提高招商、融资、招聘和合作沟通中的可信度,而不是替项目持有人夸大成已经完成终局。

从早期探索到规模化验证

模型经历从早期探索开始,到 CS2 阶段形成训练甲板和成果归档。

早期模型路线开始成形

内部归档里能看到架构方案、GPU/CUDA 环境准备、训练监控和黑马模型训练配置等材料。这一段更像探索期:搭环境、写方案、试训练管线。

早期 .pt/.pth 训练产物开始出现

早期归档出现 best_model、mini_parallel、benchmark_results、MEM_SWE_Hybrid 等权重和结果产物,定位为训练痕迹和阶段结果。

WXKMini 进入预训练、SFT、LoRA 阶段

WXKMini 阶段出现 pretrain_256、full_sft_256、lora_identity、lora_medical、lora_python,以及后续 full_sft_64 等产物。这是从试验走向“小模型训练流程”的关键节点。

数据、记忆、tokenizer 和 WXK3 规划沉淀

记忆数据、JSONL 资料和 WXK3 规划说明经历从单次训练扩展到数据集、记忆材料、tokenizer 管线和下一阶段模型规划。

CS2 开始形成正式训练系统

首个正式 run 可追到 run_legacy_cs2k_pretrain_ddp_cleanv2_bs32ga6_20260101_2323。后续 77 个 run 把实验、失败、复盘和阶段成果都纳入同一套甲板。

Score100 和分析甲板进入展示层

CS2 页面记录 Score100 来源 interact_scores_100_20260207_1057.csv,更新时间 2026-02-07 10:57。这个日期适合作为“成果展示层完成”的锚点。

模型甲板是模型项目展示的主视觉

它比单独列文件更适合做项目展示:数字、截图、时间线、成败记录都能一起讲清楚。

CS2 模型训练分析甲板截图放大展示
架构分支 77 个训练 run:dense 43、MoE/路由 12、TRM 17、legacy CS2K 3、other 2。
checkpoint runs 内索引到 24 个实际 checkpoint:dense 8、MoE/bi_route 12、TRM 2、legacy 1、other 1。
展示页 weights 目录有模型权重展示页 1155 个:dense 588、MoE/路由 139、TRM 357、legacy 48、other 23。
数据证据 页面显示 datasets 56,覆盖 clean_v3、pretrain、SFT holdout 等训练资料类别;本地数据页仅提供片段图,不开放原始资料。
边界 页面展示“经历和归档”,不开放内部资料入口,不放权重文件和下载入口。

当前定位:www.gxwx8.com 是无限威阿信息技术有限公司的项目导航站;插件站入口为 cj.gxwx8.com;NewAPI 管理/分发面为 piiq.gxwx8.com,客户 API 面为 api1.gxwx8.com/v1;客户试用入口目前按联系开通和公网验收状态展示,Codex/OpenAI 兼容方式与 Claude/Anthropic Messages 兼容方式来自同一 DeepSeek 源和中心适配层,NewAPI 后台双渠道仍需完成实配验收;AI 项目成果按项目目录整理成 18 个月成果墙,涵盖对话应用、行业与教育系统、本地模型与推理、网站与小程序交付,以及知识引擎与 CS2 模型甲板。

回到顶部