K G T · A C E
pfxl_iter5_20260720 · ace-v1.2
黑先。落子即开始。
KGT 自评 · 整局曲线

摆盘

复制当前局面取消摆盘

对局进行中,确定开新局?当前棋局将被清空。

取消新局

K G T · A C E

ACE Any-position Certified Evaluator — 本项目的核心。对任意局面给出三值之一:认证胜 / 认证不败 / 诚实未知,每个非未知判定附机器可复验证书。设计不变式:证书永不出假(soundness),认证覆盖随算力单调只增不减,渐近极限为全盘强解。宣判量为认证区间 [LB, UB]:UB 为已证胜距上界(证明档 / am_worst),LB 为 XDIS 全宽反证书或阶梯 disproof(k 手内无五 ⇒ LB ≥ k+1)。落子后区间 [n,m] 若 n=m 报「恰好 n 手必杀」,否则报「m 手内必杀」(下界不进措辞);无可靠上界时不报数字——区别于"搜不到即宣布安全"的传统引擎。

证明后端 C 版 fastsolver:VCF/VCT df-pn 证明器 + relevance-zone / 叶-TT 剪枝 + NN-priors OR 排序;XDIS 全宽有界反证器供下界。证书沿证明线下降继承并入仓库缓存,深杀宣判 O(1) 命中;深证明走切片子进程(杀语境重证 6s 兜底),生产进程 80ms 墙定格。

v2.4 双胞胎实验的冠军:iter-8 同期训练了两个配方(全量混合 vs 纯新鲜语料),纯新鲜配方在全部实战计量上胜出并换装上线——同算力 32 访问对教师 0.542→0.565,128 访问 0.438→0.492(距教师平手仅 0.008),纯直觉 0.60→0.66;深搜相对浅搜的衰减也是历代最平。质检口径同步更新:直觉档延迟预算按深杀复核(v2.2)时代重定为 6 秒。

v2.3 学生超过了老师:棋力模型升到 iter-8,在同等算力(32 访问)对局中对教师胜率 0.297→0.542,**项目首次在等算力下战胜教师**;128 访问档 0.206→0.438;在 12,704 个已被证明胜负的局面上,价值反向误判 24.0%→9.0%。开局第一手固定为天元(新训练语料的开局平衡特性会把首手偏好摊平,属分布伪影,外科修正,后续版本用数据治本)。

v2.2 深处的杀着不再放行:此前在线杀检被 80 毫秒断路器封顶,十几步开外的深杀看不见,AI(以及提示一选)偶尔会走出被证明必败的一步(曾致跟提示下棋 23 手落败)。现在每步终选着法都会再做一次 2.5 秒的加深复核,查出送杀且有活路就换着 —— AI 落子、提示一选、朱砂环同时受益(代价:中盘安静着法回应慢约 2.5 秒;更深的杀仍由离线质检兜底)。棋力模型升到 iter-7:同预算 32 访问对教师胜率 0.216→0.297,纯直觉+ACE 首次整场压过教师直觉(0.526);在 12,704 个带证书的历史局面上,价值反向误判 49.0%→24.0%。另:对局进行中点「新对局」会先确认,防误触。

v2.1 更少的判断失误:求解器两项等价改写上线(Core_k 全称限制 + 顶点支配),k=5 认证率 29.5%→50.9%、深档延迟 p90 240.6ms→80.6ms,新增的 126 条证书全部经全宽裸基线独立复核;棋力模型升到 iter-6 —— 价值判断的两类反向错误双向下降(误判自己输:2.08%→1.63%;误判自己赢:1.08%→0.94%;在 27 万个带证书的未见局面上测得),失衡局面的处理两次独立测量同向改善。

图例 提示开启时:墨色环 = 候选,越大越看好,中心点 = 首选;青环 = 你的必杀点(已认证);朱砂环 = 必挡点。危为朱,胜为青。

v2.0 证明树时代:宣判时导出防守完备证明树入仓库(落盘持久化,重启不失忆);对手树内任意偏离 O(路径) 继承,倒计时不断线;超帽鲸树由杀语境重证兜底(6s 墙)。附带:深上界臂(两段式带证数字)、宣判出口强制下界臂、ACE 请求级开关、ponder 移除(同局面同宣判,确定性可复现)。

KGT 对弈方:KataGomo 教师蒸馏的 transformer 策略/价值网,zero-r1 MCTS(直觉档 policy-only,搜索档 v8–v128)。ACE 与之解耦,亦为其训练供认证标签。