对局进行中,确定开新局?当前棋局将被清空。
ACE Any-position Certified Evaluator — 本项目的核心。对任意局面给出三值之一:认证胜 / 认证不败 / 诚实未知,每个非未知判定附机器可复验证书。设计不变式:证书永不出假(soundness),认证覆盖随算力单调只增不减,渐近极限为全盘强解。宣判量为认证区间 [LB, UB]:UB 为已证胜距上界(证明档 / am_worst),LB 为 XDIS 全宽反证书或阶梯 disproof(k 手内无五 ⇒ LB ≥ k+1)。落子后区间 [n,m] 若 n=m 报「恰好 n 手必杀」,否则报「m 手内必杀」(下界不进措辞);无可靠上界时不报数字——区别于"搜不到即宣布安全"的传统引擎。
证明后端 C 版 fastsolver:VCF/VCT df-pn 证明器 + relevance-zone / 叶-TT 剪枝 + NN-priors OR 排序 + VCT 迭代加深(先证浅树再加深,同一节点预算下证明力只增不减;实测基准 461 例上多证 57 例、零丢证、节点降到 0.694×);XDIS 全宽有界反证器供下界。证书沿证明线下降继承并入仓库缓存,深杀宣判 O(1) 命中;深证明走切片子进程(杀语境重证 6s 兜底),生产进程 80ms 墙定格。
v2.6 证明器换了搜索次序,棋力口径不变:对局网络与输入通道原封未动(iter-10-P3 + P31 认证杀点通道),换的只是机器证明后端的一件事——VCT 迭代加深:先证浅树再逐级加深,而不是一口气挖到底。旧写法有个反直觉的毛病:预算给得越多,反而可能证得越少(深度预算变大时搜索会一头扎进错误的深枝,把节点烧光)。改成迭代加深后,同一节点预算下的证明力只增不减。实测(461 例带外部神谕背书的历史难局,与服务器侧同一基准同一参数):已证局面 272 → 329(多证 57 例,零丢证),节点降到 0.694×;网站自然对局分布上 VCT 墙钟 0.60×、认证阶梯在同样 2 秒预算内认证的局面数 81 → 94(+16%)。对你看得见的部分:青环(已认证必杀点)会更早出现、出现得更多,「N 手内必杀」的数字总体更紧(青环口径实测:变紧 8 手、变松 0 手;最大数字从 12 降到 9;「恰好」口吻覆盖率 0.50 → 0.5385,原先两个「青环无口吻」的现场也被顺手补上了)。所有新证的证线都经过独立复走(合法落子 + 终局成五),零伪造;送杀防守检查(深卫兵)那条路径完全未改动(guard_v3 口径 349→349 实测零改变):安静局 114 探测配对上走子与口吻 0 手不同;青环语料 114 手配对上有 5 手改着,全部仍是青环,其中 3 手是因为找到了更短的杀。计量口径:网络 iter-10-P3 / 特征 P31 / 证书栈 v3.0 的在线适用件(VCT 迭代加深)。延迟:安静局中位与 v2.5 持平(visits=32 安静局 p50 4787→4815 ms);已经能出青环的局面反而更快(直觉档 18 个 vct 探测总耗时 −10.6%);代价落在证不出的局面上——尾部 p95 5350→5999 ms(全部位移来自同一手)。
v2.5 结构手术的胜利:棋力模型升到 iter-10,给网络加装两条「认证杀点」输入通道(己方/对方的机器证明杀点,由证明后端逐手实时签发)——网络第一次能直接看见证书。等算力裸对局(无 ACE 口径)32 访问对教师 0.565→0.596,128 访问 0.492→0.508,项目首次在 128 访问档过半;12,704 已证局面上的价值反向误判 13.1%→11.1%;纯直觉档同口径持平(0.635,python 裸策略口径)。同版起版本注记一律标注计量口径。
v2.4 双胞胎实验的冠军:iter-8 同期训练了两个配方(全量混合 vs 纯新鲜语料),纯新鲜配方在全部实战计量上胜出并换装上线——同算力 32 访问对教师 0.542→0.565,128 访问 0.438→0.492(距教师平手仅 0.008),纯直觉 0.60→0.66(TRT 快线口径,与本条前两项的 python 裸门口径不同尺);深搜相对浅搜的衰减也是历代最平。质检口径同步更新:直觉档延迟预算按深杀复核(v2.2)时代重定为 6 秒。
v2.3 学生超过了老师:棋力模型升到 iter-8,在同等算力(32 访问)对局中对教师胜率 0.297→0.542,**项目首次在等算力下战胜教师**;128 访问档 0.206→0.438;在 12,704 个已被证明胜负的局面上,价值反向误判 24.0%→9.0%。开局第一手固定为天元(新训练语料的开局平衡特性会把首手偏好摊平,属分布伪影,外科修正,后续版本用数据治本)。
v2.2 深处的杀着不再放行:此前在线杀检被 80 毫秒断路器封顶,十几步开外的深杀看不见,AI(以及提示一选)偶尔会走出被证明必败的一步(曾致跟提示下棋 23 手落败)。现在每步终选着法都会再做一次 2.5 秒的加深复核,查出送杀且有活路就换着 —— AI 落子、提示一选、朱砂环同时受益(代价:中盘安静着法回应慢约 2.5 秒;更深的杀仍由离线质检兜底)。棋力模型升到 iter-7:同预算 32 访问对教师胜率 0.216→0.297,纯直觉+ACE 首次整场压过教师直觉(0.526);在 12,704 个带证书的历史局面上,价值反向误判 49.0%→24.0%。另:对局进行中点「新对局」会先确认,防误触。
v2.1 更少的判断失误:求解器两项等价改写上线(Core_k 全称限制 + 顶点支配),k=5 认证率 29.5%→50.9%、深档延迟 p90 240.6ms→80.6ms,新增的 126 条证书全部经全宽裸基线独立复核;棋力模型升到 iter-6 —— 价值判断的两类反向错误双向下降(误判自己输:2.08%→1.63%;误判自己赢:1.08%→0.94%;在 27 万个带证书的未见局面上测得),失衡局面的处理两次独立测量同向改善。
图例 提示开启时:墨色环 = 候选,越大越看好,中心点 = 首选;青环 = 你的必杀点(已认证);朱砂环 = 必挡点。危为朱,胜为青。
v2.0 证明树时代:宣判时导出防守完备证明树入仓库(落盘持久化,重启不失忆);对手树内任意偏离 O(路径) 继承,倒计时不断线;超帽鲸树由杀语境重证兜底(6s 墙)。附带:深上界臂(两段式带证数字)、宣判出口强制下界臂、ACE 请求级开关、ponder 移除(同局面同宣判,确定性可复现)。
KGT 对弈方:KataGomo 教师蒸馏的 transformer 策略/价值网,zero-r1 MCTS(直觉档 policy-only,搜索档 v8–v128)。ACE 与之解耦,亦为其训练供认证标签。