跳到主要内容
返回时间线
arXiv来源发表:

四项研究显示语义几何未能建立AI行动前判断:词法路由器找回全部治理与阻断策略,组合管线仍将2,304个动作全部升级复核

核心概要

该工作把拟议动作与治理策略表示为向量,用余弦相似度、原始欧氏距离和有符号原始点积四项研究检验其能否在行动前判断动作与策略的关系;最终合成研究中,词法路由器以中位策略检查量下降97.7%找回全部治理与阻断策略,但组合管线仍将全部2,304个测试动作升级复核,向同一关系读取器提供全部策略也未改变任何决定,作者据此提出判断需要构建后果图。

Source-provided article image: Can Semantic Geometry Teach an AI Judgement?
Figure 1 ·

Figure 1. From a proposed action to a governed decision.

arXiv

深度剖析

在最终合成研究中,被选中的词法重叠路由器在封存表面上找回了2,880/2,880个治理策略实例和984/984个阻断策略实例,无阻断遗漏,每动作返回中位1.5条策略,中位策略评估量下降0.976562500000。 此前研究把检索与关系解释混在一起,无法判断失败发生在哪一阶段;第四项研究把路由、关系分类和端到端组合分开冻结测试,使检索成功可被单独观测。 该结果来自作者构建的合成策略世界,路由词项被暴露给管线,词法规则作用于固定预处理的人工语言;作者明确指出这不能推广为自然语言策略检索的一般结论。

关系实验中,完整三测量模型的关系宏F1为0.355163305089(编码器一)和0.485257556129(编码器二),两个编码器中仅欧氏距离的单测量表现最好;加入余弦与有符号点积相对最佳单测量的平均增益为0.002145935796和0.005580263897,低于预设的0.03有用效应下限,家族聚类自助区间均跨零,Holm校正后置换p值均为1.000000000000。 第二项研究曾保留邻近性与方向性的有限信号,第三项研究试图把它们组合成决策;第四项研究用配对家族差异而非语料级宏F1相减来检验增量效用,直接回答额外测量是否值得。 比较在十二个封存任务家族内配对进行,以家族为独立推断单位;但仅测试两个固定编码器、一个冻结模型类别、一个0.70阈值和一个合成世界。

组合管线对每个编码器的全部2,304个封存动作都输出ESCALATE,最终处置准确率为840/2,304即0.364583333333;穷举语义比较器把全部策略送入同一关系模型与聚合规则后,升级了同样的2,304个动作,准确率与升级率完全相同,平均准确率差为零,自助区间为[0.000000000000, 0.000000000000]。 第三项研究显示组合管线失败但无法定位原因;第四项研究通过穷举比较器排除了检索不足这一解释,把失败定位在检索下游的关系到处置阶段。 零假ACT源于零ACT预测,而非安全性得到证明;作者报告两个无重试副本完成、干净根重建一致、输出版本普查对账、候选字节冻结且独立验证通过。

作者据此修正假设,提出AI智能体的判断需要构建后果图,把行动者与权限同策略条件、例外以及动作将产生的变化连接起来,并规划后续研究在固定检索条件下比较后果图表示与直接语言关系读取器及结构化策略工作流。 原假设认为几何测量可提供判断基础;四项研究未确立该能力后,作者把问题重新表述为关系显式化,并明确后果图尚未被测试。 这是基于失败结果提出的后续假设与比较设计,四项研究均未测试该结构,也未确立其必要性或充分性。

启示与展望

该工作面向需要让智能体在多重策略下行动的研究者与工程团队,适用场景是策略与动作以自然语言给出、且需要区分ACT、HOLD与ESCALATE的治理化自主性设定。其可复用的产出是阶段分离的评测结构:路由、关系解释与最终处置各自回答,检索固定后再比较关系表示。词法路由的高召回与97.7%检查量下降属于作者构建的合成策略世界,其中路由词项被暴露且预处理固定。作者规划的后续研究将在固定检索条件下,把后果图表示与直接语言关系读取器、结构化策略工作流进行比较,并预先定义关系真值、比较规则与有意义的误差阈值。

读者仍需关注:合成语料的人工路由词项与受控语言可能使定位偏易,而关系解释可能以不迁移的方式显得人工化;动作与策略以整文本向量进入关系阶段,研究未确定这些表示是否丢弃了关键区分,也未确定更强的读取器能否恢复;第四项研究只测试一个确定性多项逻辑关系读取器、两个固定编码器、0.70阈值和一条固定聚合规则,更换任一表面都构成新的科学问题而非对冻结结果的修复;最终权限归属(机器直接处置、向确定性机制提交结构化证据、弃权或保留人工决定)未被选择;作者说明科学伴随材料未包含部分第一项研究对照的行预测、第四项研究原始关系重算所需的精确金标与排序连接、完整路由预算与串行比较所需的原始特征输入,模型资产未打包,完整实验复现未被声称。

来源