跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

HarnessSecurity-Bench 实测六款编码智能体:开启自动批准使攻击成功率从 29.2% 升至 95.6%

该研究构建了覆盖 40 个编码智能体 harness 的十类安全机制分类体系并评估 400 个 harness–机制单元(205 个确认实现、83 个确认缺失、112 个未决),随后提出 HarnessSecurity-Bench,用 23 个任务、五个攻击面和独立确定性判据在 GLM-5.2 下对六款 harness 运行 2,500 次试验,发现开启自动批准使攻击成功率从 29.2% 升至 95.6%,网络隔离与只读模式分别把攻击成功率从 57.1% 和 8.3% 降至 0.8% 但带来 24.5 和 34.0 个百分点的效用损失,而命令白名单与黑名单分别以小幅效用损失和效用提升降低攻击效果。