arXiv 2026年10月5日该工作把反例生成建模为针对逐定理确定性 Python 验证器的受限见证输出,发布含 4,707 条假猜想及其可执行验证器的 SymCE 语料,并以验证器作为奖励训练 Qwen3-4B:仅反例的 SFT 使真定理识别从 0.27 崩至 0.00,而稀疏结果奖励的 RLVR 修复并超过基座至 0.66,该崩溃在四个随机种子与 Gemma-3-4B 上复现。该工作把反例生成建模为针对逐定理确定性 Python 验证器的受限见证输出,发布含 4,707 条假猜想及其可执行验证器的 SymCE 语料,并以验证器作为奖励训练 Qwen3-4B:仅反例的 SFT 使真定理识别从 0.27 崩至 0.00,而稀疏结果奖励的 RLVR 修复并超过基座至 0.66,该崩溃在四个随机种子与 Gemma-3-4B 上复现。SymCE 用逐定理符号验证器生成反例:仅模仿的 SFT 使真定理识别从 0.27 崩到 0.00,稀疏奖励强化学习修复并升至 0.66该工作把反例生成建模为针对逐定理确定性 Python 验证器的受限见证输出,发布含 4,707 条假猜想及其可执行验证器的 SymCE 语料,并以验证器作为奖励训练 Qwen3-4B:仅反例的 SFT 使真定理识别从 0.27 崩至 0.00,而稀疏结果奖励的 RLVR 修复并超过基座至 0.66,该崩溃在四个随机种子与 Gemma-3-4B 上复现。该工作把反例生成建模为针对逐定理确定性 Python 验证器的受限见证输出,发布含 4,707 条假猜想及其可执行验证器的 SymCE 语料,并以验证器作为奖励训练 Qwen3-4B:仅反例的 SFT 使真定理识别从 0.27 崩至 0.00,而稀疏结果奖励的 RLVR 修复并超过基座至 0.66,该崩溃在四个随机种子与 Gemma-3-4B 上复现。