arXiv 2026年10月5日该工作提出 Law&Order 神经符号框架,通过结构对应与指称对应两种法律—逻辑对应关系,结合大语言模型合成、单元格级验证与基于人工编写的 OpenTaxSolver 申报表的迭代局部错误修复,将税法表格与填报说明自动形式化为可执行符号程序,并在从未参与生成或修复的独立留出 TaxCalcBench 申报表上评估:最强 LLM 仅达 66% 准确率,而 Law&Order 在 51 份留出申报表上达到 100% 单元格级与表格级准确率。该工作提出 Law&Order 神经符号框架,通过结构对应与指称对应两种法律—逻辑对应关系,结合大语言模型合成、单元格级验证与基于人工编写的 OpenTaxSolver 申报表的迭代局部错误修复,将税法表格与填报说明自动形式化为可执行符号程序,并在从未参与生成或修复的独立留出 TaxCalcBench 申报表上评估:最强 LLM 仅达 66% 准确率,而 Law&Order 在 51 份留出申报表上达到 100% 单元格级与表格级准确率。Law&Order 用神经符号框架将税法表格与填报说明自动形式化为可执行程序,在 51 份留出申报表上达到 100% 单元格级与表格级准确率该工作提出 Law&Order 神经符号框架,通过结构对应与指称对应两种法律—逻辑对应关系,结合大语言模型合成、单元格级验证与基于人工编写的 OpenTaxSolver 申报表的迭代局部错误修复,将税法表格与填报说明自动形式化为可执行符号程序,并在从未参与生成或修复的独立留出 TaxCalcBench 申报表上评估:最强 LLM 仅达 66% 准确率,而 Law&Order 在 51 份留出申报表上达到 100% 单元格级与表格级准确率。该工作提出 Law&Order 神经符号框架,通过结构对应与指称对应两种法律—逻辑对应关系,结合大语言模型合成、单元格级验证与基于人工编写的 OpenTaxSolver 申报表的迭代局部错误修复,将税法表格与填报说明自动形式化为可执行符号程序,并在从未参与生成或修复的独立留出 TaxCalcBench 申报表上评估:最强 LLM 仅达 66% 准确率,而 Law&Order 在 51 份留出申报表上达到 100% 单元格级与表格级准确率。