跳到主要内容
返回时间线
arXiv来源发表:

MARS在1195个PE/ELF样本上比较直接分类与声明评分:直接分类在全部六个模型上准确率更高,但保留声明支持策略重放

核心概要

MARS是一个面向PE与ELF二进制的恶意软件分诊框架,在共享证据收集器与相同静态证据包条件下,比较LLM直接分类与“结构化行为声明+固定评分策略”两条路径;在1195个样本、1001个近重复簇和六个模型上,直接分类在全部六个模型上总体准确率更高,配对准确率优势为3.7至20.9个百分点,而声明路径保留了评分输入,可在不重新调用模型的情况下重放与改策。

Source-provided article image: MARS: Malware Analysis with Rule-Based Scoring of LLM Claims
Figure 1 ·

Figure 1: MARS evaluation architecture. The full-corpus comparison uses a shared static evidence bundle for rules-only classification, direct LLM classification, and single-pass claim scoring. The two LLM paths are evaluated across six models. Additional evidence and support assessment are examined in subset studies.

arXiv

深度剖析

在证据收集器、证据包与模型均匹配的条件下,直接分类在全部六个模型上总体准确率更高,并在十二个平台与模型组合中的十个取得更高的恶意告警召回率。 以往对恶意软件分析系统的比较常受证据收集器、模型与输入差异干扰,难以把差异归因于决策架构;本文通过固定证据包与模型,把比较对象限定为完整决策路径(含提示与输出模式)。 1195个二进制、1001个近重复簇、六个模型;配对准确率优势3.7至20.9个百分点,六个簇自助法95%置信区间均高于零;在保留错误于分母时排序不变;在架构分层、元数据困难子集与用评测标签选阈值的诊断分析中排序持续。

声明中介并未带来跨模型性能波动的一致性下降,重复执行显示固定评分策略不能保证端到端稳定。 该结果把“存储策略计算的确定性”与“完整流水线的稳定性”区分开来:固定评分函数只对固定声明集可复现,而声明生成与严重度赋值会随调用变化。 十次重复执行中精确判定一致率为36.7%至93.1%,直接分类在每个平台与模型组合上告警一致率最高;18个模型、平台与路径组合中有17个对恶意样本的精确一致率更低;PE上变化样本更接近良性阈值(如0.28对3.40)。

保留的声明使判定计算可检查、可改策:从存档记录重算策略可精确复现全部9456条记录标签,包括两个被提供方撤回模型的2366条。 直接标签只能原样取回,而声明路径额外支持在不同评分策略下用同一批保留输入重算判定,无需再次调用模型。 9456条记录全部复现;将评测策略应用于同一批记录时与部署默认策略在4682条(49.5%)上一致,该分歧反映策略变更而非重放失败。

在预定义证据扰动下,移除指标字段使声明路径的恶意告警召回下降29.2个百分点,大于直接分类的10.0个百分点;家族识别探针中声明优于判定标签但低于证据文本。 该扰动研究把决策架构对证据改动的敏感性差异量化出来,并说明结构化接口保留的是策略输入而非更强的家族判别信息。 扰动子集182个文件、728个证据包、4368次调用、三个模型;S1下规则基线下降34.1个百分点、单次声明29.2、直接分类10.0,且声明路径的更大损失出现在全部四个架构分层;家族探针中证据文本点准确率61.1%(PE)与83.1%(ELF),高于所有声明表示。

启示与展望

该工作面向需要样本级良性/恶意判定的恶意软件分诊场景,适用于PE与ELF二进制、基础静态证据(可选反编译器与运行时证据)、十一个声明类别与加性评分策略。对需要显式、可修订规则并保留模型输出的运行环境,声明路径提供策略检查与改策能力:类别权重与阈值可独立于声明生成调整,存档记录可在模型不可用后重放与重算。家族识别探针与动态证据随访属于辅助分析,分别针对特定分类器与20个选定样本。

语料非家族或时间平衡,类别比例不代表部署流行度,家族标注未经独立核验,困难良性类别(如潜在不受欢迎程序与管理工具)覆盖不完整;浅层元数据基线较强且身份线索未遮蔽,绝对判定准确率难以完全归因于行为解释。匹配证据与模型并未隔离表示格式与提示、输出模式、输出预算、解析及阈值校准等路径差异,且仅声明路径使用开发集校准阈值。收集器缺陷导致11个恶意样本在两条LLM路径上均失败,其证据包最大达25.2 MB。扰动研究仅针对存储证据包的四种固定修改,未证明这些修改可由二进制改动实现,也未刻画自适应操纵。提供方撤回使两个模型无法重新提取声明,浮动模型标签限制精确复现。声明未经专家验证其语义准确性,也未测量对分析员决策的影响。

来源