跳到主要内容
返回时间线
arXiv来源发表:

LiveMACEBench 用 30 天实盘市场评测五个前沿 LLM 智能体,发现收益排名与能力指标严重脱节

核心概要

该工作提出 LiveMACEBench,一个以实时加密货币与美股市场为自然演化环境的流程感知基准,让五个前沿 LLM 在匹配的 Base、工具使用、持久记忆、规则遵循与多智能体协作配置下进行约 30 天连续纸面交易,并同时用任务结果与决策轨迹诊断能力;结果显示收益排名随时间大幅波动且常与能力指标背离,相似收益可来自截然不同的机制使用模式。

Source-provided article image: LiveMACE: Process-Aware Evaluation of LLM Agent Capabilities in Evolving Markets
Figure 1 ·

Figure 1 : LiveMACEBench overview. Agents interact with a shared, continuously evolving live-market environment along persistent trajectories. Evaluation combines realized outcomes with mechanism-specific process diagnostics to distinguish task performance from how effectively agents use each mechanism.

arXiv

深度剖析

提出流程感知的智能体评测框架,把「机制可及性、机制有效使用、实际任务收益」三者分开度量,用任务结果、受控机制效应与轨迹诊断三类信号共同刻画能力。 以往智能体基准多以最终任务成败或收益排名为主,该工作把评测对象从结果转向产生结果的机制,并在同一 ReAct 骨架上构造匹配配置,使能力差异可被定位而非从聚合表现反推。 设计层面给出五类受控配置与完整决策轨迹记录;实证层面在约 30 天实盘窗口内对五个前沿 LLM 采集轨迹,并报告收益排名反转次数与能力排名反转次数的对比(工具使用 21 对 0、记忆 19 对 5、规则遵循 19 对 8、协作 29 对 2)。

在工具使用维度上,信息覆盖与调用效率、工具发现与工具执行是可分离的失败模式:四个模型的信息覆盖均高于 0.8,但调用效率一致最低;Qwen3-Max 路由质量最低却有效调用率接近满分,Grok-4.20 路由质量较高但有效调用率仅 0.666。 把工具使用拆成发现、调用与证据使用三个环节,并同时使用 LLM 评判与客观轨迹指标,使「找到工具」与「用好工具」不再被混为一谈。 基于完整工具调用轨迹的客观指标(路由质量、有效调用率、无幻觉率)与多评判模型评分,并报告跨评判模型下模型排序一致、绝对分数随评判严格度变化。

持久记忆是多阶段能力:存储量、内容质量与有效使用彼此独立,且记忆带来一致的下行风险改善而非一致的收益提升——五个记忆增强账户的尾部损失均低于匹配的无记忆账户,但收益效应因模型而异。 将记忆评测从单一存储或检索指标扩展为「构建—检索—应用—下游风险效应」的链条,并用匹配的无记忆账户作为对照来度量下游效应。 报告各模型的检索与存储次数、内容质量与使用质量评分,以及相对匹配无记忆账户的最大回撤与尾部损失变化;案例研究进一步展示记忆在震荡市中保护资本、在趋势市中压制上行收益的双面性。

规则遵循需要两种互补能力:执行层面的合规与可审计的规则推理,二者可以背离;多智能体协作中角色参与与证据整合同样与实现收益不构成单调关系。 用程序化检查器度量执行合规,用独立 LLM 审计度量规则理解与冲突处理,并用角色多样性与证据整合度量可观测协作,从而把「做了」与「说得清、用得上」分开。 报告硬规则通过率、规则满足度与规则可审计度,并给出跨审计模型的一致性分析;案例研究展示静默合规、幻觉违规修复、边界当目标与可审计违规修复四类轨迹。

启示与展望

该基准面向在持续演化环境中运行的持久型 LLM 智能体,适用于需要区分机制可及性、机制有效使用与实际收益的评测场景,例如长时程决策、工具增强、记忆增强、策略约束遵循与多智能体协作。其设计以实时加密货币与美股纸面交易为实例,采用四小时决策轮与更细粒度的账户权益检查点,因此对希望在同一外部条件下比较不同骨干模型或不同机制配置的研究者与工程团队最为直接可用。结论适用于所观察的约 30 天窗口与相应市场状态,作者也指出将流程感知评测扩展到更长时程、更广市场状态与其他持续演化环境是自然的下一步。

读者仍需关注若干开放问题:能力指标与收益的关系在更长时程与不同市场状态下是否稳定,尚需更多窗口验证;部分评判维度(如调用效率与证据忠实度)在不同评判模型间一致性较低,绝对分数对评判严格度敏感;角色集约定与角色主导阈值会改变协作分数的绝对值,尽管模型排序保持稳定;个别运行因环境一致性缺陷或轨迹不完整而被排除,其影响范围已在文中说明。此外,本文为完整文本,但部分表格与图在解析中缺失数值,涉及多智能体收益差值与部分规则指标的具体数字无法在此逐项核对。

来源