跳到主要内容
返回时间线
arXiv来源发表:

EvoCast以认知-权限分离实现自主预测架构演化,在三个真实预测任务上取得最低MSE并降低智能体侧成本

相关研究与后续进展

核心概要

EvoCast是一个全自主研究智能体系统,用于迭代式时间序列预测架构演化:它先建立并诊断任务专属基线,再依据数据集特征、诊断结果、历史轮次与失败记录生成有证据支撑的研究方向,由LLM智能体负责假设生成与代码实现,由确定性程序权威控制源码编辑边界、规范评估与模型晋升;在30个仓库级实现任务上成功率达96.7%,并在空气质量、墨尔本行人T33与钢铁工业三个真实预测案例中取得最低MSE,同时相比R&D-Agent降低token与API成本。

Source-provided article image: EvoCast: Reliable Autonomous Research Agents for Iterative Forecasting Architecture Evolution
Figure 1 ·

Figure 1. EvoCast in the landscape of automated forecasting model development. Compared with fixed-space AutoML/NAS and open-ended LLM research agents, EvoCast combines evidence construction, bounded cognitive-agent exploration, and program-authority verification in a fixed-protocol loop for reliable architecture evolution. A three-part comparison of fixed-space AutoML and neural architecture search, open-ended LLM research agents, and EvoCast. EvoCast links task evidence, bounded cognitive-agent exploration, program-authority verification, canonical evaluation, and evidence-state updates in a closed loop.

arXiv

深度剖析

EvoCast把自主预测架构演化形式化为一个固定协议的研究闭环,覆盖异构预测仓库中的基线建立、机制诊断、有界实现、规范评估、晋升与证据更新。 与受限于预定义搜索空间的AutoML/NAS,以及在同一开放式智能体内完成研究生成、代码执行与结果裁决的通用LLM研究智能体相比,该工作把整个流程绑定到冻结的任务协议与单一比较面上。 论文以任务协议冻结、基线选择、机制消融、候选执行与晋升规则的显式形式化描述支撑该闭环,并在TFB统一基准路径上执行基线、消融与候选评估。

提出认知-权限分离:LLM智能体负责开放式假设生成、源码实现与报告叙述,确定性程序权威负责源码有效性、规范评估、指标比较、模型晋升与状态更新。 该设计把研究意图生成与实验裁决显式分离,使智能体自述不能直接成为实验结论,只有通过边界校验、产生有效规范指标并满足固定多种子比较规则的候选才能更新当前最优模型。 论文给出三类权限划分、边界执行机制、晋升门的两级语义(证据记录与现任替换),并通过RQ3的A4消融显示移除权限控制后运行时间、token与成本分别升至10.80小时、25,321,252 token与7.8792美元,最终MSE停留在基线水平0.185001。

构建了证据驱动的执行框架,把研究方向转化为可溯源源码候选,用修复与失败记忆减少无效迭代,并跨轮累积科学证据与工程证据。 相比仅依赖执行反馈或运行时修复的智能体流程,EvoCast把消融结果、被接受的改进、有效负结果、不稳定增益与工程失败分别写入证据状态,使后续规划读取完整研究轨迹。 RQ3的A5消融(冻结迭代证据更新)使最终MSE退化至0.178489、有效轮次降至15/20,而完整系统为0.162579与18/20,说明跨轮证据写回对持续进展有作用。

在仓库级实现与端到端预测研究任务上,EvoCast表现出更高的实现可靠性与更低的智能体侧成本,并产出任务专属架构。 在30个由10个预测骨干与3个想法复杂度层级构成的任务上,EvoCast成功率96.7%(29/30)、保真度100%、修复成功率95.7%(22/23),平均token 27,618、成本0.0137美元、时间153秒;在三个真实案例中取得最低MSE,并在其中两个取得最低MAE。 结果来自与Direct Independent Edit、mini-SWE-agent、AIDE、R&D-Agent、AutoResearch在相同仓库快照、想法文本与可编辑边界下的对比,以及三个公开数据集上在统一TFB评估器下的最终交付物比较。

启示与展望

该结果面向在固定任务协议下、以TFB仓库族预测模型为起点的仓库级架构演化场景,适用于希望为特定预测任务自动获得任务专属架构并保留可审计证据的研究者与工程团队。系统输出包含验证后的当前最优模型、可复现源码与配置、资源用量与HTML报告,因此可直接用于后续复现、消融检查与结果导出;Build模式还支持在正式长跑前做端到端可靠性检查。方法的价值在于把预算持续转化为留在原骨干活跃路径上的任务专属模块,而非替换为更保守的通用方案。

仍需观察的是:三个真实案例与单一消融任务(墨尔本行人T33)上的结论在更多数据集、更多仓库与更长研究预算下是否保持;权限分离各组件在不同骨干与任务模式下的相对贡献是否稳定;以及当候选实现需要更大幅度跨文件重构时,边界约束与修复预算之间的平衡如何影响最终架构质量。此外,论文报告的资源对比显示EvoCast相对AIDE在空气质量与钢铁工业上使用更多token与API成本,其相对墙钟时间随任务变化,因此成本优势的适用条件值得在读者自身任务上重新核对。

来源