跳到主要内容
返回时间线
arXiv来源发表:

TokenCast 用可组合分段成本在智能体运行中预测 token 消耗,96 组对比平均降低 MAE 14.5%

核心概要

TokenCast 为 LLM 智能体的每个执行分段学习一个可组合的成本三元组(调用次数、净输入长度变化、成本残差),通过精确的组合恒等式把早期上下文被后续每次调用重复计费的成本纳入累计预测,并在执行过程中用新观测刷新预测而无需额外 LLM 调用;在 SWE-bench Verified 上平均累计预测耗时 32.8 ms 每次运行,在 4 个任务套件与 6 个智能体模型共 96 组评估中相对最强对比方法的平均绝对误差平均降低 14.5%,离线预算控制回放中在相同轨迹完成率下比固定预算策略平均少用 21.3% 的 token。

AI-generated editorial illustration: TokenCast: Forecasting Token Consumption During LLM Agent Execution

深度剖析

论文提出分段成本分解与精确组合恒等式:每个执行分段用调用次数、净输入长度变化和成本残差表示,相邻分段组合后能显式刻画早期上下文被后续每次调用重新读取所产生的额外输入成本。 此前请求级方法只预测单次响应长度,任务级方法(如 Self-Prediction)在执行前估计总消耗,而多步框架依赖执行前已知的程序结构或依赖图;TokenCast 针对开放式智能体没有预先依赖图、且上下文持续累积的情形,把剩余成本预测拆成前缀分段、边界状态与后缀分段三个子问题。 论文给出组合恒等式的推导,并说明该组合满足结合律、任意划分完整轨迹都得到同一残差;消融显示去掉组合后归一化平均 MAE 从 0.69 升至 0.78,去掉净输入长度变化升至 0.76,去掉残差升至 0.73。

论文构建分阶段前缀–后缀预测器,把直接预测与组合预测结合,并用校准的分位数模型给出预测区间,随执行推进用已观测证据刷新预测且不产生额外 LLM 调用。 与依赖模型内部隐状态或熵统计的请求级方法不同,TokenCast 只使用预测点可见的任务与执行特征;与需要额外 LLM 调用来估计成本的 Self-Prediction 不同,它的预测开销为零额外 LLM 调用。 在 SWE-bench Verified 上每次运行平均累计预测时间 32.8 ms,每次运行约 19.7 次预测;每调用一次刷新相对 129 s 的中位运行墙钟时间增加不到 0.03%;LightGBM 模型推理时间 0.8 ms,低于 XGBoost 的 3.9 ms 与 CatBoost 的 5.2 ms。

在 4 个基准(SWE-bench Verified、Search-R1、MMLU-Pro、LongBench-v2)与 6 个智能体模型上,TokenCast 相对各组合中最强对比方法的 MAE 平均降低 14.5%,共 96 组对比。 论文报告在 In-call Update 与 Task Update 两个预测点上没有出现落后于最强对比方法的组合,落后集中在 Task Start(15 组)与 Call Start(9 组);例如 SWE-bench Verified 上 GPT-5.4 的 In-call Update MAE 从 EGTP 的 74.6 降至 38.9 token,Task Update 从 TRAIL 的 115k 降至 80k token。 实验收集 11,712 条执行轨迹,来自 240 个基准任务、6 个智能体 LLM 与两个执行框架;任务按五折划分并重复三个随机种子,同一任务的所有运行保持在同一分区。

离线预算控制回放中,TokenCast 在匹配固定预算策略的轨迹完成率的同时平均少用 21.3% 的 token。 该回放把在线预测接入停止规则,在 144 个 SWE-bench Verified 任务的 288 次 GPT-5.4 运行上按 0.3 至 0.9 分位设定七个预算,并在每个 Task Update 检查点用预测剩余消耗的分位数决定是否停止。 论文说明回放中的轨迹完成指到达记录的终止状态,并不衡量任务是否被解决;预测处理与时间计入回放核算,TokenCast 的预测 token 记为 0.0k,而 Self-Prediction 为 166.0k。

启示与展望

该结果面向按提供商计费的输入与输出 token 消耗,适用于顺序执行、行为依赖工具反馈与环境状态的开放式智能体;预测器从已记录轨迹学习,迁移到新任务域或新智能体 LLM 时可用少量目标任务适配。预算控制结论来自离线回放,其轨迹完成定义为到达记录的终止状态,论文明确说明回放不衡量任务是否被解决,因此该节省应理解为在相同完成率下的 token 用量对比,而非任务成功率结论。

组合恒等式的推导与消融在正文中给出,但部分附录表格(如长度外推与随机划分的差值、更新频率的时间标准差)在本次加载的文本中数值缺失,因此这些细节只能按正文描述理解。跨任务域零样本迁移在 Call Start 与 Task Update 上仍高于 Self-Prediction,需要多少目标任务才能稳定反超、以及在不同执行框架与推理配置下的表现,是读者可以继续关注的问题。预算控制目前是离线回放,把预测接入主动管理执行的运行时框架仍是论文列出的未来方向。

来源