谷歌在YouTube上线双循环LLM智能体系统,自主发现RMSprop、Gated Path与多目标奖励,多项A/B指标显著提升
核心概要
该工作提出并部署了一套自演化推荐系统,用Gemini系列LLM智能体充当机器学习工程师,通过离线快速循环(Offline Agent,每5分钟唤醒、每日运行)生成并离线打分候选配置、在线慢速循环(Online Agent,每日运行)排序并推进A/B实验,在YouTube多个推荐场景中自主发现了优化器切换(Adagrad→RMSprop、FTRL)、Gated Path(GLU)架构、激活精化、多目标奖励合成与奖励超参调优等改动,多项在线指标在95%置信水平上显著提升,并将实验吞吐从每周Θ(1)–Θ(10)提升到Θ(100)。
Figure 1: The Self-Evolving System Architecture. The framework operates as a dual-loop, self-evolving system centered around a shared Experiment Journal containing a persistent knowledge base, historical trials and their resulting metrics. The Offline Agent (Fast Loop) serves as the high-frequency nomination engine, where LLMs are invoked to instantiate specialized reasoning personas that generate and refine hypotheses into executable code. Tool calls are made to assign offline scores to candidates. The Online Agent (Slow Loop) is the low-frequency ranking engine, selecting high-potential candidates and promoting them to online experiment. It manages the entire experiment lifecycle including fetching online north star metrics.
· 第 4 页深度剖析
提出面向工业级推荐系统的自主MLE框架:以共享Experiment Journal为中心,Offline Agent(Fast Loop)负责高频候选生成与离线打分,Online Agent(Slow Loop)负责按北极星指标排序、推进训练、上线实验、回收资源,人类只负责提出初始研究想法与审阅最终指标。 以往AutoML(HPO、NAS、optimizer search)只能在预定义搜索空间内选择或重组操作,无法阅读生产代码、发明新模块或新奖励逻辑;该工作把"AI科学家"范式迁移到真实生产推荐系统,并处理噪声反馈、安全护栏与严格A/B协议。 论文给出完整系统设计与提示模板(图1–图4),并在YouTube多个场景部署;作者报告人类工程师仅参与首尾两个高层步骤。
智能体在优化器与架构上实现了结构性发现:将遗留Adagrad替换为RMSprop(learning_rate=0.005, rho=0.95等),提出类似GLU的Gated Path乘法门架构,并进一步把sigmoid门改为GELU加layer normalization;同时通过调整batch size、epoch与优化器超参把训练时间累计缩短8×(先4×后2×)且不损失业务指标。 这些改动不是从固定算子菜单中挑选,而是智能体直接写出新代码;作者称Gated Path带来部署中最稳健的收益之一,并展示了"先探索新结构、再精化已发现结构"的能力。 离线损失下降与在线流量提升被报告为统计显著;表1给出RMSprop的YouTube级+0.06%[+0.03%,+0.09%]、场景级+0.12%[+0.05%,+0.19%],Gated Path为+0.06%[+0.02%,+0.11%]与+0.14%[+0.08%,+0.21%],均标注95%置信水平显著。
奖励工程上,Reward Persona先用run_sql_query在用户日志上做大规模开放式分析形成假设,再用compute_eval计算与损失无关的代理指标(如long-watch correlation),合成出包含"用户是否主动与站内内容互动"这一新信号的多目标奖励,显著超过人工基线;随后又在无离线指标、仅依赖在线慢循环的情况下,两周内调好四个奖励超参。 作者强调奖励定义改变会改变优化景观,跨奖励比较Lproxy无意义,因此该角色不能使用compute_loss;这使其区别于在机器人或仿真中拥有即时反馈与明确成功判据的Eureka、LEARN-Opt等工作。 多目标奖励合成在表1中为YouTube级+0.05%[+0.02%,+0.08%]、场景级+0.17%[+0.13%,+0.22%];奖励超参调优为+0.05%[+0.01%,+0.08%]与+0.21%[+0.13%,+0.29%],均显著;作者称此前数月人工调参未能同时改善两级指标。
消融实验显示发现能力依赖模型推理力与上下文工程:Gemini 2.5 Pro(opt_2p5,归一化损失−0.84[−1.70,−0.01])优于Gemini 2.5 Flash(opt_flash,0.85[0.66,1.05]);去掉专家MLE人设(opt_no_role,−0.52)、按时间而非损失排序(opt_no_sort,0.06)、只给top-1(opt_top_1,0.11)或无历史(opt_no_context,1.05)均变差,完整且按离线损失排序的历史(opt_top_5,−0.72)接近基线。 这组对照把"智能体能否发现"拆解为可测量的因素,指出专家人设与完整排序历史是迭代发现的关键,而不仅是模型规模问题。 结果在优化器组件任务上取6次独立运行、每次探索70个想法的平均归一化z分数,并给出区间。
启示与展望
该结果面向拥有大规模生产推荐系统、可承受每日训练与在线A/B流量、并具备持久实验日志与安全护栏的工程团队;它使这类团队能把人力从重复的代码生成、编译与实验编排中释放出来,转向设定战略护栏、伦理约束与长期愿景。方法本身被描述为模型无关,但部署环境是YouTube视频观看页上基于价值函数的RL排序模型,训练通常需要Θ(小时)。对希望借鉴的读者,可直接复用的是双循环分工、共享Experiment Journal、delta式提案与专家人设提示这几项设计。
读者仍需留意:核心在线收益来自单一公司平台,跨公司、跨领域的普适性尚未验证;表1中部分条目(如4×训练效率的YouTube级−0.01%[−0.05%,+0.03%]、激活精化的−0.02%[−0.05%,+0.01%])区间跨越零,说明并非每项改动都在每个指标上稳健;消融实验仅针对优化器组件,架构与奖励角色的同类敏感性未单独给出;论文未披露候选被拒绝或失败的比例,也未给出智能体提案的长期稳定性与安全事件统计。此外,本文为全文解析,图1–图4为架构与提示模板示意,具体提示词全文与工具实现细节需查阅原文与代码。未来值得观察的是:这套框架在非推荐类工业ML系统上是否同样有效,以及当人类工程师只保留首尾两步时,如何界定与审计智能体的决策边界。
