跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

DAGO 用上下文老虎机选择多父代工作流融合,在六个基准上把宏平均分从 80.3 提升到 81.7 并降低 11.2% 搜索开销

DAGO 把每个父代工作流组合建模为老虎机的一个臂,用代码与提示的预训练嵌入表示该臂,以对角 LinUCB 在预测子代质量与不确定性探索之间权衡,由 LLM 经摘要引导融合生成子代并以子代验证分作为奖励,在数学推理、代码生成与问答六个基准上取得所评估基线中最高的宏平均分,并在与 AFlow 相同的验证评估预算下把宏平均分从 80.3 提升到 81.7、把总搜索开销降低 11.2%。