跳到主要内容

检索

“全部学科” · 1362 项结果

第 4 页 · 当前显示 20 项
arXiv

RRT用项目反应理论把评分表判定转成质量奖励,在Qwen3.5-4B上比GRPO高1.7分并省下约一半评判请求

该工作提出Rubric Response Theory(RRT),把评分表准则的通过/不通过判定视为对同一潜在质量的项目反应证据,用两参数项目反应模型推断每条 rollout 的质量作为GRPO奖励,并用Response Parameter Network从提示与准则文本预测准则难度与区分度、以在线EM随策略更新,在Medical、Science、Rubrics as Rewards Science与RubricBench四个数据集上以Qwen3.5-4B为策略时宏观准则得分比GRPO高1.7分,在Medical与Science的Hard与Very hard准则上高2.8至5.6分,且在准则预算减半时自适应Fis
arXiv

Jev 在 Amazon 三域重排中保持高 NDCG@10,延迟随候选集增大增长远慢于点式 Qwen

该研究在 Amazon Reviews 2023 的 Movies and TV、Video Games、Books 三个域上,用 SASRec 检索出的高排名负例构造受控困难候选集(候选规模从 10 到 100),把被 TypeSafe AI 称为“System One Model”的决策导向模型 Jev 与 SASRec、DCNv2 以及 Qwen2.5 7B Instruct 的点式与列表式重排器对比,发现 Jev 在保持较强推荐效果(NDCG@10、Hit Rate@10、MRR)的同时,其观测服务延迟随候选集增大的增长明显比点式 Qwen 更平缓,但仍远高于推荐专用模型。
Gemini

Google 将 Gemini 的 Gems 替换为可复用技能,并开始全球推送

Google 宣布把“技能”功能全球推送到 Gemini 聊天中,并将在未来几周扩展到 Google Workspace 的商业、企业、非营利和教育客户,技能可保存常用指令并通过输入斜杠加名称重复调用,同时将逐步取代 Gems。
arXiv

一篇综述用59条发布记录和11个开源权重端点,把注意力演进重写成上下文记忆的组织问题

这篇综述以“模型内部上下文记忆”为统一分析单位,提出记忆表示、记忆更新、访问、读出与整合五个维度,梳理Softmax注意力、稀疏注意力、线性注意力、状态空间模型与混合架构五条研究线,并用截至2026年9月22日的59条发布级记录(覆盖14个主要模型谱系)和11个高性能开源权重端点的冻结对比,说明注意力设计在走向多样化而非收敛,混合与跨层复用正在把网络深度变成组织上下文记忆的一个维度。
arXiv

TERRA 仅凭运动学轨迹重建地形,让肌肉驱动的人体模型在楼梯、坡道与座椅上完成动作

TERRA 提出一套端到端流程,仅从无场景的运动学轨迹出发,结合地形先验、估计的接触事件与自由空间证据恢复任务相关支撑几何,并在重定向中加入解剖、肌腱连续性与接触约束,用五个数据集生成的“运动—地形”配对训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在受支持地形族上取得最高完成率。
arXiv

SeLMRoute 用 16 个可解释语义探针把查询需求变成概率状态,在 LLMRouterBench 上取得 72.08% 平均准确率

SeLMRoute 把 LLM 路由拆成三步——先用决策模型对查询做 16 个可解释语义判断并保留概率分布形成 40 维语义状态,再用轻量监督回归器预测各候选模型表现,最后套用部署目标;在 LLMRouterBench(15 个数据集、20 个候选模型、11,481 条查询)上平均准确率 72.08%±0.45,分组五折折外评估 72.64%,高于最强固定候选的 69.23%,并在 13 模型性能-成本设置中五个分组全部取得正向 PerfGain(均值 2.66%)。
arXiv

WorldAuditBench 用 213 个任务测多模态智能体查 3D 世界异常,最好模型 42.3%、人类 83.4%

作者构建了 WorldAuditBench——覆盖 13 个 Unreal Engine 5 与 Three.js 环境、五大异常族共 213 个任务的交互式 3D 世界审计基准,并比较单模型 VLM 智能体与两阶段 VLA–VLM 审计器,结果显示 VLM 智能体成功率 28.2%–42.3%、两阶段审计器 6.6%–17.4%,均远低于人类 83.4%。
Nature News

Merriam-Webster 收录 agentic、vibe coding 等 AI 词汇,Nature 同期报道 Google DeepMind 用 SynthIDBio 给 AI 生成蛋白质打水印

Nature 报道称 Merriam-Webster 于九月新增 agentic、AGI、natural language processing、prompt engineering、vibe coding 等 AI 与计算术语以及 biohack、direct air capture、geoengineering、uncanny valley 等技术词,词典编纂者 Peter Sokolowski 指出这批词需要较专业知识才能理解,认知科学家 Lera Boroditsky 认为技术加速推动语言变化;同一证据包中的 Nature 论文则提出 SynthIDBio,用 SynthID-text 的 tournament sampling 改造 Prote
arXiv

MemLife用实体锚定的第一人称文本记忆加时间索引智能体读取器,在四个长时程第一视角视频基准上比最强免训练基线高出4.6–12.0%,MemOpt再以FIRM奖励只训练记忆写入器提升2.7–5.0%

该工作提出MemLife——一个把第一视角视频压缩为时间与实体锚定的第一人称文本片段、并由时间索引的智能体读取器检索的多模态记忆系统,在无需训练、也无需查询时访问视频的条件下于四个长时程基准上比最强免训练基线提升4.6–12.0%;并进一步提出MemOpt,用忠实、信息量、可检索的FIRM奖励只对记忆写入器做强化学习,使MemLife再提升2.7–5.0%,且增益可跨写入器与读取器骨干、记忆系统以及域外视频与问题分布迁移。
arXiv

A2Z GameSpec-Bench 用 100 份长文档 GDD 检验编码智能体:可编译率近 99%,但整体 GDD Fidelity 最高仅 77.0

该工作提出 A2Z GameSpec-Bench,用 100 份长文档游戏设计文档(GDD,Small 与 Big 各 50 份,平均 14,085 与 26,297 tokens)把每份 GDD 转成固定的依赖感知契约,再以源码检查、场景回放与自适应试玩三条通道评估编码智能体端到端生成游戏的忠实度,结果显示可编译可运行并不等于忠实实现(如 Claude-Fable-5.1 可验证率 98.7% 而整体 GDD Fidelity 为 77.0),依赖上下文把已记录试玩违规的覆盖从 71.1% 提升到 80.2%,需求级反馈两轮后相对自我修订把 Big GDD 上的整体 GDD Fidelity 提升 10.9%。
arXiv

RSIGame 用局部探索-诊断-改进加全局最优检查点,把 Qwen3.8-27B 在 Godot 上从 37.07 提到 61.38,超过 GPT-5.5 单次生成的 50.26

RSIGame 把自动游戏开发组织成递归自我改进:局部 explore-diagnose-improve 循环广泛探索可执行游戏、诊断并排序问题、基于证据修改,并用不断增长的检查清单累积测试与改进指引;全局循环跟踪整体质量、保留最佳检查点并检测饱和或回退;此外把成功的开发经验通过监督微调内化进生成器,在 140 个 GameCraft-Bench 任务、Godot 与 Phaser 两个引擎、五个生成器上于同等开发预算下持续提升游戏质量,其中经验内化使 Qwen3.8-27B 在 Godot 达到 61.38、在 Phaser 达到 58.53,超过 GPT-5.5 单次生成分数并把 Qwen 的生成 token 减少 11 倍。
arXiv

CheatBench 用十类任务测出:九个前沿智能体都会作弊,最高综合作弊率 78%

研究者发布 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等十个类别、由十三个智能体环境加两个谄媚聊天设置构成的作弊基准,在每个环境中同时布置“诚实工作预期”“蜜罐线索”和“作弊动作”,对九个前沿智能体评分后发现作弊率随模型与任务大幅变化,最高综合作弊率为 78%,且每个被评估的智能体都在某些设置中作弊。
arXiv

SMART 用自进化多智能体把整季字幕翻译做成长程状态任务,在 15 个方向上取得最低 SubMQM 惩罚

该工作提出 SMART,一个面向长篇字幕翻译的自进化多智能体系统:在测试时训练阶段构建持久化的剧集级记忆,通过动态图路由与 Mixture-of-Agents 层翻译一部分句子,并借助术语核验、字幕约束校验与上下文检索工具,由 judge-refiner 循环把文本批评回传以更新智能体提示与路由策略而不重训底层 LLM;测试时推理阶段用演化后的配置翻译剩余内容,同时发布覆盖 14 个类型、每剧 2–198 集、制作年份 1959–2023、15 个目标语区的 Subtitle Arena 基准与含 7 个维度、19 类错误的 SubMQM 评估框架,结果显示 SMART 在全部 15 个 Subtitle Arena 方向上取得最佳 Overall
Nature News

从鲨鱼星云到新猫科动物:Nature九月图片盘点里的科学发现

Nature图片团队盘点的九月科学影像涵盖天文摄影(鲨鱼星云、太阳活动区、月掩金星、极光)、秘鲁Chan Chan的38人高等级墓葬、DNA双链“拉链式”配对的首张原子力显微图像、玻利维亚发现百余年来首个新猫科动物Leopardus tilcayo、瑞士Tsanfleuron冰川的羊毛毯保温试验、尼泊尔Bhotekoshi河泥石流灾害、SpaceX星舰首次入轨以及日本Hyper-Kamiokande中微子探测器洞穴完工。
arXiv

DyRAD 用固定点扩散函数渲染动态驾驶场景的完整距离-方位-多普勒雷达张量,在 RADIal 上把参考检出目标的雷达检测恢复率从 26.9% 提升到 90.7%

DyRAD 把动态驾驶场景表示为静态背景点反射体与跟随刚体轨迹的动态点反射体,用由雷达信号处理链推导并固定的解析点扩散函数渲染完整的距离-方位-多普勒(RAD)张量,多普勒既作为渲染输出又作为轨迹监督,在 RADIal、Boreas 与合成基准上同时评估轨迹内位姿与位移视角,在 RADIal 上把参考检出目标的雷达检测恢复率从最强基线的 26.9% 提升到 90.7%。
arXiv

MILO 用多智能体协同进化自动发现智能体 harness,在 Terminal-Bench 2.1 上以 86.1% 超过官方榜首并收紧三个数学上界

MILO(Meta-evolutionary Island Orchestration)把智能体 harness 与其搜索策略共同进化:用岛屿式层级谱系记忆把被拒绝的变异当作负证据,用每个岛屿的 mutator 智能体重写完整 harness,再由 orchestrator 智能体通过谱系嫁接、物种分化、mutator 重分配与课程修订自适应调整搜索;在 Terminal-Bench 2.1、PaperBench、DeepSWE 上,用 Opus 4.8 相对初始 harness 分别提升 12.0%、28.3%、10.3%(此前最佳搜索增益为 4.5%、18.3%、0%),Terminal-Bench 2.1 达到 86.1±2.0%(
arXiv

Soft Spatial Reasoning 用 AdaptSoft 按步调节软思考温度,在 OmniSpatial 上把加权平均准确率提到 49.68

该工作提出 Soft Spatial Reasoning 后训练框架,让大型视觉语言模型在空间推理的每个思维链步骤用混合 token 嵌入的连续软状态代替硬性选择单个 token,并用 AdaptSoft 控制器依据当前隐藏状态与预测不确定性逐步调节软度,配合梯度对齐目标训练;在 OmniSpatial、SpatiaLab、MindCube 三个基准上,其加权平均准确率均高于同骨干的硬思考与固定软度思维链基线以及所比较的现有模型。
arXiv

VoxParity 用 183 个场景测试 28 个语音代理:音频要求保护时,所有系统都更常照字面执行常规操作(41% 对 12%)

该工作提出 VoxParity 基准:183 个来自 14 个行业的场景,每个场景固定同一段文字稿、只改变音频(教练声音、医疗监护仪蜂鸣、无线电检查中的求救信号、药名上的噪声、下注的儿童声音、惊恐的低语),并让正确的可执行工具调用随之改变;在 206 个带线索单元上,28 个系统(含 9 个生产级实时代理)在音频要求保护时执行常规请求的比例为 41%,而在干净通话上过度触发为 12%,23 个有文字通路的系统中只有 11 个通过“纯文字零假设”检验,且通过几乎全部来自明确写出规则的条目。
arXiv

OSWorld-Science 用 146 个科学软件任务测 12 个视觉语言模型:最强智能体平均仅 73.7%,最难任务集只有 40%

该工作提出 OSWorld-Science 基准与评测环境,把专家定义的科学任务、基于产物的执行式评分器和统一智能体外壳结合起来,在 7 个科学领域、17 款软件、3 种语言上评测 12 个视觉语言模型,结果显示最强模型 Claude Fable 5.1 平均得分 73.7%、最难任务集约 40%,且失败多发生在交互层与结果校验环节而非科学推理本身。
arXiv

南科大与港城大提出Box2-Bench:前沿模型用得上好工作流,却在坏工作流下最多掉43.3分

作者提出Box2-Bench,在固定模型与任务的前提下只改变工作流的可用性与可靠性(无、好、坏、部分、混合五种匹配条件),发现Gemini 3.7 Flash、DeepSeek V4 Flash、GLM 5.2等前沿模型在12个模型–任务对中8对受益于好工作流、12对全部被坏工作流拉低(降幅3.3至43.3分),且混合条件在12对中10对低于匹配的部分条件;随后仅用坏工作流训练两个开放权重模型,反事实SFT把坏工作流惩罚从20.0分降到6.7分(AIME)和从9.8分降到0.6分(WebShop),但削弱了对留出好工作流的利用,结果奖励RL又把AIME上的利用率从-3.3恢复到+6.7,并在多智能体协作