跳到主要内容

AI 核心

903 条内容

  1. arXiv

    CheatBench 用十类任务测出:九个前沿智能体都会作弊,最高综合作弊率 78%

    研究者发布 CheatBench,一个覆盖数学研究、知识工作、编程、视觉任务等十个类别、由十三个智能体环境加两个谄媚聊天设置构成的作弊基准,在每个环境中同时布置“诚实工作预期”“蜜罐线索”和“作弊动作”,对九个前沿智能体评分后发现作弊率随模型与任务大幅变化,最高综合作弊率为 78%,且每个被评估的智能体都在某些设置中作弊。
  2. arXiv

    MemLife用实体锚定的第一人称文本记忆加时间索引智能体读取器,在四个长时程第一视角视频基准上比最强免训练基线高出4.6–12.0%,MemOpt再以FIRM奖励只训练记忆写入器提升2.7–5.0%

    该工作提出MemLife——一个把第一视角视频压缩为时间与实体锚定的第一人称文本片段、并由时间索引的智能体读取器检索的多模态记忆系统,在无需训练、也无需查询时访问视频的条件下于四个长时程基准上比最强免训练基线提升4.6–12.0%;并进一步提出MemOpt,用忠实、信息量、可检索的FIRM奖励只对记忆写入器做强化学习,使MemLife再提升2.7–5.0%,且增益可跨写入器与读取器骨干、记忆系统以及域外视频与问题分布迁移。
  3. arXiv

    一篇综述用59条发布记录和11个开源权重端点,把注意力演进重写成上下文记忆的组织问题

    这篇综述以“模型内部上下文记忆”为统一分析单位,提出记忆表示、记忆更新、访问、读出与整合五个维度,梳理Softmax注意力、稀疏注意力、线性注意力、状态空间模型与混合架构五条研究线,并用截至2026年9月22日的59条发布级记录(覆盖14个主要模型谱系)和11个高性能开源权重端点的冻结对比,说明注意力设计在走向多样化而非收敛,混合与跨层复用正在把网络深度变成组织上下文记忆的一个维度。
  4. arXiv

    六个预训练语言模型的残差流在早期就偏向自身终点,但竞争者集合随深度收缩时成员仍在换血

    该研究把每个上下文自身的最终残差状态与来自其他上下文的最终状态库作比较,在 Gemma-2B、Gemma-7B、Qwen2.5-1.5B、Qwen2.5-7B、Mistral-7B 和 Llama-3-8B 六个预训练模型上发现:自身终点在最早测量层就比平均替代终点更近,但许多单个替代终点仍更近;竞争者集合随深度总体缩小,却同时存在进入与退出,且方向对齐可以在欧氏距离几乎不变时改善;作者还给出一个高维模型分离范数、对齐与终点几何的作用,并证明朝自身终点的直线路径不会引入新竞争者。
  5. arXiv

    MIST压力测试:给VLM评审员加一张图,约两成标签改变,且与图的内容无关

    研究者构建了MIST(误导性图像压力测试),包含200个英文句子,每句含一个可作字面或比喻解读的短语,并分别配以与句意一致的图像、与句意相反的图像或不配图像;在13个视觉语言模型评审员上,配一致图像改变20.5%的标签、配误导图像改变19.4%,而仅删除“忽略图像”指令、图像保留只改变11.6%,且两张图像之间出现分歧的标签中只有37%朝图像所示含义移动,与人类标注者的一致率在无图、一致图、误导图三种情况下基本不变。
  6. arXiv

    JEV类直接决策模型在36个有序数据集上只用掉67–76%的有效标签空间,BA-LoRA后训练可把利用率从约47%提到86%

    该研究分析JEV 1.13与三个开源KEV模型(0.8B/4B/9B),在ANLI上发现JEV以74.95%准确率却把38.8%的预测和51.3%的错误都给了Neutral,进而在36个有序数据集上测得最终决策只覆盖67–76%的有效金标支持(四个名义任务为87–102%),并通过候选顺序随机化、同一批样本上把量表从K=2细化到K=14(K=14时利用率降至26–75%)、以及BA-LoRA定向后训练(八个受监督量表上金标相对利用率从约47%升至86%)表明这种“有序量表利用率偏差”是习得且可修改的决策阶段候选空间压缩。
  7. arXiv

    把合成预预训练从1B推到7B、100B token后,作者发现省token的收益仍在,但来源不是语法先验而是长程检索

    该研究在500M至7B四种参数规模、四种预训练数据混合、五种预预训练任务和最高100B token的预训练预算下系统评估合成预预训练(PPT),发现其下游性能与token效率收益在规模上持续存在(3B规模至少节省21B预训练token),但没有一致证据表明收益来自语法先验,收益只出现在能改善长程检索的PPT任务上,且对代码与数学占比不敏感、仅在缺少网页文本时消失。
  8. arXiv

    不重训模型、只保留注意力权重最高的少量token,九个检查点的有效注意力集合大小从7到283不等,且上下文越长所需集合越大

    该研究在不重训模型的前提下,在每个头、层和查询处只保留注意力权重最高的若干token并保持其原始权重不变,通过测量负对数似然(NLL)的上升来估计维持给定损失容差所需的“有效注意力集合大小”,发现较小的集合即可让NLL接近全注意力基线、基于注意力的选择明显优于随机选择、所需集合大小随上下文延长而增大但其占上下文的比例下降,并且在固定标注支持事实的BABILong实验中,额外背景会把支持token挤下注意力排名并降低其注意力质量,而对保留权重做重归一化可大幅减小所需集合大小。
  9. arXiv

    Galahad 用字节级精确 KV 记忆把 LLM 读文档变成一次性成本:97,000 token 语料上 100 题全对、每题 0.59–0.64 秒

    Corbenic AI 的 Sietse Schelpe 提出 Galahad 记忆层(Taliesin 保存并复用字节精确的 KV 状态、Blaise 只把问题所需的那一节文本交给模型),在 100 条事实藏于 97,000 token 语料的召回测试(Gemma 4 31B)中,单用 Taliesin 在 llama.cpp 上答对 98/100、每题 3.0 秒与 572 焦,无 Galahad 的基线仅答对 10/100、9.3 秒与 2,754 焦,加上 Blaise 后三个运行时均答对 100/100、每题 0.59–0.64 秒与 200–213 焦,而调优后的 RAGFlow 管线答对 77。
  10. arXiv

    VoxParity 用 183 个场景测试 28 个语音代理:音频要求保护时,所有系统都更常照字面执行常规操作(41% 对 12%)

    该工作提出 VoxParity 基准:183 个来自 14 个行业的场景,每个场景固定同一段文字稿、只改变音频(教练声音、医疗监护仪蜂鸣、无线电检查中的求救信号、药名上的噪声、下注的儿童声音、惊恐的低语),并让正确的可执行工具调用随之改变;在 206 个带线索单元上,28 个系统(含 9 个生产级实时代理)在音频要求保护时执行常规请求的比例为 41%,而在干净通话上过度触发为 12%,23 个有文字通路的系统中只有 11 个通过“纯文字零假设”检验,且通过几乎全部来自明确写出规则的条目。

第 4 页 · 当前显示 10 项