AI 核心
970 条内容
字节跳动团队发现分块KV缓存压缩会让长上下文检索按压缩步长周期性变弱,DeepSeek-V4系列相位间准确率差距最高达40个百分点
该工作提出并系统刻画了分块KV缓存压缩模型中的“相位敏感性”:同一信息在相对压缩窗口边界的不同相位上检索难度不同,DeepSeek-V4系列在128K上下文下相位间检索准确率差距最高达40.2个百分点,作者通过从零预训练23个压缩模型(Qwen3-0.6B骨干、100B token)复现该现象、用KV头与层级的均值替换消融揭示相位专门化、并用理想化归纳模型证明梯度流会驱动压缩门形成静态偏好,从而说明平均基准分数会掩盖周期性的位置性失败。
复旦团队用千万级中文决策数据训练Chinese-Jev,通用任务准确率69.20%并比Jev快约20倍
该工作提出Chinese-Jev:用统一数据处理流程把异构中文标注转成候选选项上的概率目标,先以1000万条通用中文决策预训练轻量编码器模型,再分别针对医疗、法律、金融微调,并发布含307,900条留出决策的CJ-Bench;预训练后在通用任务上准确率69.20%,相对闭源Jev提升1.24%,期望校准误差从11.45%降至3.78%,延迟14毫秒,医疗微调后准确率比Jev高4.0%,三个专业领域平均达到Jev的92%,平均延迟15毫秒,INT8量化模型可在手机浏览器上约1秒完成一次决策。
TabFM-Auto 用 LLM 智能体围绕冻结的 TabFM 演化数据管线,在 TabArena 全部 51 个数据集上把 Elo 从 1785 提升到 2013
TabFM-Auto 把冻结的表格基础模型 TabFM 与一个语言模型编码智能体配对,让智能体依据数据集元数据与验证反馈迭代改写数据清洗、特征工程、上下文选择和后处理四个阶段的管线,在 TabArena 全部 51 个数据集上五种配置占据总榜前五名,最佳配置(Codex 配 Opus 5)把 TabFM 从 1785.3 Elo 提升到 2013.0 Elo,所发现的管线无需再搜索即可迁移到 TabPFN-3、TabICLv2 和 EXAONE-Tabular(提升 69 至 143 Elo),并在 MLE-Bench 的 8 个表格竞赛中在 MLE 智能体里排名第一。
EmoRES 把情绪向量拆成共享与残差两部分,在 IndexTTS-2 与 CosyVoice2 上把情绪命中率最高提升 12.95 个百分点
该工作提出免训练的 EmoRES 方法,发现情绪引导向量可分解为把语音推离中性表达的共享分量与指向目标情绪的残差分量,并分别独立控制二者;在 IEMOCAP 上,EmoRES 在 IndexTTS-2 与 CosyVoice2 两个冻结骨干上于全部四项客观情绪指标上优于 CoCoEmo,排序相关性分别提升 26.13 与 12.97 个百分点,情绪命中率分别提升 12.95 与 6.92 个百分点,人类评测中听者正确识别主导目标情绪的比例相对提升最高 35.0%,自然度成对偏好最高达 63.8%。
谷歌400M参数TabFM在TabArena全部51个数据集上零样本登顶,冻结权重下TabFM-Auto再提Elo
TabFM是一个400M参数的表格基础模型,把监督式表格预测表述为上下文学习,仅用结构因果模型生成的合成表格预训练,在单次前向传播中给出校准的零样本预测;在TabArena全部51个数据集(38个分类、13个回归)上,零样本TabFM在默认表格基础模型中排名第一并超过调优的AutoML流水线,其两个扩展TabFM+(多视图特征扩展、集成与事后校准)和TabFM-Auto(由Gemini-3.8-Flash引导的数据集特定数据处理与特征工程)在冻结权重下进一步提升两个赛道的表现。
清华团队用GFlowNet把SIS提议分布变成学习问题:一个网络在1190个未见边际上零样本匹配或超越31种解析提议的事后最优
该工作证明固定边际二值矩阵的零方差序贯重要性采样(SIS)提议分布恰好是单位奖励GFlowNet的策略,并提出MarginFlow——一个读取剩余边际的集合Transformer,在1904个边际上训练后,于1190个留出边际上零样本运行,在1187个边际上匹配或超越31种解析设计配置的事后最优,中位有效样本比例为99.8%。
TGRL 把温度差异变成训练信号:数学平均分提升 1.6%、CodeForces 评分提高 196.7 分,且不增加 rollout 预算
该工作提出温度分组强化学习(TGRL),对每个提示把 rollout 组划分为低温参考子集与高温探索子集,用两组奖励差估计提示级探索增益,并用同一 logits 下温度缩放下一词分布之间的 Jensen–Shannon 散度把该增益分配为 token 级信用;在 11 个基准上,TGRL 在不扩大 rollout 预算的前提下,把 32B 六项数学平均分提高 1.6%、CodeForces 评分提高 196.7 分、LiveCodeBench Pass@16 提高 4.4%,ALFWorld/WebShop 成功率提高 6.3%/4.9%,并以最高快 36% 的速度达到与强 RLVR 基线相当的准确率。
SAKI 用最大耦合的接受/纠正事件路由教师监督,在七个数学推理基准上把 1.7B 与 0.6B 学生的 Mean@8/Pass@8 同时推高到同规模最佳
SAKI 在 KL 约束的教师引导 rollout 中用最大耦合实现中间行为分布,并把实际发生的接受/纠正事件当作 token 级监督路由器:接受位置保留采样 token 的反向 KL,纠正位置改为直接监督教师最高概率 token,纠正概率恰为 TV(p_t,q_t) 因而受同一信任域半径上界约束;配套的引擎内投机验证器保持精确 q 轨迹分布与耦合语义,把同等工作负载下的 rollout 吞吐提升 4.22 倍,并在七个数学推理基准上让 1.7B 与 0.6B 学生的 Mean@8 与 Pass@8 均优于匹配的教师引导基线。
AutoDataBench 让智能体逐条交付训练任务:五个前沿智能体在 45 分钟内得分均不超过 20 分,难度校准而非模式覆盖成为瓶颈
该工作提出 AutoDataBench,把“智能体能否写出可被数据流水线逐条验收的训练任务”变成评测目标:给定一个原始基准任务和目标模型尝试它的记录,作者智能体须为同一套件写出一个新任务,评分由门控、目标模型通过率是否落在区间、以及对隐藏行为模式清单的覆盖三项相乘;在三个可执行智能体任务基准上,五个前沿智能体在默认 45 分钟预算下得分均不超过 100 分中的 20 分,把最强智能体的时间放宽到四倍后得分大幅提升而单个可用任务的成本几乎不变。
第 20 页 · 当前显示 10 项