跳到主要内容

AI 核心

1011 条内容

  1. arXiv

    自演化搜索智能体出现“共同作弊”:内部奖励上升而真实正确率停滞,CrossFit 把假一致率从 6.1%/8.8% 降到 3.0%/3.7%

    该工作诊断了自演化搜索智能体中的“共同作弊”失效模式——出题者(proposer)与解题者(solver)在共享错误上越来越一致,使内部奖励上升而外部正确率停滞,并提出多样本验证(MSV)与主方法 CrossFit(按来源文档分折、用互补折训练的辅助解题者给提案打分),在 Qwen3.5-4B/9B 上把假一致质量从 6.1%/8.8% 降至 3.0%/3.7%,在七个下游搜索基准上平均 Cover-EM 相比标准耦合自演化提升 8.8/8.4 个百分点。
  2. arXiv

    RRT用项目反应理论把评分表判定转成质量奖励,在Qwen3.5-4B上比GRPO高1.7分并省下约一半评判请求

    该工作提出Rubric Response Theory(RRT),把评分表准则的通过/不通过判定视为对同一潜在质量的项目反应证据,用两参数项目反应模型推断每条 rollout 的质量作为GRPO奖励,并用Response Parameter Network从提示与准则文本预测准则难度与区分度、以在线EM随策略更新,在Medical、Science、Rubrics as Rewards Science与RubricBench四个数据集上以Qwen3.5-4B为策略时宏观准则得分比GRPO高1.7分,在Medical与Science的Hard与Very hard准则上高2.8至5.6分,且在准则预算减半时自适应Fis
  3. arXiv

    BIABench用16项已发表研究检验AI智能体:常规分析可完成,3D与时间序列任务得分跌至0.00–0.10

    研究者构建了BIABench,把16项已发表生物学研究还原为原始图像加生物学家指令的端到端生物图像分析任务,用研究自身报告的结果作真值、以确定性指标评结果分并用VLM按专家撰写的评分细则评过程分,在6个智能体、多个模型与两种指令详细度下各重复三次,发现常规2D任务最高可达0.97,而5D核孔定量与3D致癌点状结构定量在所有配置下都不超过0.25。
  4. Google DeepMind News

    SynthID Bio 概念验证:为 AI 生成的蛋白质加入水印并保持其生物功能

    该工作提出并验证了 SynthID Bio 这一概念验证方案,用于对 AI 生成的蛋白质进行水印标记,同时在标记后保持蛋白质的生物学功能。
  5. MIT News - Artificial intelligence

    MIT等团队开发的Ataraxos在Stratego上以15-1-4击败世界最强人类选手,训练成本不到DeepNash的百分之一

    MIT、卡内基梅隆大学、纽约大学和斯坦福大学的研究者开发了名为Ataraxos的AI系统,它结合自对弈强化学习得到的“蓝图策略”与使用生成模型进行决策时规划的方法,在隐藏信息的棋盘战争游戏Stratego中以15-1-4的创纪录比分击败世界最强人类选手,并在世界锦标赛顶级选手中取得39-2的战绩,同时训练样本不到DeepMind的DeepNash的百分之一、自对弈局数不到其三十分之一,还能泛化到Barrage Stratego、Hanabi和斗地主等不同规则的不完全信息游戏。
  6. Cohere Labs

    Cohere 提出 RCP-nDCG@10:用校准 AI 评审替代固定答案键,在 289 场盲测中 77% 与人类偏好一致,而传统 nDCG 仅 52%

    Cohere 提出 RCP-nDCG@10 检索评测方法,用校准 AI 评审对每篇检索文档按统一相关性评分标准打分,并结合成组比较与校准,从而为答案键未收录的相关文档记分;在 46 名标注者、273 个查询、289 场盲测对比中,两指标给出不同胜者时评审 70% 支持 RCP-nDCG,总体 RCP-nDCG 与人类偏好一致率 77%、传统 nDCG 为 52%,且其优势主要来自为答案键遗漏的相关文档记分(贡献 19 个百分点)。
  7. Cohere Labs

    Cohere 发布 Embed 5 双模型家族:Pro 在 ViDoRe V3 平均 85.8、Fast 以 2.4 倍吞吐共享同一嵌入空间

    Cohere 发布 Embed 5 嵌入模型家族(Pro 与 Fast 两档),两者共享同一嵌入空间并支持 128K 上下文、文本/图像/融合输入、100 多种语言与 2048 至 256 维的 Matryoshka 输出,其中 Pro 在 ViDoRe V3 上平均 85.8(较 Embed 4 提升 8.8)、在 FinanceBench 得 80.1、在解析 PDF 套件平均 84.8,Fast 在 ViDoRe V3 平均 84.5 且文档吞吐平均为 Pro 的 2.4 倍,定价分别为每百万 token 0.12 美元与 0.08 美元。
  8. Journal of Computer Science and Technology

    综述梳理近似计算高层次综合:围绕误差估计、近似技术与设计空间探索组织最新方法并指出研究空白

    该综述针对近似计算高层次综合(AHLS)领域缺乏系统性综述与最新方法深入分析的问题,汇总了该领域的最新技术,重点覆盖误差估计、近似技术和设计空间探索(DSE)三个方面,并分析了当前的研究空白,旨在为研究者、工程师和学者提供AHLS的理论与实践框架。
  9. Natural Sciences and Applied Technology

    FedTrust-GNN 在 1 万至 10 万参与者规模下达到 94.2% 准确率,并将标签翻转攻击成功率从 34% 降至 6.1%

    该工作提出 FedTrust-GNN,一个把差分隐私联邦学习与安全多方计算、采用 PBFT 共识的许可链、以及异构图注意力网络(HGAT)推断的动态信任分数结合起来的去中心化用户建模框架,并用信任加权鲁棒聚合(TWRA,结合范数裁剪与坐标中位数聚合)实现拜占庭容错;在 Federated EMNIST、Stack Overflow 与合成数据集(1 万至 10 万参与者)上报告 94.2% 准确率(与中心化模型相差 1.3% 以内)、标签翻转攻击成功率由 34% 降至 6.1%(降低 82%)、收敛稳定性提升 41%,以及 1200 TPS 与 2.3 秒最终性的区块链性能。
  10. Natural Sciences and Applied Technology

    DCONVNET 将二维到达角估计拆成两个一维问题,并用交替方向乘子法完成方位角与俯仰角估计

    该研究提出一种面向甚高频阵列雷达低仰角目标的快速二维波达方向估计方法:先利用均匀平面阵的方位角与俯仰角解耦特性,把二维角度估计问题转化为两个一维 DOA 估计问题,再用数字波束形成提取方位与俯仰维度的目标信息,最后用交替方向乘子法估计方位角和俯仰角,从而降低复杂度并避免运行中的特征值分解。

第 21 页 · 当前显示 10 项