跳到主要内容

AI 核心

901 条内容

  1. Investigative Radiology

    AI-RADS 框架让 5 名放射科医师对 350 例 AI 输出分级,图像与生成任务的读者间一致性分别达 α=0.87 与 0.93

    该研究开发并多读者评估了 AI-RADS——一个用于在病例层面评估放射学 AI 输出可靠性、临床实用性与建议处置的结构化框架,5 名委员会认证放射科医师独立评估了 7 个代表性 AI 应用处理的 350 例病例,每例赋予 5 个 AI-RADS 类别之一、适用修饰符及独立正确性评级作为参照,结果显示图像类任务的核心类别读者间一致性为 Krippendorff's α=0.87(95% CI: 0.83-0.91),生成式 AI 任务为 α=0.93(95% CI: 0.91-0.95),读者判定的正确性与提示可整合入临床工作流的类别 1 至 2 吻合良好,被评为“错误”的输出主要归入需要覆盖或从显示中移除的类别 4 至 5。
  2. DOAJ (DOAJ: Directory of Open Access Journals)

    研究以索绪尔符号学结合头脑风暴与AIGC生成20个皮革包拼接设计方案,B27满意度最高

    该研究以皮革包设计中的拼接方法为对象,先依据索绪尔符号学分析材质拼接、工艺拼接、元素拼接等"能指"与功能、审美、内涵等"所指"的共生关系,再通过市场调研定位需求与风格、结合头脑风暴构建能指与所指关系并整理为AIGC提示词批量生成20个系列皮革包方案,最后用CSAT满意度调查排序选优,结果显示20个包的量表内部一致性α值均超过0.80,KMO=0.8664且Bartlett球形检验显著(P<0.001),整体满意度均值介于3.34至3.48之间,B27整体满意度最高,维度C(价值提供:趣味、愉悦、自我表达)略高于维度A(风格设计)与维度B(设计方法),并形成"理论分析—市场调研—创新应用—效果验
  3. Anthropic

    Legate-Yang 与 Massenkoff 构建机器人暴露指数:机器人已能完成美国 74% 的体力任务,但仅对 0.3% 的工作具备成本竞争力

    作者用 Claude 对 O*NET 约 900 个职业、约 19,000 条任务描述按环境受控程度打分,构建机器人暴露指数,发现当今机器人可完成美国 74% 的体力任务(占全部工作时间 34%),但仅对 0.3% 的工作具备成本竞争力,且 1977 年以来的回测显示暴露度更高的职业随后出现工资与就业下降。
  4. arXiv

    DC-SAE 用语义加像素双分支把图像压缩到 32 倍,ImageNet 上 gFID 3.37、PSNR 29.79,并比 DC-AE 快 4.41 倍

    北京大学与新加坡科技设计大学提出 DC-SAE 解耦紧凑语义自编码器,用冻结语义编码器提供生成友好的紧凑潜空间、用可训练像素编码器保留低层细节,在 32 倍空间压缩下于 ImageNet 取得 29.79 PSNR 与 3.37 gFID,较 DC-AE 在 PSNR 上提升 13.5%、gFID 上提升 54.9%,并实现 4.41 倍加速,同时一个 B 参数 DiT 在 GenEval 得 0.84、DPG-Bench 得 86.007。
  5. arXiv

    MILO 用多智能体协同进化自动发现智能体 harness,在 Terminal-Bench 2.1 上以 86.1% 超过官方榜首并收紧三个数学上界

    MILO(Meta-evolutionary Island Orchestration)把智能体 harness 与其搜索策略共同进化:用岛屿式层级谱系记忆把被拒绝的变异当作负证据,用每个岛屿的 mutator 智能体重写完整 harness,再由 orchestrator 智能体通过谱系嫁接、物种分化、mutator 重分配与课程修订自适应调整搜索;在 Terminal-Bench 2.1、PaperBench、DeepSWE 上,用 Opus 4.8 相对初始 harness 分别提升 12.0%、28.3%、10.3%(此前最佳搜索增益为 4.5%、18.3%、0%),Terminal-Bench 2.1 达到 86.1±2.0%(
  6. arXiv

    PivotOPD 把蒸馏集中在关键失误及其后几轮,让 Qwen3-1.7B 在 ALFWorld 上比最强基线高 5.5 个百分点

    该工作分析 ALFWorld 上 Qwen3 系列(8B–235B)的失败轨迹,发现过半失败含有一个早期且通常可恢复的“关键失误”,据此提出 PivotOPD:用教师模型定位关键轮并给出金动作与后续恢复动作,以反向 KL 做预防蒸馏、以正向 KL 做恢复蒸馏,与组相对 RL 合并进一次 PPO 更新,在 ALFWorld、WebShop、Search-based QA 上对 Qwen3-1.7B 与 Qwen3-8B 均取得最高平均表现,并把增益迁移到 Nemotron-3.5 在 SWE-Bench Verified 上的解决率(+3.2%)。
  7. arXiv

    SkillGym 把 18.4 万个社区技能变成可验证训练环境,9B 微调模型在两个基准上超过 397B 未训练模型

    SkillGym 提出一条自动流水线,从互联网抓取技能并筛选出可离线复现的部分,用 builder-reviewer 智能体系统围绕四种推理结构构造带参考解与可执行验证器的技能关键型任务,再用三个教师模型和四个 agent harness 采集成功轨迹做监督微调,使 2B 到 122B 的六个模型在四个技能使用基准上 24 项比较中 22 项提升,其中 9B 模型在 SkillGym 测试集与 SkillEval 上超过 Qwen3.5-397B-A17B,并把智能体读取相关技能的比例从 28% 提高到 96%。
  8. arXiv

    TERRA 仅凭运动学轨迹重建地形,让肌肉驱动的人体模型在楼梯、坡道与座椅上完成动作

    TERRA 提出一套端到端流程,仅从无场景的运动学轨迹出发,结合地形先验、估计的接触事件与自由空间证据恢复任务相关支撑几何,并在重定向中加入解剖、肌腱连续性与接触约束,用五个数据集生成的“运动—地形”配对训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在受支持地形族上取得最高完成率。
  9. arXiv

    跨会议说话人归属评测:ThyVoice 以 47.13 的平均 SI-cpWER 领先全部商业级联,而单场最优的 ElevenLabs 在 CHiME-6 上归属误差增加约 30 个百分点

    该工作提出以语料级全局说话人映射计算的 SI-cpWER 指标,在 CHiME-8 NOTSOFAR(干净与加噪)及 CHiME-6 上评测五个商业 diarize-then-identify 级联、两个开放基线以及端到端参考系统 ThyVoice,发现要求跨会议保持同一身份会改变商业系统排名:ThyVoice 在三种条件下均优于所有被评测的商业级联,全组平均 SI-cpWER 为 47.13,次优系统为 54.75。
  10. arXiv

    复旦团队用IDS拆解汉字结构做奖励,让Qwen-Image在LongText与GenTextEval上结构质量与语义对齐双双领先

    该工作提出IDSpect:先用Unicode 16.0 BabelStone词典把目标汉字递归拆解为表意文字描述序列(IDS)令牌,再训练一个基于SVTRv2与NRTR解码器的专家IDS识别器,把生成图像中的文字区域直接转写为IDS序列,通过全局唯一令牌信用的令牌级F1与整字语义奖励加权融合,在GRPO后训练Qwen-Image时不改动生成器、不增加推理开销,在LongText与GenTextEval上取得领先的结构质量与语义对齐。

第 3 页 · 当前显示 10 项