跳到主要内容

检索

“全部学科” · 1368 项结果

第 10 页 · 当前显示 20 项
Journal of Applied Health Sciences and Medicine

30岁男性左侧颈部肿块经影像与FNAC提示后,Sistrunk手术切除并病理证实为甲状舌管囊肿

本文报告一例23岁男性以左侧颈部3×4 cm囊性肿块就诊、随吞咽移动但不随伸舌移动的病例,超声与颈部增强CT显示位于舌骨下方、甲状软骨上方并偏向左外侧的囊性病变,FNAC提示良性囊性病变可能为甲状舌管囊肿,患者接受Sistrunk手术(囊肿、瘘管及舌骨体一并切除),术后经过平稳,组织病理证实为左侧甲状舌管囊肿。
Natural Sciences and Applied Technology

双分支URL与主机特征加抗泄漏OOF堆叠的钓鱼网站检测模型在UCI数据集上达到92.67%准确率与0.9788 ROC-AUC

该研究提出一个基于URL特征与主机特征双分支、并用抗泄漏的Out-Of-Fold堆叠机制融合的混合机器学习钓鱼网站检测系统,在包含11,055个实例、17个特征的UCI Phishing Websites数据集上取得92.67%的准确率和0.9788的ROC-AUC,优于单一特征集模型,交叉验证显示低方差的泛化表现,特征重要性分析显示基于交互的元特征对分类精度贡献显著。
Natural Sciences and Applied Technology

Ridezy 用边缘 AI 与物联网传感器实时生成司机可信度,并把哈希与信誉更新锚定在 Polygon 上,在行为检测保真度与信任保证上优于传统评分、纯 AI 与纯区块链三种基线

本文提出 Ridezy——一个去中心化信任架构,用边缘人工智能与物联网(AIIoT)持续监测车道保持、限速合规、制动行为和交通标志遵守等行为指标,把行为摘要放在链下处理、仅将加密哈希、可信度更新与支付记录锚定到 Polygon 智能合约,并与传统评分制、纯 AI 架构、纯区块链架构三种信任模型在行为检测性能、端到端时延、成本效率、吞吐量、信誉稳定性、防篡改以及组件消融等维度上进行比较,结果显示该混合架构在保持低单次行程链上成本并通过批量链上提交实现可扩展运行的同时,取得更高的行为保真度与更强的信任保证。
Claude 产品博客

Anthropic 销售团队用 Claude Managed Agents 搭建购买代理,让入站线索转化为商机的比例提高一倍以上、成交快约五天

Anthropic 销售发展负责人 Carl Johnson 讲述其团队如何在 Claude Managed Agents(beta)上构建一个购买代理,部署在 Contact Sales、Pricing 页面、产品内和邮件中,每天承接数千次对话并可直接完成结账,把线索转化为商机的比例提高到旧表单的两倍以上、成交快约五天,同时把需要人工介入才能成交的对话占比降低约一半。
The FASEB Journal

整合机器学习与多层转录组分析将JAK2和ANXA5锁定为连接阻塞性睡眠呼吸暂停与氧化应激的关键基因,并在患者脂肪组织、间歇缺氧小鼠和CPAP治疗后样本中得到验证

该研究整合limma差异分析、WGCNA、GeneCards氧化应激基因集、PPI网络与LASSO、随机森林、SVM-RFE三种机器学习方法,从阻塞性睡眠呼吸暂停(OSA)脂肪组织转录组中筛出57个共有差异基因并锁定JAK2与ANXA5两个核心基因,随后用单细胞测序、scTenifoldKnk虚拟敲除、免疫浸润解卷积以及RT-qPCR和Western blot临床样本验证,发现JAK2在OSA中显著上调、ANXA5显著下调,二者主要富集于单核细胞,且CPAP治疗后JAK2下降、ANXA5回升。
Natural Sciences and Applied Technology

模糊排序特征选择加H2O AutoML集成,在两个公开宫颈癌数据集上取得最高95.1%准确率与98.1% AUC

该工作提出可解释的 Fuzzy Rank-H2O AutoML 框架,用模糊排序特征选择(FRFS)综合统计显著性、信息增益、临床重要性与不确定性挑选预测因子,再由 H2O AutoML 自动构建集成模型,并用 SHAP 与 LIME 提供全局与患者级解释;在两个公开宫颈癌数据集上以分层五折交叉验证评估,每折仅对训练集施加 SMOTE 以避免信息泄漏,报告的最高准确率为 95.1%、AUC 为 98.1%,优于传统机器学习模型与基线 H2O AutoML 框架。
NVIDIA Technical Blog

NVIDIA 团队以编码智能体构建 TensorRT Model Connect,公开预览已覆盖 128 个模型家族并在 GB300 上测试

NVIDIA 团队以一篇经验总结文章描述了开源项目 TensorRT Model Connect 的构建方式:该项目用 C++ 在 TensorRT 之上提供模型家族自有的参考实现,把 Hugging Face 或本地 checkpoint 转换为带版本的 .bundle 产物并暴露面向任务的 C++ API,覆盖文本、视觉、音频、扩散、分割、嵌入、预测等工作负载;截至 2026 年 7 月 29 日的公开发布对比,项目覆盖 128 个模型家族并在 NVIDIA GB300 上测试,团队据此提出以并行可分解任务、模型家族隔离、可逆变更和 GPU 支撑的自动化验证为核心的“AI 原生”工程做法。
The latest research from Google

谷歌研究提出 Diffusion Controller:轻量“转向阻尼器”网络在灰盒条件下于 HPS-v2 胜率上超过 LoRA,白盒版本对基线取得 90% 胜率

谷歌研究(Chih-wei Hsu 与 Moonkyung Ryu)提出 Diffusion Controller 框架,把扩散模型的去噪过程重新表述为平滑的连续控制问题,用一个轻量“转向阻尼器”网络在冻结基座模型的前提下动态修正生成轨迹;在 Stable Diffusion v1.4 骨干上,他们用 SFT、RWL 和 PPO 三种微调方式与 HPS-v2 人类偏好评分进行评估,报告称该框架在白盒与灰盒环境下均优于对应基线,灰盒版本在 SFT 与 RWL 路径上的 HPS-v2 胜率超过 LoRA 且改动的内部层更少,白盒版本对基线取得 90% 胜率,并可通过单一推理时引导强度参数在线调节约束强度。
NVIDIA Technical Blog

NVIDIA VSS Blueprint 3.3 用单条提示在 30 分钟内搭出视觉 AI 智能体,并让 VLM 输入 token 减少 80%

NVIDIA 发布 VSS Blueprint 3.3,新增 Build Vision Agent 技能(vss-build-vision-ai)与自适应高效视频采样(Adaptive EVS):前者让编码智能体从自然语言请求出发,复用四个已验证配置档并只计算最小增量,在双 GPU RTX PRO 6000 Blackwell 主机上把橙汁灌装线溢出告警智能体在 30 分钟内交付为可预览部署;后者在 RTX PRO 6000 Blackwell 上运行 Cosmos 3 Super FP8 时,把告警上下文延迟从 1,021 ms 降到 844 ms(17%),并发实时 VLM 流从 13 提升到 19(46%),并把 60 分钟视频摘要的 VLM 输入 token 减少 80%
Harvard Gazette

伯克曼·克莱因中心小组讨论:AI 评估需兼顾系统行为与对人的影响,并让公众参与报告与评估

伯克曼·克莱因中心举办的一场小组讨论中,Alex Pascal 提出“我们想从 AI 得到什么”,Jeff Dunn、Amit Goldenberg 与 Avijit Ghosh 分别就 AI 的双刃性、从工具到有名字有人格的完整智能体的连续谱,以及当前“基准刷分”式评估的不足展开讨论,Ghosh 建议建立同时衡量系统行为与对人的影响的评估体系,并让公众参与报告与评估,例如以“60 天内修复所报告问题则免于责任”的方式激励企业回应反馈。
Harvard Gazette

哈佛与布鲁金斯学者用四情景模型和任务分析说明:AI 尚未引发大规模裁员,但 41% 工作任务已可被自动化或增强

哈佛肯尼迪学院经济学家 Doug Elmendorf、Karen Dynan 与布鲁金斯学会 Louise Sheiner 在 NBER 工作论文中提出 AI 影响经济的四种情景(从温和提振 GDP 且就业减少有限,到 GDP 更快增长但失业率持续高企),并以中国冲击为参照估计其 AI 情景下任一时刻约 300 万人(约占劳动力 2%)失业;哈佛商学院 Joseph Fuller 与埃森哲研究合作开发的 AI 模型发现当前 41% 的工作任务可被 AI 自动化或增强,但企业 AI 实验仅约三分之一成功,因此大规模裁员尚未出现。
Anthropic

Anthropic 启动用 AI 访谈员收集用户对 AI 看法的研究,并首次允许受访者公开完整访谈记录

Anthropic 宣布启动一项由 AI 访谈员(Anthropic Interviewer)执行的新研究,向 Claude 与 Claude Code 的 Free、Pro、Max 用户询问其与 AI 相处的正负经历、希望 AI 改变的工作/学校/医疗/政府等现实领域以及对 AI 开发公司的诉求,研究期为 2026 年 9 月 29 日至 10 月 6 日、每次约 15 分钟,并首次允许受访者选择将完整访谈连同所属国家公开,同时以 FAQ 形式说明公开的好处、再识别风险与不可撤回性。
arXiv

EngiWorld 用 1301 个真实工程任务测出:最强模型 EngiScore 仅 44.3,多软件协作成功率 3.6%

研究者构建了 EngiWorld 基准,围绕完整工程设计闭环,在 CAD、CAE、CAM、BIM、EDA 与 3D 可视化 6 个领域、26 个专业软件平台上设置 1301 个专家策展任务,并用统一的领域验证器套件对最终与中间产物做几何有效性、物理可行性与规则合规检查;对 7 个前沿模型的评测显示最强模型 EngiScore 仅 44.3,多软件尝试成功率仅 3.6%。
arXiv

ActFirst-OPD 让多轮智能体先行动后推理,在 ALFWorld、WebShop、ScienceWorld 上把同策略蒸馏训练提速 2.3、1.8、4.9 倍

该工作提出 ActFirst-OPD,把环境交互与完整响应生成解耦:学生模型借助参考下一观测做参考条件逆动力学推断并执行动作,一旦转移偏离参考轨迹就切换为自主下一动作预测,同时从收集到的交互上下文异步生成完整“先思考后行动”响应供教师做 token 级监督;在 0.6B、1.7B、4B 的 Qwen3 学生上,相对 Vanilla OPD 在 ALFWorld、WebShop、ScienceWorld 取得平均 2.3 倍、1.8 倍、4.9 倍的墙钟训练加速,并在九个基准–模型设置中的八个里平均任务成功率持平或更高。
arXiv

DeepMind 给 AI 设计的蛋白质嵌入 SynthIDBio 水印,绑定病毒、血管与免疫靶点仍保持活性,但换一个设计工具即可抹除

谷歌 DeepMind 团队开发了 SynthIDBio,把统计水印同时写入 AI 设计蛋白质的氨基酸序列与三维结构,在不明显损害功能的前提下标记其“由 AI 生成”的来源;团队称水印蛋白对病毒侵染、血管生成和免疫调控相关靶点的结合效率与未加水印版本相当,但该标记在多数情况下可被另一个设计工具重新生成序列后擦除,因此被视为生物安全分层防护中的一层而非单一解决方案。
arXiv

SAKI 用最大耦合的接受/纠正事件路由教师监督,在七个数学推理基准上把 1.7B 与 0.6B 学生的 Mean@8/Pass@8 同时推高到同规模最佳

SAKI 在 KL 约束的教师引导 rollout 中用最大耦合实现中间行为分布,并把实际发生的接受/纠正事件当作 token 级监督路由器:接受位置保留采样 token 的反向 KL,纠正位置改为直接监督教师最高概率 token,纠正概率恰为 TV(p_t,q_t) 因而受同一信任域半径上界约束;配套的引擎内投机验证器保持精确 q 轨迹分布与耦合语义,把同等工作负载下的 rollout 吞吐提升 4.22 倍,并在七个数学推理基准上让 1.7B 与 0.6B 学生的 Mean@8 与 Pass@8 均优于匹配的教师引导基线。
arXiv

EpiCon用两个2B模型搭建共享多模态记忆库,让不同智能体系统互相复用经验并把宏平均分提高1.7到4.9分

EpiCon提出一个共享多模态记忆框架,用两个独立训练的2B模型(记忆控制器与树自组织器)把问题级的文本指导与视觉证据协同演化,并与持久经验库相连,在不更新宿主模型参数的前提下,让不同多智能体系统互相复用和贡献经验;在11个基准、4个多模态任务域、两种harness与多个骨干上,冻结记忆库即可在单次求解下提升其他系统,第二个harness使原系统宏平均分提高2.6分,四种宿主配置下2B版本比无记忆提高1.7至4.9分,并把记忆操作时间相对骨干规模记忆模型减少67%至74%。
arXiv

AnyStep-WAM 用冻结教师轨迹蒸馏与风险收益调度,把三个世界动作模型的去噪步数削减约五成至八成半并保持成功率

该工作提出 AnyStep 世界动作模型框架:用冻结教师轨迹构造的区间目标做预算对齐的流图蒸馏,并训练一个轻量风险—收益调度器,从单次一步预览预测教师轨迹难度与各预算下的学生保真度,从而为每个动作块选择满足保真要求的最小去噪预算;在 RoboTwin 2.0 上对 Motus、FastWAM、LingBotVA 三个骨干分别减少平均去噪步数 60.2%、49.8%、85.28% 且平均成功率与全预算基线相差不超过 0.24 个百分点,同时把一步预算下的成功率分别提升 7.07、12.08、8.94 个百分点,并在六项真实机械臂任务上取得 1.67–6.14 倍的单次推理加速。
arXiv

CaptchaArena 用 2 万道可执行验证的验证码题训练出单一策略 CaptchaAgent,平均 Pass@1 从 11.4 提升到 71.7,人类为 94.1

该工作构建了 CaptchaArena——一个包含 2 万道交互式验证码谜题、覆盖 20 种类型与五种交互模式的大规模细粒度计算机使用训练数据集,每道题的解答都经真实浏览器回放并由页面验证器接受,同时提供 2 万条截图-动作轨迹(其中 1.8 万条带经裁判过滤的逐步推理标注)以及针对不规则目标的像素掩码监督;基于该数据训练单一 90 亿参数策略 CaptchaAgent,监督微调后平均 Pass@1 达 70.5,再用环境验证器作为奖励做强化学习后升至 71.7,而未训练骨干为 11.4、最强开源 GUI 智能体为 35.2、最强闭源模型为 69.2、人类为 94.1。
arXiv

VoxPolyMem 用交互感知分层记忆与 EG-GRPO 检索策略,在多方言谈记忆基准 VoxPolyBench 上取得 85.0 分,超出最强基线 23.6 分

该工作提出 VoxPolyMem——一个面向多方言谈的交互感知多模态长期记忆框架,结合增量说话人识别与由交互记忆、事实记忆、参与者画像构成的分层记忆,并把检索建模为序贯决策,用 Evidence-Gain GRPO(EG-GRPO)按轮次奖励新获得的支撑证据;同时构建 VoxPolyBench(18 个场景、176 个会话、18.9 小时合成语音、1,527 个问答对),VoxPolyMem 在该基准上总分 85.0,超过最强被评估基线 23.6 分,在 Mem-Gallery 与 H2HMem-Multi 上分别得 89.6 和 74.4,均超过最强公开记忆基线 8 分以上。