AI 核心
927 条内容
Cohere 提出 RCP-nDCG@10:用校准 AI 评审替代固定答案键,在 289 场盲测中 77% 与人类偏好一致,而传统 nDCG 仅 52%
Cohere 提出 RCP-nDCG@10 检索评测方法,用校准 AI 评审对每篇检索文档按统一相关性评分标准打分,并结合成组比较与校准,从而为答案键未收录的相关文档记分;在 46 名标注者、273 个查询、289 场盲测对比中,两指标给出不同胜者时评审 70% 支持 RCP-nDCG,总体 RCP-nDCG 与人类偏好一致率 77%、传统 nDCG 为 52%,且其优势主要来自为答案键遗漏的相关文档记分(贡献 19 个百分点)。
Cohere 发布 Embed 5 双模型家族:Pro 在 ViDoRe V3 平均 85.8、Fast 以 2.4 倍吞吐共享同一嵌入空间
Cohere 发布 Embed 5 嵌入模型家族(Pro 与 Fast 两档),两者共享同一嵌入空间并支持 128K 上下文、文本/图像/融合输入、100 多种语言与 2048 至 256 维的 Matryoshka 输出,其中 Pro 在 ViDoRe V3 上平均 85.8(较 Embed 4 提升 8.8)、在 FinanceBench 得 80.1、在解析 PDF 套件平均 84.8,Fast 在 ViDoRe V3 平均 84.5 且文档吞吐平均为 Pro 的 2.4 倍,定价分别为每百万 token 0.12 美元与 0.08 美元。
综述梳理近似计算高层次综合:围绕误差估计、近似技术与设计空间探索组织最新方法并指出研究空白
该综述针对近似计算高层次综合(AHLS)领域缺乏系统性综述与最新方法深入分析的问题,汇总了该领域的最新技术,重点覆盖误差估计、近似技术和设计空间探索(DSE)三个方面,并分析了当前的研究空白,旨在为研究者、工程师和学者提供AHLS的理论与实践框架。
FedTrust-GNN 在 1 万至 10 万参与者规模下达到 94.2% 准确率,并将标签翻转攻击成功率从 34% 降至 6.1%
该工作提出 FedTrust-GNN,一个把差分隐私联邦学习与安全多方计算、采用 PBFT 共识的许可链、以及异构图注意力网络(HGAT)推断的动态信任分数结合起来的去中心化用户建模框架,并用信任加权鲁棒聚合(TWRA,结合范数裁剪与坐标中位数聚合)实现拜占庭容错;在 Federated EMNIST、Stack Overflow 与合成数据集(1 万至 10 万参与者)上报告 94.2% 准确率(与中心化模型相差 1.3% 以内)、标签翻转攻击成功率由 34% 降至 6.1%(降低 82%)、收敛稳定性提升 41%,以及 1200 TPS 与 2.3 秒最终性的区块链性能。
DCONVNET 将二维到达角估计拆成两个一维问题,并用交替方向乘子法完成方位角与俯仰角估计
该研究提出一种面向甚高频阵列雷达低仰角目标的快速二维波达方向估计方法:先利用均匀平面阵的方位角与俯仰角解耦特性,把二维角度估计问题转化为两个一维 DOA 估计问题,再用数字波束形成提取方位与俯仰维度的目标信息,最后用交替方向乘子法估计方位角和俯仰角,从而降低复杂度并避免运行中的特征值分解。
1003名抑郁症患者评估不同AI参与程度的心理治疗:更愿意选择人类治疗师,对辅助或协作式AI愿付费用低31.6%,对全自主AI低57.2%
该研究让1003名抑郁症患者阅读描述不同AI参与程度心理治疗(无AI的人类治疗师、辅助式AI、协作式AI、全自主AI)的情景材料并作出评价,结果发现参与者一致更青睐人类治疗师,表现为更高的求助意愿、更低的犹豫程度和更高的治疗可接受性,相比人类治疗师,他们对使用辅助或协作式AI的治疗师愿少付31.6%的费用,对全自主AI愿少付57.2%,18-19%的参与者表示会拒绝涉及辅助或协作式AI的治疗,31%会拒绝全自主AI,且这种对人类治疗师的偏好在其经验水平较高(博士或硕士)时比同伴或受训者更为明显。
SCITFS 将自适应冗余惩罚与自助法稳定性正则化合并为单一目标,在八个基准数据集上把 SVM 平均准确率提高 3.7%、随机森林提高 4.2%,同时减少 92.3% 的特征。
该工作提出稳定性约束信息论特征选择(SCITFS),把条件熵、归一化互信息最大化与惩罚自助样本间特征排序方差的稳定性项整合进一个形式化目标,并用带单调性保证的贪心前向选择实现 O(B n^2 m d^4 + k n^2) 的计算复杂度;在八个基准数据集、五种分类器(SVM、随机森林、k-NN、XGBoost、逻辑回归)上,SCITFS 优于信息增益、互信息、mRMR、ReliefF、Fisher Score 与 JMI,SVM 平均准确率提升 3.7%、随机森林提升 4.2%,并实现 92.3% 的特征缩减而保持性能;Friedman 检验(χ² = 127.4,p < 0.001)与带 Bonferroni 校正的 Wilcoxon 符号秩检
Evo 2 在五个二分类任务上展现上下文学习能力,短序列 F1 达 0.902,但千碱基尺度崩溃且 7B 反超 40B
该研究在五个生物与人工序列的二分类任务上刻画了核苷酸级基础基因组语言模型 Evo 2 的上下文学习工作区间,发现短自然序列上表现稳健(miRNA 的 F1=0.902,毒素为 0.785),随序列长度增加而退化并在千碱基尺度崩溃,模型规模扩大无收益(7B 系统性优于 40B),困惑度难以预测准确率,并通过 logit-lens 与 Jacobian Scope 的机制可解释性分析提示存在预测—泛化权衡、模型可能追踪提示结构而非承载信号的序列内容。
Ridezy 用边缘 AI 与物联网传感器实时生成司机可信度,并把哈希与信誉更新锚定在 Polygon 上,在行为检测保真度与信任保证上优于传统评分、纯 AI 与纯区块链三种基线
本文提出 Ridezy——一个去中心化信任架构,用边缘人工智能与物联网(AIIoT)持续监测车道保持、限速合规、制动行为和交通标志遵守等行为指标,把行为摘要放在链下处理、仅将加密哈希、可信度更新与支付记录锚定到 Polygon 智能合约,并与传统评分制、纯 AI 架构、纯区块链架构三种信任模型在行为检测性能、端到端时延、成本效率、吞吐量、信誉稳定性、防篡改以及组件消融等维度上进行比较,结果显示该混合架构在保持低单次行程链上成本并通过批量链上提交实现可扩展运行的同时,取得更高的行为保真度与更强的信任保证。
第 13 页 · 当前显示 10 项