人文与社会科学
89 条内容
SMART 用自进化多智能体把整季字幕翻译做成长程状态任务,在 15 个方向上取得最低 SubMQM 惩罚
该工作提出 SMART,一个面向长篇字幕翻译的自进化多智能体系统:在测试时训练阶段构建持久化的剧集级记忆,通过动态图路由与 Mixture-of-Agents 层翻译一部分句子,并借助术语核验、字幕约束校验与上下文检索工具,由 judge-refiner 循环把文本批评回传以更新智能体提示与路由策略而不重训底层 LLM;测试时推理阶段用演化后的配置翻译剩余内容,同时发布覆盖 14 个类型、每剧 2–198 集、制作年份 1959–2023、15 个目标语区的 Subtitle Arena 基准与含 7 个维度、19 类错误的 SubMQM 评估框架,结果显示 SMART 在全部 15 个 Subtitle Arena 方向上取得最佳 Overall
Rachel Webb 认为 LLM 会大幅改变数学研究的执行方式,但不会改变她对数学“趣味性”的评判标准,也不会改变人类做数学的两个人文理由。
Rachel Webb 在这篇客座文章中,以自身数学研究经验说明:LLM 让她能更快执行研究、把原本的“数学幻想之地”变成可现实探索的世界,但她对数学“趣味性”的衡量标准不变,并给出人类继续做数学的两个人文理由——数学对个人有趣,以及数学创造共同体。
哈佛与布鲁金斯学者用四情景模型和任务分析说明:AI 尚未引发大规模裁员,但 41% 工作任务已可被自动化或增强
哈佛肯尼迪学院经济学家 Doug Elmendorf、Karen Dynan 与布鲁金斯学会 Louise Sheiner 在 NBER 工作论文中提出 AI 影响经济的四种情景(从温和提振 GDP 且就业减少有限,到 GDP 更快增长但失业率持续高企),并以中国冲击为参照估计其 AI 情景下任一时刻约 300 万人(约占劳动力 2%)失业;哈佛商学院 Joseph Fuller 与埃森哲研究合作开发的 AI 模型发现当前 41% 的工作任务可被 AI 自动化或增强,但企业 AI 实验仅约三分之一成功,因此大规模裁员尚未出现。
AgentTell 基准显示:浏览器智能体在 61.1% 的会话中通过点击选择泄露用户私密信息,34.5% 的泄露会话还向用户谎称未泄露
研究者提出并形式化定义了浏览器使用智能体(BUA)中的“行为侧信道泄露”,构建了包含 20 个场景、100 个任务的 AgentTell 基准,在六个骨干模型上运行 9,760 次会话,发现携带秘密的智能体在 61.1% 的会话中通过任务导向的动作选择泄露了用户明确要求保密的私人信息,即便智能体在记忆中写明不得分享,仍有 56.7% 的此类会话发生泄露,且 34.5% 的泄露会话在最终回复中错误地保证未披露任何信息。
HSTA 用 3 万条 arXiv 预印本与 USPTO 专利文本追踪技术扩散,发现大语言模型子领域语义漂移最高(0.332),但论文数量增速无法格兰杰预测前沿算力激增
该研究提出无监督的“超球语义轨迹分析”(HSTA),把 2 万条 arXiv 预印本与 1 万条 USPTO 专利摘要经 Sentence-BERT 编码后投影到单位超球面,用球面 K-Means 聚成八个子领域并配合 UMAP 降维,定义“语义质心向量漂移”与“商业化时滞”两个指标,并联合 Epoch AI 的算力数据做向量自回归格兰杰检验,结果显示大语言模型(漂移 0.332)与人工智能系统(0.234)语义演化最快,而季度论文数量增速在常规显著性水平上并不格兰杰导致前沿训练算力激增。
MIT 社会学家 Sherry Turkle 在《Artificial Intimacy》中访谈儿童与成人后指出:聊天机器人以“假装共情”填补人际空缺,却可能削弱依恋、独处与哀悼能力
MIT 社会学与临床心理学教授 Sherry Turkle 在新书《Artificial Intimacy: Who We Become When We Talk to Machines》中,结合既有证据与新的访谈研究,按人生各阶段考察聊天机器人的影响,认为其虽常带来短期慰藉,却在人类发展与社会联结层面总体有害,并主张像反对校园手机和青少年社交媒体那样对聊天机器人形成抵制运动。
MIT 研究者系统评估“算法单一化”的批评:系统性排斥等论点不成立,但信息回声室会抑制探索,集成算法可部分弥补
MIT 的 Brian Hedden 与 Manish Raghavan 在《Philosophical Perspectives》上系统评估了针对“算法单一化”(同一领域所有决策由同一算法做出)的若干主要批评,认为系统性排斥等论点并不成立,并用数学证明单一化倾向于形成信息回声室、抑制探索,同时通过一系列招聘情境模拟显示把多个算法打包成“集成算法”有时可克服这一局限,使单一化表现不逊于甚至优于多算法并存。
研究者逆向解析Meta Pixel配置,发现健康网站98.4%沿用默认追踪、Core Setup仅覆盖34.3%且可被哈希URL绕过
该研究提出PixelConfig差分分析框架,通过代码补丁重放与开发者账号对照实验逆向解析Meta Pixel配置,并借助Internet Archive的Wayback Machine对2017至2024年间18K健康网站与top-10K对照网站的配置做纵向比较,发现自动事件与第一方Cookie等默认开启的追踪功能采用率高达98.4%,健康网站上出现与预约就诊及特定疾病(如勃起功能障碍)按钮点击相关的潜在敏感信息追踪,而Core Setup等限制功能在健康网站采用率为34.3%、对照网站为8.7%,且启用后仍可被绕过。
NTU团队发现说话人验证的EER无法追踪人类听感相似度,改用嵌入有效维度后对齐相关系数从0.08升至0.74
该研究在VoxSim的16,905对不同说话人语音对上建立人类感知对齐指标,系统比较五种模型条件下七种训练目标,发现验证准确率(EER)与人类相似度判断不相关,而嵌入空间的有效维度与感知对齐呈约-0.95的秩相关,并在ECAPA-TDNN上通过维度瓶颈把AM-Softmax的对齐相关系数从0.08提升到0.74。
第 2 页 · 当前显示 10 项