跳到主要内容

人文与社会科学

89 条内容

  1. arXiv

    人权值多少钱?ECtHR-NPD:预测非金钱损害赔偿金额的基准

    该工作构建了 ECtHR-NPD,一个包含 14,575 份欧洲人权法院判决、以名义欧元记录案件级非金钱损害赔偿(NPD)金额的基准,采用按时间划分的训练/验证/测试集与 ID/OOD/Challenging 三种诊断视图,并系统评测了常数预测器、梯度提升树、检索方法、微调编码器语言模型、提示式解码器语言模型与知识增强智能体六类方法,结果显示最复杂的语言模型与智能体方法并未稳定超越最强的特征基线,所有方法族在识别零赔偿案件与校准高额赔偿上都表现困难。
  2. arXiv

    PersonaPath:面向知识中心的个性化学习路径规划基准

    该工作提出知识中心(KC)个性化学习路径规划任务,并构建 PersonaPath 基准,将 2,000 个细粒度学习者画像与覆盖 77 个学科、347 本教材、1,751 个单元、4,092 个概念的分层知识图谱配对,用于评测大语言模型在给定学习者画像、掌握状态与先修知识结构下决定下一步应学哪本教材、哪个单元、哪个概念的能力;对代表性大模型的评测显示,最强模型在基础教育场景的最终通过率仅为 29.5%,且主要瓶颈在于适配性,没有任何模型在针对个体学习者定制路径方面超过 44.7%。
  3. arXiv

    可解码但被错误路由:稀疏特征揭示视觉语言模型在有害模因检测中的读出缺口

    该研究用稀疏自编码器、角色条件探针、因果干预与恢复实验,在 Gemma-3 与 Qwen3.5 上跨六个有害内容基准(并补充西班牙语与印地语-英语混合语评估)区分“模型未表征证据”与“已表征但未路由到输出”两种失败,发现稀疏读出在全部六个二分类任务上均优于原生预测(Qwen 平均 0.740 对 0.432,Gemma 从 0.532 升至 0.714),探针判别方向与输出路由方向可分离,仅校准的路由恢复平均缺口的 93.3%,探针蒸馏 LoRA 可改善原生预测但共享多任务适配带来负迁移,且信号超出英语、不能仅由所提供 OCR 解释、并依赖成对视觉证据。
  4. arXiv

    TeleAntiFraud 2.0:可刷新、基于画像、以音频为载体的电信诈骗检测基准

    该工作提出 TeleAntiFraud 2.0,一个以月度冻结快照形式组织的可刷新中文电话音频基准,通过混合树反诈生成流水线把网络诈骗案情摘要转化为共享情境、仅在带标签行为处分叉的诈骗与近域合法姊妹对话,并渲染为角色匹配语音;每个冻结集含 900 通中文电话(600 诈骗、300 近域非诈骗),受控文本实验显示三类分类器在无关或普通负例上达到完美 Macro-F1,而在近域姊妹负例上降至 0.65–0.68,全量音频与 ASR+LLM 评测进一步揭示类别先验捷径、预测坍缩与快照敏感性。
  5. arXiv

    面向低资源语言的自动化NER标注纠错可扩展框架

    该工作提出一个多步骤框架,先用ChatGPT-4o做词切分纠正、再用词频阈值≥3的实体词典做上下文无关的实体补全,最后以基于频率的迭代自训练配合logits概率阈值与自注意力90百分位双阈值筛选伪标签、并用多语言XLM-RoBERTa-large按F1挑选候选,在乌尔都语MK-PUCIT、Shahmukhi(西旁遮普语)与信德语SiNER三个人工复核的验证/测试集上,微调XLM-RoBERTa-large后测试集micro-F1分别提升3.96、1.40、1.44个点,同时报告ChatGPT-4o零样本/少样本NER的表现低于有监督模型。
  6. Research Square

    LLM 用于开放式调查文本分析:人类与 GPT-5 在归纳式内容分析上的表现比较

    本研究以欧洲博士生调查中六个开放题、共 903 条回答为材料,让五名人类编码者与 GPT-5.4 按同一套归纳式内容分析流程分别生成编码与主题,用调整兰德指数(ARI)衡量一致性,结果显示人机在编码层面的平均一致性为 0.61、主题层面为 0.54,接近人类内部(0.68)与模型内部(0.76)的一致性水平,且各变量间一致性差异较大,低内部一致性总伴随低跨主体一致性。
  7. 发表出处待核验

    当AI说“我也经历过类似的情况”:类同伴照护支持中的合成亲身经历

    该研究以阿尔茨海默病及相关痴呆(ADRD)家庭照护者为情境,结合在线社区中的人类同伴支持对话与三个大语言模型(LLaMA、GPT-4o-mini、MedGemma)在“类同伴”提示下生成的回应,通过心理语言学分析与质性分析比较人类同伴与AI如何使用个人叙事,发现人类同伴回应中第一人称与过去时导向语言显著多于类同伴AI回应,并归纳出人类同伴支持中七类个人叙事,指出AI常能复现其中的情感工作却可能虚构经历依据,从而提出“叙事真实性差距”与“合成亲身经历悖论”。
  8. ACM Journal on Computing and Sustainable Societies

    提示的不可承受之轻:设计教育中使用生成式AI的环境影响批判性反思

    该论文以2023年一场有49名学生参与的研讨会为动因案例,批判性地反思了设计教育中使用生成式AI的能源成本,并提出五组替代立场及相关行动,以支持在设计教育中有意识地使用生成式AI。
  9. JMIR Formative Research

    焦虑青年对生成式AI的问题性依赖:一例病例报告

    本病例报告描述一名二十多岁、患有广泛性焦虑障碍与重性抑郁障碍、既往社会与职业功能良好的女性,逐渐对ChatGPT形成功能性依赖,将撰写邮件、解读社交互动、预测未来与做决定等日常认知和人际任务外包给AI,并在独立完成这些任务时愈发不适,作者以I-PACE模型刻画这种认知卸载、独立判断信心下降与思维外化的模式,并提示AI的无限可及性可能强化寻求安慰行为、削弱对不确定性的耐受。
  10. Figshare

    《制度窗口:合同法如何约束生成式AI下人类后备能力的责任信号》复现包(v1.3.1.1)

    该复现包为Bauer(2026)的论文提供完整可验证材料:论文研究当生成式AI使产出本身不再具有信息量时,责任承诺何时仍能证明提供方保留了人类后备能力,并用四项法律原语把公布的责任上限与约定赔偿条款映射为留存风险,给出低类型在零处混同、中间类型在锚定于F的日程上分离、高类型可能在顶棚处混同的消息集合{0}∪[F,C],以及在法律移除零风险区间时分离从最低类型开始的结果。

第 8 页 · 当前显示 10 项