跳到主要内容
返回时间线
arXiv来源发表:

SciMuse 用 5800 万篇论文知识图谱加 LLM 生成个性化科研想法,100 余位研究组长对 4400 余条想法打分均值仅 2.40(5 分制),但 24.9% 获 4 分或 5 分

核心概要

作者提出 SciMuse,用包含 5800 万篇论文的知识图谱与大语言模型生成个性化科研想法,并邀请超过 100 位横跨自然科学到人文领域的研究组长对 4400 余条想法按兴趣程度评分,结果显示专家评分整体温和(5 分制均值 2.40,最常见评分为 1),24.9% 的想法获 4 分或 5 分;用知识图谱选出的概念对并未比仅用标题的 GPT 基线提升专家兴趣评分,高引用预测的概念对甚至呈现弱趋势(1.94σ)低于随机概念对;但图谱特征可用于控制想法属性,且基于图谱特征的监督神经网络与基于 LLM 的零样本排序都能预测想法兴趣度。

Source-provided article image: Generating Interesting Scientific Ideas using Knowledge Graphs and LLMs: Evaluations with 100 Research Group Leaders
Figure 1 ·

Figure 1: Overview of the four main components of SciMuse : an evolving impact-augmented knowledge graph, a method for generating personalized research suggestions, a large-scale expert evaluation across diverse scientific fields, and methods for predicting the scientific interest of research suggestions.

arXiv

深度剖析

论文提出 SciMuse,一个结合 5800 万篇论文知识图谱与大语言模型的科研想法生成系统,可产出个性化研究想法。 相对于仅依赖 LLM 或文献检索的既有做法,该工作把大规模知识图谱作为概念来源接入生成流程,并明确以“个性化”为生成目标。 摘要给出知识图谱规模(5800 万篇论文)与所用组件(知识图谱加 LLM),属于系统描述层面的证据。

超过 100 位来自自然科学到人文领域的研究组长对 4400 余条个性化想法按兴趣程度评分,整体评分温和:5 分制均值 2.40,最常见评分为 1,同时 24.9% 的想法获 4 分或 5 分。 该工作提供了跨学科、由研究组长这一高专业度群体完成的大规模专家评分数据集,把“AI 生成想法是否有意思”从推测变为可量化的专家判断。 证据来自超过 100 位专家对 4400 余条想法的评分,样本规模与评分者身份在摘要中明确给出,属于大规模专家评估证据。

用知识图谱选出的概念对并未比仅用标题的 GPT 基线提升专家兴趣评分,高引用预测的概念对甚至呈现弱趋势(1.94σ)低于随机概念对。 这一对照结果直接检验了“图谱选概念能提升想法质量”的假设,并给出了与直觉相反的方向性信号。 证据来自与标题-only GPT 基线和随机概念对的对照比较,其中高引用预测对的差异以 1.94σ 的弱趋势形式报告。

图谱特征可用于控制想法的属性,且基于图谱特征的监督神经网络与基于 LLM 的零样本排序都能预测想法兴趣度。 在生成质量未因图谱概念而提升的情况下,该工作把图谱特征转用于可控性与兴趣度预测,并借助上述专家评分数据集训练与验证预测方法。 证据来自两类预测方法(监督神经网络与零样本 LLM 排序)在同一专家评分数据集上的表现,摘要未给出具体预测精度数值。

启示与展望

该结果面向希望用 AI 辅助科研选题的研究者与工具开发者:SciMuse 的生成流程与图谱特征控制、兴趣度预测方法可在拥有类似论文知识图谱与专家评分数据的场景中复用。评估设定为研究组长对个性化想法的兴趣评分,因此结论适用于“专家主观兴趣”这一指标,而非想法的可执行性、正确性或最终科研产出。

摘要未给出兴趣度预测的具体精度、监督神经网络与零样本 LLM 排序之间的比较结果,也未说明 1.94σ 弱趋势的统计细节;此外,专家评分均值 2.40 与 24.9% 高分想法并存,提示想法质量分布可能高度不均,读者若需据此判断方法优劣,仍需查阅正文中的图表与统计检验。

来源