跳到主要内容
返回时间线
arXiv来源发表:

CodePori 用多智能体系统自动生成代码,并通过问卷调查评估其在真实软件开发中的可用性

核心概要

该研究分两阶段开展:先构建名为 CodePori 的多智能体系统以自动化代码生成,再通过问卷调查让参与者评估智能体在自主软件开发任务中的表现,结果显示基于大语言模型的多智能体系统在自主代码生成上具有潜力,但其成功整合需要应对短期记忆限制、幻觉和代码异味等具体挑战,并纳入以从业者为中心的视角。

Source-provided article image: CodePori: Large-Scale System for Autonomous Software Development Using Multi-Agent Technology
Figure 1 ·

Figure 1: Multi-agent system and survey workflow.

arXiv

深度剖析

研究提出并构建了 CodePori,一个用于自动化代码生成的多智能体系统,作为两阶段方法中的第一阶段。 相对于以往仅在基准数据集上评估智能体的研究,该工作把系统构建与面向真实软件开发任务的评估结合起来。 论文摘要明确说明采用两阶段方法,其中第一阶段为开发 CodePori 多智能体系统以自动化代码生成;具体架构细节未在摘要中给出。

研究通过问卷调查评估智能体表现,参与者对智能体在自主软件开发任务中的表现进行评价。 以往研究多以基准数据集上的二元通过或失败结果衡量智能体,该研究改用调查方式考察实际适用性。 摘要指出研究开展了调查,由参与者评估智能体在自主软件开发任务中的表现;摘要未给出参与者人数或统计结果。

结果显示基于大语言模型的多智能体系统在自主代码生成上具有潜力,但成功整合需要应对短期记忆限制、幻觉和代码异味等具体挑战。 该结论把评估重点从基准分数转向真实世界适用性所需的条件,并强调以从业者为中心的视角。 摘要以举例方式列出短期记忆限制、幻觉和代码异味等挑战,并指出需要从业者中心视角;摘要未提供量化效应量。

研究提出应超越标准基准来评估真实世界适用性,并指出在产业界和学术界更广泛采用的新机会。 该工作把评估方法本身作为讨论对象,主张基准结果不足以反映实际可用性。 摘要明确表述需要超越标准基准评估真实世界适用性,并提到更广泛采用的机会;摘要未给出具体采用路径或数据。

启示与展望

该研究面向自动化代码生成这一真实世界软件开发任务,适用于希望了解大语言模型多智能体系统在自主软件开发中实际表现的从业者与研究者。其两阶段设计——先构建 CodePori 多智能体系统,再通过问卷调查评估智能体表现——意味着结论主要来自参与者对智能体在自主软件开发任务中表现的评价,而非来自基准数据集上的通过或失败结果。研究结论所指向的应用场景是产业界与学术界对这类系统的更广泛采用,前提是解决短期记忆限制、幻觉和代码异味等具体挑战,并纳入以从业者为中心的视角。

摘要未说明调查的参与者人数、抽样方式、评估量表或统计分析方法,也未给出 CodePori 的智能体组成与协作机制细节,因此无法判断调查结论的稳健程度。摘要以举例方式提到短期记忆限制、幻觉和代码异味,但未说明这些挑战在评估中出现的频率或严重程度。摘要提出应超越标准基准评估真实世界适用性,但未给出替代评估方案的具体设计。此外,本次可获取的文本为摘要与提交历史,正文中的图表与实验细节不在其中,若需据此复现或比较,仍需查阅全文。

来源