跳到主要内容
返回时间线
arXiv来源发表:

仿真到代理的VLM框架:视频记忆将野火四标签准确率从22.6%提升至51.5%,完整系统报告字段达77.3%

相关研究与后续进展

核心概要

该工作提出一个以仿真为依托的视觉语言模型框架,用固定Blender映射把2D野火仿真自动转换为带标签的视频片段,并以此构建可复用的多模态记忆,供免训练多智能体VLM系统检索参考片段、调和视觉与记忆预测并生成结构化野火报告;在留出的生成片段上,视频记忆的四标签精确准确率为51.5%,直接VLM查询为22.6%,纯文本记忆为16-17%,完整系统在六个仿真器派生报告字段上达到77.3%准确率,并通过组件消融、跨生成器测试和三次真实无人机评估考察检索、报告、生成器变化与可观测监测任务。

Source-provided article image: A Simulation-Grounded Agentic VLM Framework for Wildfire Monitoring and Reporting
Figure 4 ·

Figure 4: We show the effects of different multimodal embedding models on tag retrieval accuracy. From experiments, Qwen3-2B-VL gives the best retrieval accuracy in most cases which leads to our choice of it being our embedding model.

arXiv

深度剖析

提出将2D野火仿真自动转换为带标签视频片段的流程,用固定Blender映射生成与仿真器地形、燃料布局、火情活动和风场线索对齐的低细节3D代理,再由可控视频生成补充外观细节。 此前将视觉证据与物理火行为关联需要同步物理标注的真实视频,而这类数据稀缺且高保真3D仿真成本高;该流程把仿真标签与生成视频配对,形成可复用的多模态记忆。 摘要说明代理是中间表示而非精细渲染的最终场景,并报告在留出的生成片段上视频记忆达到51.5%四标签精确准确率,高于直接VLM查询的22.6%和纯文本记忆的16-17%。

构建免训练的多智能体VLM系统,检索参考片段、调和视觉与记忆预测,并输出结构化野火报告。 与直接查询VLM或仅用文本记忆相比,引入视频记忆与多智能体调和机制,使系统在仿真器派生的报告字段上获得更高准确率。 完整系统在六个仿真器派生报告字段上达到77.3%准确率,并通过组件消融评估检索与报告各部分的贡献。

通过跨生成器测试和三次真实无人机评估,考察生成器变化与可观测监测任务下的表现。 把评估从单一生成器扩展到不同生成器,并在真实无人机场景中检验可观测监测任务,补充了仿真到代理流程的适用性证据。 摘要报告了跨生成器测试与三次真实无人机评估,用于评估检索、报告、生成器变化和可观测监测任务。

启示与展望

该框架面向真实世界物理标注稀缺的野火监测场景,适用于可获取2D仿真并需要结构化报告的监测任务;其代理是中间表示而非精细渲染场景,因此结果适用于仿真器派生的标签体系与报告字段。对希望减少对同步物理标注真实视频依赖的研究者与工程团队,该工作提供了可复用的多模态记忆与免训练多智能体报告流程,并已在三次真实无人机评估中检验可观测监测任务。

摘要未说明留出生成片段的规模、四标签与六字段的具体定义、跨生成器测试所用生成器数量,以及三次真实无人机评估的任务设置与评价方式;这些信息影响对51.5%、22.6%、16-17%和77.3%等数字外推范围的判断。此外,代理作为中间表示而非精细渲染场景,其与真实火行为的对应程度仍需在更多真实场景中观察。

来源