arXiv 2026年10月5日该工作提出一个以仿真为依托的视觉语言模型框架,用固定Blender映射把2D野火仿真自动转换为带标签的视频片段,并以此构建可复用的多模态记忆,供免训练多智能体VLM系统检索参考片段、调和视觉与记忆预测并生成结构化野火报告;在留出的生成片段上,视频记忆的四标签精确准确率为51.5%,直接VLM查询为22.6%,纯文本记忆为16-17%,完整系统在六个仿真器派生报告字段上达到77.3%准确率,并通过组件消融、跨生成器测试和三次真实无人机评估考察检索、报告、生成器变化与可观测监测任务。该工作提出一个以仿真为依托的视觉语言模型框架,用固定Blender映射把2D野火仿真自动转换为带标签的视频片段,并以此构建可复用的多模态记忆,供免训练多智能体VLM系统检索参考片段、调和视觉与记忆预测并生成结构化野火报告;在留出的生成片段上,视频记忆的四标签精确准确率为51.5%,直接VLM查询为22.6%,纯文本记忆为16-17%,完整系统在六个仿真器派生报告字段上达到77.3%准确率,并通过组件消融、跨生成器测试和三次真实无人机评估考察检索、报告、生成器变化与可观测监测任务。仿真到代理的VLM框架:视频记忆将野火四标签准确率从22.6%提升至51.5%,完整系统报告字段达77.3%该工作提出一个以仿真为依托的视觉语言模型框架,用固定Blender映射把2D野火仿真自动转换为带标签的视频片段,并以此构建可复用的多模态记忆,供免训练多智能体VLM系统检索参考片段、调和视觉与记忆预测并生成结构化野火报告;在留出的生成片段上,视频记忆的四标签精确准确率为51.5%,直接VLM查询为22.6%,纯文本记忆为16-17%,完整系统在六个仿真器派生报告字段上达到77.3%准确率,并通过组件消融、跨生成器测试和三次真实无人机评估考察检索、报告、生成器变化与可观测监测任务。该工作提出一个以仿真为依托的视觉语言模型框架,用固定Blender映射把2D野火仿真自动转换为带标签的视频片段,并以此构建可复用的多模态记忆,供免训练多智能体VLM系统检索参考片段、调和视觉与记忆预测并生成结构化野火报告;在留出的生成片段上,视频记忆的四标签精确准确率为51.5%,直接VLM查询为22.6%,纯文本记忆为16-17%,完整系统在六个仿真器派生报告字段上达到77.3%准确率,并通过组件消融、跨生成器测试和三次真实无人机评估考察检索、报告、生成器变化与可观测监测任务。