跳到主要内容
返回时间线
arXiv来源发表:

Omni-IO Skills 用 27 个技能把 GPT-5.6 Sol 与 Claude Sonnet 5 的多模态输入支持率从约 40% 提到 100%

核心概要

该工作提出即插即用的 Agent Harness「Omni-IO Skills」,通过分层 Skills、标准化多模态执行接口、依赖感知编排与持久化 Asset Registry,在不改动宿主智能体推理核心的前提下,把多模态工作流表示为 Declare Execution Graphs 并调度执行;在 UniM-90 上,GPT-5.6 Sol 与 Claude Sonnet 5 的输入支持率分别从 40.00% 和 38.89% 提升到 100%,相对 Semantic–Quality Coupled Score 从 26.99 升到 74.94、从 27.82 升到 77.78,Strict Structure Score 达到 100.00 与 99.78。

AI-generated editorial illustration: Omni-IO Skills: Harnessing Your Agent Omni-Native

深度剖析

提出并实现了一个即插即用的 Omni 模态 Agent Harness,把通用智能体扩展为 omni-native 系统而无需重训宿主模型。 此前路线要么把能力增长绑定到昂贵的基座模型更新,要么把专家模型与工具拼装起来却未解决过程、依赖、中间资产与跨轮修订如何协调;该工作把统一性放在任务执行与资产流层面。 论文以四层架构(Skill Entry、MCP Tool Service、Provider and Configuration、Asset Registry)与两个宿主智能体的对照实验支撑这一表述。

用分层 Skills 组织多模态能力:19 个 Atomic、2 个 Expert、6 个 Scenario,共 27 个 Skills,覆盖 38 个代表性任务、七种产物模态与理解、生成、推理、检索四类能力族。 既有 Agent Skills 工作覆盖通用专家任务、计算机使用与视觉智能体,Omni 智能体研究则单独确立协调模态专家的价值,二者交集在多资产执行与持久资产状态上尚不充分。 论文给出完整技能目录(A1–A19、E1–E2、S1–S6)及任务到技能的映射说明。

以 Declare Execution Graph 表达控制与数据依赖,按 Wave 并发调度独立节点,节点失败时取消其后继而独立分支继续执行,成功输出写入 Asset Registry 供下游与跨轮复用。 把依赖感知编排、失败隔离与持久资产状态纳入同一运行时,使工作流不绑定特定服务或文件路径,Provider 与模型可替换而 Skill 描述与图结构不变。 论文给出图表示、校验(依赖可解析且无环)、Wave 调度规则、失败处理与注册表原子写入与文件锁机制,并以产品推广案例展示四波执行与跨轮仅重跑落地页。

在 UniM-90 上,两个宿主智能体的输入支持率均升至 100%,相对 SQCS 提升 47.95 与 49.96 个百分点,结构指标接近满分。 作者强调增益是同一宿主在加载 Harness 前后的组内对比,且加载后的绝对 SQCS(74.94、77.78)高于 Base Agent 仅在其较窄支持子集上测得的 67.49 与 71.53。 实验为 90 个实例的受控子集,覆盖文本、图像、音频、视频、文档、代码与 3D 及其交错组合;作者明确不把跨智能体分差解读为模型能力排名。

启示与展望

该结果面向需要跨模态输入输出与多资产交付的应用场景,例如教育分享、办公文档、求职材料、活动物料与游戏资产;适用前提是宿主智能体保留其推理与规划核心,Harness 只提供过程知识、执行接口与资产底座。对使用者而言,这意味着可以在不重训基座模型的前提下,通过替换 Provider 与配置层来更新底层模型或服务,而 Skill 描述与执行图保持不变;对研究者而言,它提供了一个把多模态能力增长与模型更新周期解耦的系统层参照。

评估集中在 UniM-90 这一 90 实例的受控子集,覆盖七种模态与交错组合,但相对指标与绝对指标的口径不同,读者需留意相对 SQCS 与绝对 SQCS 的差异来源。作者明确不把两个宿主之间的分差解读为模型能力排名,因此跨智能体的比较应谨慎。案例研究为定性分析,展示了一致性表现,但未给出案例层面的量化。此外,加载后的绝对 SQCS 是与 Base Agent 在其较窄支持子集上的数值相比,两者覆盖的实例范围并不相同。技能目录、任务到技能映射与部分图表位于附录,若只读正文,对 38 个任务的具体构成与选择协议的了解会受限。

来源