跳到主要内容
返回时间线
NVIDIA Technical Blog来源发表:

NVIDIA 用 TensorRT Edge-LLM 在单台 Jetson AGX Thor 上跑完 MLPerf Edge Agentic 全部 1,007 轮,耗时 24 分 36 秒,比 llama.cpp 参考实现快 6.4 倍

核心概要

NVIDIA 在 MLPerf Inference v6.1 Edge Agentic 基准上,用 TensorRT Edge-LLM 在单台 128 GB 统一内存、MAXN 功耗模式的 Jetson AGX Thor 开发套件上以 SingleStream 模式运行 Qwen3.6-27B,取得 52.33 tokens/s 输出吞吐、247.12 ms 中位首 token 时延、14.68 ms 中位每输出 token 时延和 87.94% 的 BFCL 总体准确率,并在 24 分 36 秒内完成性能阶段全部 1,007 轮,比使用 Q4_K_M 量化的 llama.cpp 参考提交的 2 小时 37 分钟快 6.4 倍,其手段是 NVFP4 权重与激活量化、FP8 KV 缓存、KV 缓存与循环状态

AI-generated editorial illustration: TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor

深度剖析

该提交在单台 Jetson AGX Thor 上完成 MLPerf Edge Agentic 性能阶段的 20 段对话、1,007 轮生成,用时 24 分 36 秒,输出吞吐 52.33 tokens/s,中位首 token 时延 247.12 ms,中位每输出 token 时延 14.68 ms。 MLCommons 的 Edge Agentic 示例同时公布了同一硬件上使用 Qwen3.6-27B 与 Q4_K_M 量化的 llama.cpp 参考运行,耗时 2 小时 37 分钟;该提交把同一工作负载的时间压缩到 6.4 分之一。 结果来自 MLPerf Inference v6.1 Edge Agentic 的官方测量流程,性能阶段回放录制的软件工程智能体轨迹,并用基于 IoU 的内联准确率确认性能阶段确实在正确运行智能体;配置为温度 0、种子 42、关闭推理、并发 1。

准确率阶段使用 BFCL v4 提示(仅单轮、关闭推理),该提交取得 87.94% 的总体准确率,评估模型是否选对函数、生成合法参数、以及在不需要工具时不调用工具。 量化与推测解码通常以精度换取速度,该提交在采用 NVFP4 权重与激活、FP8 KV 缓存和树式 MTP 的同时,仍报告了 MLPerf 所要求的准确率水平。 准确率由 BFCL v4 提示在边缘设备上以单轮、关闭推理的设置测得,文中说明这一设置是为在边缘设备上平衡准确率与评估时间。

运行时识别可复用的提示前缀并恢复其缓存的注意力 KV 页;由于 Qwen3.6 采用混合架构,运行时还恢复继续执行所需的循环状态和部分 KV 页状态,只对对话新增后缀做预填充。 该工作把 KV 缓存与循环状态复用扩展到混合架构的智能体轨迹,使缓存复用与树式 MTP 互补:前者降低生成开始前的成本,后者减少生成期间目标模型的步数。 在该工作负载上约 96% 的提示 token 由热缓存服务,运行时在全部 13.6M 提示 token 中只预填充约 0.5M。

除传统线性 MTP 外,TensorRT Edge-LLM 实现了树式 MTP:把高概率候选组织成树,目标模型一次前向验证候选并接受匹配路径,若多个候选被接受则一次推进多个 token。 MLPerf 服务器配置使用 8 个草稿步、每个草稿深度取前 2 个候选、16 节点验证树;相比 3 个草稿步的线性 MTP,树式 MTP 在该工作负载上可再获得约 40% 的解码性能提升。 文中说明树式验证对函数调用有用,因为工具名、JSON 语法和常见参数结构往往可预测,而多分支可保留单个参数值的多种可能;草稿参数可在启动服务器时调整。

启示与展望

该结果面向在单台 Jetson AGX Thor 开发套件(128 GB 统一内存、MAXN 功耗模式、SingleStream、并发 1)上部署 OpenAI 兼容模型端点的团队,适用于需要长上下文与工具调用的边缘智能体场景。它使开发者能够从已发布的校准 Qwen3.6-27B NVFP4 检查点起步,或在任意开发系统上完成一次训练后量化后部署,并按发布分支中的导出设置、TensorRT 引擎构建命令、服务器配置与 MLPerf 客户端配置复现该提交。

准确率阶段采用 BFCL v4 的单轮、关闭推理设置,这是为在边缘设备上平衡准确率与评估时间而做的取舍,因此多轮工具调用下的准确率表现仍是开放问题。树式 MTP 的约 40% 额外解码增益是在该工作负载上相对 3 个草稿步线性 MTP 的比较,其他工作负载与草稿参数下的表现有待观察。此外,本文为完整正文,但未给出功耗、能效或与云端部署的对比数据,这些方面尚待补充。

来源