TensorRT Edge-LLM 在 Jetson AGX Thor 上加速边缘智能体推理

NVIDIA Generativ2 天前

AI 智能体正在从云端数据中心走向车辆、机器人和其他边缘设备。与只回答单个提示词的聊天机器人不同,智能体通常需要执行一系列步骤:选择工具、评估工具返回结果,并在不断变长的对话上下文中继续推理。

这类工作流对边缘推理提出了更高要求。模型不仅要快速生成 token,还要在有限算力、功耗和内存条件下处理更长上下文与多轮推理。

根据发布内容,TensorRT Edge-LLM 在 Jetson AGX Thor 上完成了 MLPerf Edge Agentic Benchmark,并实现了 6.4 倍速度提升。

这表明边缘侧大模型推理优化正在从传统单轮问答场景,进一步扩展到更复杂的智能体任务场景。对于自动驾驶、机器人和本地化 AI 应用来说,低延迟、高吞吐的边缘推理能力将变得更加关键。

评论

请登录后发表观点

暂无数据