arXiv 2609.01736
PAPER 11 · AGENT HARNESS · TOOL USE
HEART
让工具适配模型,而不是让模型适配工具:自然语言工具原语 + 2.5 万函数仓库
Haibo Jin 等 · arXiv 2609.01736 · 2026-09
arXiv 2609.01736 · 投稿 2026-09 · 中文版收录 2026-09-03
CITE
与其让模型迁就工具,不如让工具学会说人话。
— 本站导读
LLM 工具调用有两大顽疾:工具输出类型与 API
schema 不兼容导致多步多轮推理脆弱,工具目录一大性能就崩。HEART 的答案是
角色反转:Tool Primitive 用 LLM 包装每个工具、以自然语言为调用接口,schema 解析全部在内部完成;ToolFace 仓库收纳 25,519 个函数,推理时
语义检索按需取用;Planner–Router–Verifier 三 agent 流水线负责规划、分派与四标准验证。8B 骨干在五个基准上平均超 SFT 模型 10%、超 GPT-5.4 / Claude-4.6-Sonnet / Gemini-3.1-Pro 6%,API 成本最高降 85%——且
结构上免疫 prompt injection。
解决什么问题
现有工具调用方法要求模型直接适配 API 语言:调用方要处理原始 schema、格式化参数、串接输出类型,多步嵌套调用一环断裂全盘皆输;工具目录从 8K 增至 120K token 时,准确率下降 7%–85%。SFT 微调路线在嵌套调用上几乎全灭(多个模型 Full Acc. 为 0)。缺的是把「工具使用」从模型能力问题转化为harness 结构问题的方案。
创新点
01Tool Primitives:自然语言作为工具接口CORE
每个工具由共享基础 LLM(不同 schema 条件化)包装成 Primitive:接收自然语言请求,内部完成 schema 解析、参数绑定与执行。三个设计属性均有实验支撑——自然语言调用(消融后 ToolBench Pass Rate 75.1→16.1)、工具间 LLM-to-LLM 通信(NESTFUL 嵌套调用上 SFT 模型 Full Acc. 崩至 0.00、DeepSeek-V3 仅 0.09,HEART 达 0.44)、执行隔离(失败作为信号呈报 Verifier,错误可定位)。
02ToolFace:2.5 万函数的集中式工具仓库
把工具存储与模型上下文解耦:25,519 个工具(ToolBench 16,464 个 live API、ACEBench 4,538 个双语 API、NESTFUL 数学/编码工具等)以 schema–function 对存储,推理时对 schema 描述符做语义检索、只取相关工具,上下文里无需枚举原始 API schema。
03Planner–Router–Verifier 反馈恢复闭环
Planner 做意图分析 + 信息充分性检查,不足时先向用户定向澄清再规划 K 步调用序列;Router 负责每步参数映射与工具分派;Verifier 按四个独立标准(任务完成、参数一致性、执行有效性、约束满足)评估结果,任一失败即生成结构化诊断回传 Planner 再规划(预算 B=3)。五阶段流水线把工具调用变成可迭代、可恢复的结构化推理。
关键结果
骨干为 Qwen3-8B(四个角色共用),在 ToolBench / NESTFUL / τ²-Bench / ACEBench / BFCLv4 五个基准上对比 SFT 模型与三个前沿商用模型。最直观的是 50 个真实世界任务:
- NESTFUL 嵌套调用五项指标全部第一(Full Acc. 0.44,超 GPT-5.4 +4~5%);τ²-Bench 所有领域所有 Passₖ 最高,Telecom Pass₄ 提升超 50%——迭代再规划在长多轮交互中持续见效。
- 结构性安全:工具 schema 存于 ToolFace、经 Primitive 调用,从不进入 LLM 输入 prompt——prompt injection 攻击下 ASR 为 0.0%,而三个商用模型高达 70–82%。
- 成本:token 消耗虽高,但 8B 骨干使 API 成本比 GPT-5.4 最高降 7.4×;「推荐 vs 执行」的分野是真差距——商用模型能检索选项,无法代替用户执行操作。
局限
- 多 agent 流水线 token 消耗与延迟偏高(Telecom 约 38s),延迟敏感场景需合并角色。
- ToolFace 的 schema 依赖人工撰写保证接口质量,向新领域扩展需要人工整理,自动化 schema 生成是未来方向。
- 鲁棒性评估仅覆盖工具选择阶段的 prompt injection,被污染的工具输出等更广威胁模型未研究。