arXiv 2609.01736
PAPER 11 · AGENT HARNESS · TOOL USE

HEART

让工具适配模型,而不是让模型适配工具:自然语言工具原语 + 2.5 万函数仓库

Haibo Jin 等 · arXiv 2609.01736 · 2026-09

arXiv 2609.01736 · 投稿 2026-09 · 中文版收录 2026-09-03

CITE

与其让模型迁就工具,不如让工具学会说人话。

— 本站导读
LLM 工具调用有两大顽疾:工具输出类型与 API schema 不兼容导致多步多轮推理脆弱,工具目录一大性能就崩。HEART 的答案是角色反转:Tool Primitive 用 LLM 包装每个工具、以自然语言为调用接口,schema 解析全部在内部完成;ToolFace 仓库收纳 25,519 个函数,推理时语义检索按需取用;Planner–Router–Verifier 三 agent 流水线负责规划、分派与四标准验证。8B 骨干在五个基准上平均超 SFT 模型 10%、超 GPT-5.4 / Claude-4.6-Sonnet / Gemini-3.1-Pro 6%,API 成本最高降 85%——且结构上免疫 prompt injection

解决什么问题

现有工具调用方法要求模型直接适配 API 语言:调用方要处理原始 schema、格式化参数、串接输出类型,多步嵌套调用一环断裂全盘皆输;工具目录从 8K 增至 120K token 时,准确率下降 7%–85%。SFT 微调路线在嵌套调用上几乎全灭(多个模型 Full Acc. 为 0)。缺的是把「工具使用」从模型能力问题转化为harness 结构问题的方案。

创新点

01Tool Primitives:自然语言作为工具接口CORE

每个工具由共享基础 LLM(不同 schema 条件化)包装成 Primitive:接收自然语言请求,内部完成 schema 解析、参数绑定与执行。三个设计属性均有实验支撑——自然语言调用(消融后 ToolBench Pass Rate 75.1→16.1)、工具间 LLM-to-LLM 通信(NESTFUL 嵌套调用上 SFT 模型 Full Acc. 崩至 0.00、DeepSeek-V3 仅 0.09,HEART 达 0.44)、执行隔离(失败作为信号呈报 Verifier,错误可定位)。

02ToolFace:2.5 万函数的集中式工具仓库

把工具存储与模型上下文解耦:25,519 个工具(ToolBench 16,464 个 live API、ACEBench 4,538 个双语 API、NESTFUL 数学/编码工具等)以 schema–function 对存储,推理时对 schema 描述符做语义检索、只取相关工具,上下文里无需枚举原始 API schema。

03Planner–Router–Verifier 反馈恢复闭环

Planner 做意图分析 + 信息充分性检查,不足时先向用户定向澄清再规划 K 步调用序列;Router 负责每步参数映射与工具分派;Verifier 按四个独立标准(任务完成、参数一致性、执行有效性、约束满足)评估结果,任一失败即生成结构化诊断回传 Planner 再规划(预算 B=3)。五阶段流水线把工具调用变成可迭代、可恢复的结构化推理。

关键结果

骨干为 Qwen3-8B(四个角色共用),在 ToolBench / NESTFUL / τ²-Bench / ACEBench / BFCLv4 五个基准上对比 SFT 模型与三个前沿商用模型。最直观的是 50 个真实世界任务:

50 个真实任务完成率(%)
22
商用均值
20
GPT-5.4
24
Claude-4.6
84
HEART
ToolBench 平均 Pass(%)
67.3
最强商用
71.9
最强 SFT
75.1
HEART

局限

DISCUSSION选中正文任意文字 → 点「✎ 批注」即可带原文引用发言 · 需 GitHub 登录