ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

HarnessDev:LLM 能否创建和发展自己的智能体驾驭?

HarnessDev:LLM 能否创建和发展自己的智能体驾驭? 26年9月来自字节跳动 Seed 团队、新加坡科技设计大学 SUTD、M-A-P和佐治亚理工学院和TokenWave.AI等机构的论文“HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?”。1. 论文速览与核心贡献提出了 HARNESSDEV 基准测试,将大模型(LLM)评估的对象从“单次任务的输出答案”转移到“可运行、持久化且可复用的 Agent 执行脚手架(Harness Infrastructure)”。如图1所示HarnessDev涵盖Harness开发的两个阶段。在创建阶段,创建者基于一个功能较弱但可运行的初始版本和少量开发用例构建完整的Harness。在演进阶段,创建者利用下游执行反馈不断改进其持久化的Harness。这两个阶段都评估跨任务持久化的可运行基础设施,而非一次性任务输出。2. 研究背景与动机(Why Harness?)随着 AI Agent 从实验原型走向生产落地(如 Claude Code, OpenHands, Codex CLI 等),决定 Agent 能力的不再仅仅是模型本身的权重,还有包裹模型的模型外执行基础设施(Agent Harness)。Harness 的关键作用:负责管理执行循环(Execution loop)、工具使用(Tool policy)、上下文管理(Context)、持久化状态(State)、失败恢复(Lifecycle/Recovery)和结果验证(Verification)。论文发现:在不改变模型权重的前提下,将 GPT-5 放入 Terminus 2 脚手架中时 Terminal-Bench 求解率为 35.2%,而换入 Codex CLI 脚手架后性能升至 49.6%。现有基准痛
返回列表