Featured image of post 微软 Agent Framework 走向生产:Harness 与 Hosted Agents 补上运行时拼图

微软 Agent Framework 走向生产:Harness 与 Hosted Agents 补上运行时拼图

微软把代理框架从构建库推进到可治理运行时。

从 SDK 到生产运行时

从 SDK 到生产运行时

微软已正式发布 Agent Framework Harness 和 Foundry Hosted Agents,标志着 Agent Framework 从“帮助开发者构建代理的 SDK”升级为可受支持的生产运行时。该框架在 2026 年 4 月 2 日发布 1.0 版本;随后在 6 月 2 日至 3 日的 Build 2026 上,Agent Harness、GitHub Copilot SDK 与 Claude Agent SDK 连接器,以及多代理编排模式进入稳定发布阶段。

这次发布的核心变化是:平台团队不只获得一个库,而是获得一套能运行、管理和治理代理的基础设施。Harness 以单个二进制文件形态运行,可覆盖本地开发、容器和托管部署环境;Foundry Hosted Agents 则提供托管部署目标,并按使用量计费。

Harness 为什么成为关键层

此前,微软将 Semantic Kernel 与 AutoGen 的方向整合进 Agent Framework,并在 1.0 后把两个前身项目转入维护模式。新的问题随之出现:代理在哪里执行、能访问哪些资源、行为如何进入现有观测和策略系统。Harness 正是回答这些问题的运行时层。

用一句话解释,Harness 是包裹大模型的执行环境:模型负责生成和推理,Harness 负责让它调用工具、保存历史、处理多步骤任务并在必要时停止。微软首席软件工程师 Wes Steyn 的观点是,仅有模型只能生成文本;要让它持续完成任务,就需要运行时封装。

本次发布默认启用的能力包括:

  • 函数调用、历史调用持久化、上下文压缩;
  • 带计划与执行模式的待办事项列表、文件记忆、技能;
  • 网络搜索、工具审批、内置 OpenTelemetry。

OpenTelemetry 是一套开源可观测性标准,用于统一采集日志、指标和链路追踪。Shell 工具、文件访问、后台子代理和自动循环仍属可选能力,启用时会发出警告。开发者只需提供聊天客户端、操作指南和工具,Harness 通过一次调用处理规划、持久化、压缩、审批、搜索和遥测等流程。

工程复杂度不在“模型”本身

微软强调 Harness,并非只是产品包装。MBZUAI 旗下 VILA 实验室在 2026 年 4 月论文《深入解析 Claude Code》中给出一个参考样本:研究人员分析了 3 月 31 日短暂曝光源映射包所包含的 Claude Code v2.1.88 TypeScript 源码,统计出 1884 个文件、约 512000 行代码。其估算显示,约 98.4% 属于 Harness 基础设施、权限、上下文、沙箱、工具路由和恢复机制,AI 决策逻辑约 1.6%

研究者也提醒,这只是对泄露包的代码行分类,包含生成与压缩代码,并非全面审计。但趋势仍有参考价值:Codex CLI、Aider 等独立编码代理也呈现相似结构。换言之,代理系统的难点往往不只是“模型会不会想”,而是“系统能否安全、可控、可恢复地执行”。

早期基准测试也指向同一结论。微软人工智能首席架构师 Aqib Sherwani 对比 Agent Framework 与 GitHub Copilot SDK 时固定模型参数,并先用确定性模拟测试隔离差异。他的总结是“推理相同,工程实现不同”:两者用相同步数得到相同答案,但运行时差异明显。关键例子是循环控制:Agent Framework 在 40 次往返后自行终止并返回达到限制;关闭主机端停止控制后,Copilot SDK 可运行到 300 次仍不自行停止。也就是说,有的 Harness 把刹车内置在循环中,有的则依赖宿主系统提供刹车

连接器、编排与治理合流

Agent Framework 的连接器让 GitHub Copilot SDK、Claude Agent SDK 可被纳入同一编排体系,无需为委托任务编写自定义适配器。每个编码代理仍运行自己的自主循环,但会作为受管控成员与 Azure OpenAI、Anthropic 或自定义代理协同工作。

关键在治理:这些连接器遵循代理集群设置的身份、内容安全和可观测性策略。编码代理流量会进入相同的 OpenTelemetry 追踪和 Foundry 仪表板,而不是形成独立访问模型。治理问题也因此从“代理能做什么”转向“谁运行了它、依据什么策略、追踪信息流向哪里”。

稳定发布的编排模式包括顺序管道、并行协作,以及源自微软研究院 Magentic-One 的 Magentic 模式。其 2024 年评估报告显示:GAIA 为 38%,AssistantBench 为 27.7%,WebArena 为 32.8%。微软称前两个基准在统计上与当时最先进水平相当,WebArena 也具竞争力。由于这些模式共享 API,团队可调整协调风格而不必重写代理代码。

行业走向:代理平台进入“运行时竞争”

这次发布表明,企业级代理竞争的重心正在从 SDK 和模型调用,转向运行时、治理、观测和成本控制。对于平台团队而言,最重要的不是多一个创建代理的接口,而是一个受支持的 Harness、按量计费的托管目标,以及能把第三方编码代理纳入统一策略的控制平面。

短期看,.NET 与 Python 版本已在 GitHub 发布,会降低团队试点门槛;长期看,代理系统会越来越像云原生应用:模型只是核心组件之一,真正决定能否上线的是权限边界、审计链路、停止机制和编排方式。微软此次把 Harness 和 Hosted Agents 正式推向生产,正是在为这一层标准化基础设施抢位。