华尔街把Agent拉进真实办公场景
8月19日消息,华尔街投行杰富瑞分析师近日对8款全球主流AI Agent进行真实办公任务测试,阿里“千问办公”在综合评分中排名第一,超过Claude Cowork、Codex等产品。这次测试的看点不只是哪款Agent更聪明,还在于评估方式从单纯问答转向了更接近企业日常工作的端到端任务。
AI Agent通常指能够理解目标、调用工具并连续执行步骤的人工智能应用。相比聊天机器人只回答问题,Agent更强调“把事做完”:例如查资料、读文件、生成文档、控制浏览器或制作内容。杰富瑞此次设置的任务覆盖了办公室常见但并不简单的工作链路,因此更能体现模型能力、工具调用能力和产品工程能力的综合水平。
五类任务检验“能不能落地”
据报告,此次实测共包含5项真实办公任务:
- 基于多份文件撰写公司年报摘要;
- 联网查找并比较公司经营数据;
- 操作真实桌面浏览器完成信息检索和文档生成;
- 根据数据制作英文PPT;
- 参考图片生成营销海报。
这些任务覆盖文本理解、联网检索、桌面操作、数据整理和多模态生成等环节。多模态是指模型同时处理文本、图片等不同类型信息的能力。测试结果显示,千问办公整体表现较均衡,在复杂办公任务、网页浏览器控制和多模态内容生成等场景中表现突出,并且是唯一一个在所有测评维度均获得90分以上的Agent产品。
这说明Agent竞争已经不只是“答得是否正确”,而是要看它能否在长流程中保持稳定。企业办公任务往往包含多个文件、多轮判断和跨工具操作,任何一个环节失误都可能导致最终结果不可用。因此,均衡性在企业环境中比单点能力更关键。
Harness成为模型之外的分水岭
报告进一步把Agent能力拆为模型与Harness两部分。Harness可以理解为围绕大模型运行的一整套工程系统,包括提示指令、上下文管理、工具调用、执行边界、反馈纠错和治理机制等。简单说,模型负责“思考”,Harness负责把思考转化为可控、可复现的操作流程。
按照杰富瑞测算,千问办公的**“隐含Harness分”位居此次测试首位**,高于Claude Cowork、Codex等7款国内外主流Agent产品。这一结果表明,在底层模型之外,工程化能力正在成为Agent产品的重要分界线。
原因并不难理解:企业用户需要的不是一次性的演示效果,而是稳定完成真实任务的能力。Agent要访问文件、浏览网页、调用工具、生成内容,还要在执行过程中识别错误并修正路径。即便底层模型能力接近,谁能更好地管理上下文、减少误操作、协调多工具,谁就更可能在实际办公中取得优势。
成本从API价格走向Cost per Task
除性能外,报告还强调成本正在成为Agent商业化的重要因素。杰富瑞称,千问办公底层Qwen 3.8 Max的API价格明显低于部分海外头部模型。由于Agent通常不是一次调用模型就结束,而是需要多轮推理、持续调用工具并执行长链路任务,企业评估Agent价值时,可能会越来越关注Cost per Task,即完成一项真实任务的总执行成本。
这与传统大模型应用的计费逻辑有所不同。聊天或搜索场景通常按输入输出消耗估算成本,但Agent会在后台产生更多步骤:拆解任务、读取资料、调用浏览器、生成文件、检查结果。单次模型价格较低,并不必然意味着整项任务便宜;反过来,如果产品能够减少无效推理、提高一次成功率,也会直接降低任务成本。
因此,阿里Qwen模型与千问办公Agent的组合,被报告认为体现出较好的性能与成本优势。对于准备采购或部署Agent的企业来说,未来比较对象可能不只是模型榜单排名,还包括任务完成率、平均执行成本以及与既有系统的集成难度。
企业级Agent竞争转向工作流和生态
报告认为,过去几个月Agent竞争正在从个人办公转向企业级场景。对企业级Agent而言,核心壁垒不只在模型,还在工作流和生态协同。随着Agent连接企业数据、业务系统、协作工具和权限体系,用户的历史任务、工作习惯、连接器、Skills和自动化流程会逐渐沉淀在产品中,形成使用粘性和迁移成本。
据介绍,千问办公不仅面向个人提效,也针对企业AI需求设计。目前它已初步打通钉钉IM工具,企业员工可通过千问办公完成群聊总结、文档表格创建、消息邮件收发等操作。未来,企业客户还可将其接入更真实复杂的工作流,连接企业数据库和业务流程,以提升办公与组织效率。
行业来看,Agent正在进入从“可用”到“可规模化使用”的阶段。短期内,真实任务评测会比单一模型跑分更受企业关注;中长期看,谁能把模型能力、工程Harness、成本控制和企业生态整合在一起,谁就更可能在企业级Agent市场中建立优势。

