Featured image of post Real-SWE发布:评测AI处理真实企业私有代码库的能力

Real-SWE发布:评测AI处理真实企业私有代码库的能力

Real-SWE以真实企业私有代码库测试AI编码代理。

Real-SWE发布:评测AI处理真实企业私有代码库的能力

核心事件与关键信息

Real-SWE是一项用于评测前沿AI模型的编码基准,任务来自获得授权的真实企业私有生产代码库。它关注的不是公开代码仓库中的标准化题目,而是工程师在既有产品中实际面对的问题及其上下文。

这些代码库和对应解决方案不公开于互联网。评测采用贴近企业工程实践的原生执行框架,因此衡量的是模型与执行框架的组合表现,而非孤立的模型能力。

真实企业任务的三项特征

Real-SWE强调,企业软件任务通常具备以下特点:

  • 私有代码与上下文:代理需要在专有系统中定位问题、理解架构,不能依赖公开网络上已有的答案。
  • 直接的业务影响:任务可能涉及账单、税务计算和客户迁移等流程,修改结果会影响企业运营。
  • 公司特定的工程复杂性:代理不仅要改对代码,还要遵循现有编码习惯、业务规则和多服务协作方式。

原文指出,真实企业中的大量代码和上下文并不在前沿模型的训练数据可及范围内。基准所考察的重点,因而是模型能否理解特定公司的工程模式与隐含约束,而不只是生成局部可运行的代码。

一个计税修复任务如何跨越多层系统

示例任务要求修复发票计税功能。代理需要理解不同企业的税务配置:有的企业自行维护税率,有的需要按买方目的地通过税务服务定价,也有企业不征税;已记录税务豁免的客户则不应被征税。

该任务还要求代理处理地址、商品行和商品类别等信息,在沙箱或生产环境调用税务服务;若税务服务拒绝某个地址,系统应报告该问题而不阻断发票开具。已结算发票的销售记录还需要回传,以便税务申报与发票编号对账。任务环境涉及税务服务、账本、NestJS服务和TypeScript代码等多个环节。

Real-SWE环境按任务需要提供相应工具和服务,可能包括AWS模拟器、Docker、Kubernetes、代码托管与任务管理工具,以及PostgreSQL、MySQL、MongoDB、Redis等数据库;相关项目可使用Go、Python或Node.js等技术栈。

短时与长时执行的失败率接近

原文报告称,执行时间不足10分钟的轨迹中,71.4%失败;更长执行时间的轨迹中,73.4%失败。两者差距很小,说明仅增加执行时间未必能解决核心难题。

更关键的挑战在于:代理必须在复杂既有代码中梳理需求,识别跨系统依赖,理解业务逻辑和公司特定编码模式,并验证自己的假设。对于企业部署而言,这也提示评估编码代理时,不应只看单次生成结果,还应考察其理解上下文、遵守约束和完成验证的能力。

结语

Real-SWE将评测焦点放在真实生产代码库和实际业务任务上。它反映出,当前AI编码代理在处理企业内部规则、遗留架构与跨服务工作流时,仍面临明显挑战。