Featured image of post Coding Agent 进入数据栈:价值不只在写 SQL,更在理解平台上下文

Coding Agent 进入数据栈:价值不只在写 SQL,更在理解平台上下文

平台上下文决定数据智能体可用性

核心事件:数据智能体的瓶颈从“会写代码”转向“懂环境”

核心事件:数据智能体的瓶颈从“会写代码”转向“懂环境”
核心事件:数据智能体的瓶颈从“会写代码”转向“懂环境”|新闻截图

一篇来自 InfoQ 的技术实践文章指出,Coding Agent 在数据工程中的价值,越来越取决于它能否理解企业真实数据环境,而不只是生成语法正确的 SQL 或脚手架代码。文章以 Snowflake 的平台原生智能体 CoCo 为例,讨论了通用编码智能体在数据栈中面临的上下文、治理和平台知识缺口。

所谓 Coding Agent,通常指能根据自然语言指令生成、修改或解释代码的 AI 工具。在数据工程场景中,它确实能减少重复劳动:例如生成流水线框架、编写增量转换逻辑、处理常见 SQL join,或产出迁移脚本。这些任务模式稳定、规则清晰,是智能体较容易发挥效率的区域

通用答案为何离生产可用仍有距离

文章强调,很多团队的挫败感并不来自明显“幻觉”,而是来自一种更隐蔽的问题:Agent 给出的结果看起来合理,语法正确,也符合通用编码习惯,但并不适配企业自己的数据环境。它可能不知道哪些表用于生产,哪些 Schema 受治理约束,也不了解组织的 RBAC 结构。

在数据工作里,“上下文”不是抽象概念,而是非常具体的运行条件,包括:

  • 特定 SQL 方言和平台语法;
  • Schema 命名约定和表之间的真实关系;
  • 平台对象,如 Dynamic Tables、Snowflake Tasks、Snowpark stored procedures;
  • 数据访问规则、脱敏策略和角色权限。

用户可以把 Schema、示例查询和平台限制写进 Prompt,但这会把 AI 使用变成持续维护上下文的集成工作。每次新增表、调整字段或引入平台能力,都需要重新补充说明。模型越通用,越需要外部上下文来把答案从“可读”推进到“可用”

治理与平台知识是更深层缺口

比 Schema 更难补齐的是治理上下文。文章提到,数据脱敏策略、行级访问控制策略和基于角色的访问控制,对脱离数据平台运行的通用 Agent 往往不可见。于是它可能生成一段能编译、能通过代码审查、甚至能上线的查询,但最终才暴露出访问了不该访问的数据,或绕过了保护敏感字段的策略。

这里的关键不是 Agent “故意违规”,而是它根本看不到约束。RBAC 即基于角色的访问控制,用角色层级决定用户或服务能访问哪些资源;行级访问控制则是在查询时限制可见数据行;脱敏策略用于隐藏或替换敏感字段内容。对数据平台而言,这些是生产安全的基础;对外部 Agent 而言,它们却很难仅靠提示词完整表达。

还有一类知识来自平台自身的运行方式。例如查询 ACCOUNT_USAGE 时应选择哪些视图、如何连接视图,以及哪些字段存在延迟;SYSTEM$CLASSIFY 有特定输出格式和适用场景;GET_LINEAGE 要按特定顺序传参,并结合平台语义解读返回结果。这些并非通用 SQL 知识,而是特定平台 API 和版本语境下的操作经验。

平台原生智能体的思路:把上下文内置进执行环境

文章认为,换用更强模型并不能自然消除上述问题,因为缺口并不只在推理能力,而在智能体是否运行于正确的环境中。Snowflake 的 CoCo 被描述为围绕这一需求设计:它以用户实际使用的 Snowflake 角色运行,因此脱敏策略和行访问策略不再只是需要模型理解的文字约束,而成为执行环境的一部分。

在上下文获取上,CoCo 可以直接查询目录、检查模式,并在账户内运行 SQL,减少用户手动把表结构塞进 Prompt 的需求。在平台能力上,它内置了面向数据团队日常工作的技能,包括查询 ACCOUNT_USAGE、通过 GET_LINEAGE 追踪数据血缘、使用 SYSTEM$CLASSIFY 进行个人身份信息(PII)分类、分析成本和诊断工作负载。

文章将这些能力描述为面向 Snowflake API 和查询模式构建的结构化工作流,而非简单提示词模板。其价值在于让数据工程师把更多时间用于设计数据管道、编写转换逻辑和审计治理策略,而不是反复为通用智能体搭建背景材料。

行业观察:数据智能体会走向“平台化”而非只拼模型

从这篇实践文章可以看出,企业级 Coding Agent 的竞争重点正在变化:早期看重生成速度和代码质量,进入数据栈后,更重要的是能否与权限、治理、目录、血缘和成本信息协同。对普通技术团队来说,选择通用 Agent 仍可能带来效率提升,但需要投入上下文工程和治理校验;选择平台原生 Agent,则是在特定生态内换取更深集成。

未来的数据智能体很可能不会只是一层聊天界面,而会成为数据平台的操作入口。它们的可靠性不只取决于模型参数和提示词技巧,更取决于是否能在正确角色、正确权限和正确元数据范围内工作。对企业而言,真正值得评估的问题也将从“它会不会写 SQL”,转向“它是否理解我这套数据系统如何被安全地使用”。