核心事件:Snowflake 扩展 Cortex 平台,释放非结构化数据价值

Snowflake 正式将 Cortex AI Functions 作为其数据仓库原生能力的一部分,实现对通话转录、支持工单、法律合同、图像和视频等非结构化数据的结构化处理。该方案无需数据外搬即可完成文本分析、音频转录与图像理解,核心功能已于 2026 年向现有客户逐步开放,无单独收费表述,基于 Snowflake 计算资源计费。
主要硬信息包括:
- 发布时间:2026 年(当前上下文时间点)
- 适用对象:Snowflake 数据平台用户
- 数据处理位置:完全在 Snowflake 内部完成,无需外部 NLP 服务
- 架构模式:延续 raw → transformed → curated → consumption 四层标准管线
Transformed 层革新:AI 能力内嵌至数据管线
原 Snowflake 数据架构中,transformed 层主要处理结构化清洗与整合;此次升级赋予其直接处理非结构化文本的能力。Cortex AI Functions 包含七类核心函数:
- AI_TRANSCRIBE:音频口语内容转文本,支持原始录音直接分析
- AI_COMPLETE:从单条文本/图像提取关键信息或生成摘要(示例使用 claude-3-5-sonnet)
- AI_CLASSIFY:将内容归入预定义业务分类(如 billing_issue、technical_support)
- AI_FILTER:基于业务条件快速标记记录(如是否属投诉类工单)
- AI_SIMILARITY:计算文本语义相似度,匹配已知问题库
- AI_AGG / AI_SUMMARIZE_AGG:跨多记录聚合生成高管级别摘要
- AI_EMBED:生成文本/图像向量,支撑语义搜索与相似度比较
这些函数可在一条 SQL 查询中组合调用,实现从原始文本到业务可行动洞察的单步转换。例如某呼叫中心案例中,一条音频转录可在单次查询中同时输出意图分类、升级标记、问题匹配度与摘要生成四种结构化字段。
真实落地:呼叫中心分析的范式转变
在呼叫中心场景下,传统做法依赖临时脚本或外部 NLP 服务,导致洞察分散、治理困难。采用 Cortex 架构后:
- 客户为何致电
- 哪些案例需升级处理
- 客户情绪趋势变化
- 反复出现的已知问题
上述问题可通过统一工作流解答。关键改进在于:
- 原始音频/文本直接入库,通过 AI_TRANSCRIBE 转录为文本
- Transformed 层用 AI_CLASSIFY 与 AI_FILTER 进行逐行增强
- Curated 层用 AI_AGG 生成每周问题汇总(如三类主要客户问题)
- 最终结构化数据直接驱动 BI 仪表盘、机器学习管道与 Cortex Analyst 自然语言查询
一例聚合查询可将多条通话记录总结为一句高管摘要,而逐行增强查询可在单次 SQL 中完成意图识别、升级标记、相似问题匹配等四项操作。
结构化治理框架的三重收益
将传统 raw → transformed → curated 架构迁移至非结构化数据后,企业获得以下保障:
- 治理与溯源:从原始文本到结构化洞察全程留痕,满足审计要求
- 一致性与复用性:单套增强管线服务多业务团队,消除数据孤岛与定义分歧
- 可扩展性与可信度:同一框架适配合同分析、通话记录、图像识别等多领域,所有输出可回溯至原始数据源
值得注意的反差是:非结构化数据长期被视为临时处理对象,而本次方案首次赋予其与结构化数据同等的治理纪律与 lineage 可追溯性。
落地建议:三步启动实践
- 适合立即尝试者:已使用 Snowflake 且拥有通话录音、合同文本或工单数据的客户;业务场景明确指向意图识别、问题归类或摘要生成
- 建议暂缓者:尚未完成数据中台基础建设的中小企业;对实时性要求高于分析精度的场景(Cortex 更侧重准确性与治理而非低延迟)
建议优先选择一个高价值非结构化源(如客服通话),明确 1-2 个核心提取目标(如升级标记与问题分类),再构建 transformed 层。
写在最后
非结构化数据治理长期滞后于结构化数据,Snowflake 将 AI 能力深度集成至仓库层,标志着数据治理从"处理结构化数据"迈向"处理所有类型数据"的统一范式。这一转变将加速企业从"能分析非结构化数据"进入"可靠、可审计、可复用地分析非结构化数据"的新阶段。

