WhatsApp 小范围测试端侧 AI 反诈功能
WhatsApp 正在小范围测试名为 Scam Alert 的可选反诈功能。其核心设计是:针对非联系人消息的诈骗分类在设备本地完成,分类期间消息内容保留在设备上。用户可选择启用该功能。
关键技术要点:
- 端侧运行:小型机器学习模型下载至设备本地执行分类
- 差分隐私保护:聚合遥测数据时应用最小群组阈值和差分隐私
- 机密计算:使用可信执行环境的一种形式——机密虚拟机处理性能衡量任务
- 透明度机制:生产或实验模型版本及其 SHA-256 哈希值在部署前发布至第三方仅追加透明度账本
- 模型验证:客户端加载模型前需验证账本条目、模型签名、时效性及哈希值
功能运作机制与隐私设计
Scam Alert 的工作流程可分为两部分:实时检测与性能评估。
实时检测阶段:启用后,当非联系人发来消息时,设备上的模型会基于对话结构与语言信号进行判断。Meta 表示,该模型基于用户此前向 WhatsApp 举报的诈骗对话中观察到的模式进行训练。若识别为疑似诈骗,用户会看到一条发送者不可见的警告,并可选择屏蔽、举报或继续对话。用户还可将聊天标记为“可信”,此后 Scam Alert 将不再标记该对话。用户也可以选择将可信聊天中最近收到的 5 条消息分享给 WhatsApp,以帮助改进该功能。
性能评估阶段:设备会在本地把警告事件和用户操作汇总为计数。这些指标使用匿名凭据通过 Oblivious HTTP(OHTTP)中继传输,并在机密虚拟机内处理。客户端在传输数据前会验证机密环境中运行的代码,并检查隐私参数。聚合过程会应用最小群组阈值和差分隐私,之后 WhatsApp 只能获得近似的总体层面统计数据。
值得注意的是模型分发环节也被视为安全边界。每个生产或实验模型版本及其 SHA-256 哈希值都会在部署前发布到第三方仅追加透明度账本中。客户端在加载模型前验证账本条目、签名、时效性和哈希值;模型下载使用匿名凭据和 OHTTP,实验分组则在本地完成,从而防止服务器为单个用户选择特定模型变体。
对比:Google Messages 与 WhatsApp 的端侧检测方案
原文提到,Google Messages 也采用类似思路,为诈骗和网络钓鱼提供实时垃圾消息防护,并使用隐私保护机制进行检测。不过,不同功能在本地或通过 Google 服务执行处理的边界并不完全相同。
| 维度 | WhatsApp Scam Alert | Google Messages |
|---|---|---|
| 检测位置 | 消息分类在设备本地完成 | 因具体消息安全功能而异 |
| 隐私机制 | 机密计算 + 差分隐私 + OHTTP + 透明度账本 | 使用隐私保护机制,部分功能采用端侧检测 |
| 训练数据来源 | 用户此前举报的诈骗对话模式 | 原文未说明 |
| 模型验证方式 | 客户端验证 SHA-256 哈希、签名和透明度账本条目 | 原文未说明 |
这类方案的共同目标,是在不把消息内容直接交给服务器扫描的前提下,提高对诈骗和钓鱼内容的识别能力。但各平台对端侧处理、云端服务和遥测数据的边界划分并不完全一致。
对用户意味着什么
对经常收到陌生联系人消息的用户来说,Scam Alert 若后续开放,可能提供额外的风险提示层。它不会自动举报对话,用户仍可自行决定屏蔽、举报、继续聊天,或将某些聊天标记为可信。
同时,这项功能仍处于小范围测试阶段。用户需要留意两个方面:一是模型可能存在误报或漏报;二是虽然分类在本地完成,但用户若选择帮助改进功能,仍可能主动分享可信聊天中最近收到的 5 条消息。
写在最后
反诈功能正从“云端实时扫描”扩展到“端侧模式识别”,这反映出即时通信平台在安全与隐私之间寻找新平衡。Meta 表示,此次小范围测试将让公司及其 Bug Bounty 社区在更广泛推出前对实现进行压力测试;该公司还计划扩大 Bug Bounty 覆盖范围,将机密联邦分析管线纳入其中,并发布机密虚拟机二进制文件以及与隐私相关的源代码组件,供独立安全审查。



