有人问视频去重、伪原创这条线现在什么情况。我把链路从头查了一遍——平台怎么查重、市面去重服务用了哪些手法、开源仓库能不能复现、以及能不能往产品方向走。下面是查到的东西,按层和实验数据记录,取舍留给读者自己权衡。
平台查重不是一层,是六层
成熟平台的查重是六层级联,任一层命中就标记为重复内容:
- 文件层:MD5/SHA1 全文件哈希,加容器元数据、编码器指纹。重编码就会变。
- 视觉层:抽关键帧(场景切换或固定间隔),算 pHash/dHash,Hamming 距离比阈值。这是多数人以为的"查重"。
- 时序层:帧序列指纹、运动轨迹、场景切换节奏。
- 音频层:频谱峰值指纹(类 Shazam 的 Chromaprint),加 ASR 把语音转文字后比对。
- 深度学习层:CNN 特征(ResNet)、CLIP embedding,余弦相似度。
- 跨模态层:视觉+音频+时序投票融合,综合判定。
目前抖音、B 站、视频号已经做到第五层。B 站撞车系统是自监督 ResNet50 + FAISS 向量检索;视频号用的是 CVPR 2023 双赛道冠军方案 + 腾讯云 Milvus;YouTube Content ID 从早期的 Waveprint(小波+MinHash+LSH)迭代至今。也就是说,平台查重不止是哈希比对,语义模型已经在用。
市面去重服务的手法
市面上的"去重服务"常见手法:重新编码、水平镜像、RGB 通道偏移、微抖动变速、抽帧插帧混合、画中画蒙版叠加(低透明度)、四边裁剪缩放、调色滤镜、音频变调、清元数据、混剪重排。
这些手法作用的主要是像素层。在不同查重层,它们的效果有差异:pHash 等视觉哈希对像素变化敏感,这些手法能改变哈希值;而 CNN/CLIP 提取的是语义特征,对只改像素、不改内容的变换不那么敏感。下面用一组实验测这个差异。
一组对照实验
拿同一段测试视频做一次水平镜像,然后用两种指纹分别比对"原片 vs 镜像片":
- pHash(视觉层):原片哈希
f6c3f6965c00f600,镜像哈希f63ef6b6a300f600,Hamming 距离 16/64——pHash 判定为不同。 - 语义层(ResNet/CLIP):余弦相似度 0.94——语义层判定为近重复。
注:真 CLIP 权重这台机器下不动(HuggingFace 连不上),脚本自动回退到 ResNet50,同样是语义层特征,结论方向一致。联网环境会自动用真 CLIP。
同一次镜像变换,两种指纹给出不同判定:pHash 认为不同,语义层认作近重复。把范围放大到重编码、RGB 偏移、调色、裁剪、蒙版、帧混合这些手法,它们都只改像素、不动语义,因此在语义层和 pHash 层的效果同样存在差异。
查重机制的演进趋势
2023 到 2026 的演进路线:pHash → CNN → CLIP 多模态 → 2025 的视觉+音频+语义多路检测。往后可能加的方向:音频 ASR 比对(变调能改频谱,但改不了转出来的文字语义)、跨账号图算法关联(不只盯单条视频,还盯搬运账号矩阵)、AIGC/合成内容水印检测(针对 AI 批量生成的内容)。整体方向是各层逐步收口,具体到哪种手法在哪个时间点效果如何,要看各平台迭代节奏。
几个可能的方向
把这套技术往产品方向落,大致有三个,各自的技术和法律情况:
搬运伪原创工具:技术上,像素层手法在 pHash 层有效、在语义层效果有限;法律上涉及复制权、信息网络传播权、改编权,平台规则也明文限制,存在侵权和违规风险。这是技术和法律上都有约束的方向。
自查重 / 素材库管理:管的是自己的素材,合法。技术上 pHash 先召回、CLIP 重排、FAISS/Milvus 亿级向量检索,这套本地可跑通。需求来自内容机构、MCN、自媒体对自己素材去重,付费意愿相对明确。
盗用检测 / 版权维权:和 2 是同一套技术反过来用,帮版权方发现被盗用的内容。合法,有社会价值;获客上版权方分散、付费意愿偏低、要对接平台投诉通道。
同一套指纹技术,正着用(自查重、抓盗用)和反着用(帮搬运)在技术和法律上处境不同。具体往哪个方向走,看各自的权衡。
完整报告
这篇是浓缩版。完整调研报告含 10 个可跑的 ffmpeg 脚本、Python 指纹代码、15 个经 API 核验的 GitHub 仓库清单、平台查重分层架构图、自建流水线架构图、文献来源,存了私库,需要细看再说。