架构设计
内容解析为结构化数据。
信息检测。
采用关键帧提取 + 场景切换检测。
3.1 内容解析 Agent
- 视频抽帧策略:采用关键帧提取 + 场景切换检测。15秒短视频抽取5-8帧关键帧即可覆盖主要内容;长视频按每2-3秒一帧 + 场景切换点额外补帧。
- ASR选型:使用支持时间戳对齐的ASR模型(如 Whisper / FunASR),输出带时间戳的文本片段,便于后续证据定位。
- OCR后处理:OCR结果需做去重、合并、版面恢复。特别关注画面底部小字、快速闪现的文字(使用连续帧OCR差异检测)。
- VLM理解深度:不仅描述画面"有什么",还要理解"在做什么"——例如人物是否在做引导性手势、画面是否有暗示性构图。
处理阶段 | 技术方案 | 输出 |
视频预处理 | 解码 → 分辨率标准化 → 时长检测 → 场景切换检测(基于帧间差异) | 关键帧时间戳列表 |
关键帧抽取 | 场景切换帧 + 固定间隔帧(每2-3秒)+ 首尾帧 + 画面变化异常帧 | 5-15张关键帧图片 |
音频分离 | 从视频中提取音轨 → 降噪 → 语音活动检测(VAD)分段 | 分段音频片段 |
ASR转写 | 使用支持时间戳的ASR模型转写 → 标点恢复 → 说话人分离(如有多人) | 带时间戳的文本片段 |
帧OCR | 对每张关键帧做OCR → 去重合并 → 版面恢复 → 小字区域放大重试 | 每帧的文字列表+位置坐标 |
VLM理解 | 对关键帧做画面描述 → 物体检测 → 场景分类 → 人物动作识别 | 画面语义描述 |
时序异常检测 | 连续帧OCR差异分析(检测闪现文字)→ 音频语速异常检测 → 音画同步验证 | 异常时间点列表 |
3.2 有害信息检测 Agent
职责
基于内容解析Agent输出的结构化内容,对8类有害信息风险进行逐一检测,输出风险类型、风险等级、证据片段和判定理由。
检测流程
- 风险预筛:规则引擎 + 小模型快速扫描,标记可能存在风险的维度(如检测到敏感词、暴露画面特征等)
- LLM深度分析:对标记维度使用大模型进行语义级推理分析
- 知识库检索:RAG检索相关法规条款和历史相似案例,辅助判定
- 证据提取:定位具体违规内容片段,标注来源模态和时间戳
3.3 引流信息检测 Agent
职责
专门负责6类引流信息的检测,重点攻克隐蔽引流和对抗性变体。该Agent需要更强的推理能力和模式识别能力。
检测策略
检测层 | 方法 | 覆盖类别 |
规则匹配层 | 正则匹配微信号格式、URL格式、电话号码格式;二维码检测;已知黑名单词库匹配 | D1/D2/D3/D5 显性部分 |
谐音变体检测 | 谐音词典 + 拼音相似度匹配 + LLM语义推理("威信"→"微信","薇芯"→"微信") | D1 隐性部分 |
Emoji编码检测 | Emoji组合模式库 + LLM推理(��+数字组合 = 电话号码引导) | D1/D6 |
行为意图检测 | LLM分析文案/音频中的引导性行为话术("搜索""加""私信""扫码"等动词 + 宾语组合) | D2/D3/D4/D6 |
音画交叉检测 | 对比音频转写与画面内容,检测"音频口述但画面不展示"或"画面闪现但音频不提及"的不一致模式 | D6 核心检测 |
时序异常检测 | 检测画面中快速闪现的文字/图像(连续帧OCR差异分析),检测音频中语速异常变化段 | D6 |
3.4 综合决策 Agent
职责
聚合有害信息检测Agent和引流信息检测Agent的结果,结合规则引擎和置信度评估,输出最终审核决策。
决策逻辑
- 风险聚合:合并所有检测结果,按风险等级排序
- 规则引擎兜底:命中"一票否决"规则(如涉政、毒品)直接拒绝
- 置信度计算:综合各Agent置信度、证据充分性、模型一致性
- 决策输出:置信度 ≥ 0.95 且无风险 →自动通过置信度 ≥ 0.90 且有明确违规 →自动拒绝(附拒绝理由和证据)0.70 ≤ 置信度 < 0.95 →人工复审(附AI初审报告)置信度 < 0.70 或存在矛盾判定 →人工复审(标记为难例)
3.5 人工审核调度 Agent
职责
管理人工审核工作流,将低置信度case智能路由到合适的审核员,收集审核结果并反馈到系统优化闭环。
核心能力
- 智能路由:根据case类型、难度、审核员专业领域和工作负载,将case分配给最合适的审核员
- 初审报告生成:为每个待人工审核的case生成结构化初审报告,包含AI检测结果、证据片段、推荐决策,帮助审核员快速判断
- 难例标记:标记模型不确定或存在矛盾判定的case为"难例",优先分配给资深审核员
- 反馈收集:记录审核员的最终决策与AI决策的差异,作为模型迭代训练数据
- 批量优化:对相似case进行聚类,支持批量审核,提升效率
角度
垃圾发布者账号识别:注册时间、关联手机/邮箱、IP、发布频率等。
垃圾内容识别:色情、暴力恐怖、广告过滤、违禁、违法、政治敏感。AI生成内容鉴别。垃圾广告、谩骂内容检测。
针对未成年,进行未成年 不宜信息识别。
引流到其他APP、渠道的识别。