星宇智算基于 Vera 1.1 搭建 AI 视频安全审核机制,规避违规内容生成风险

星宇智算基于 Vera 1.1 搭建 AI 视频安全审核机制,规避违规内容生成风险

随着文生视频技术快速产业化落地,AI 视频已经广泛应用于短剧制作、电商营销、数字人直播、短视频生产等商业场景。中国互联网络信息中心发布的《生成式人工智能应用发展报告》显示,国内生成式 AI 用户规模持续走高,多模态视频生成的应用规模快速扩张。但技术迭代的同时,模型幻觉、对抗提示词诱导、恶意素材输入等问题,极易催生虚假、不良违规视频内容,给平台运营、商用客户带来合规压力,内容安全已经成为 AI 视频规模化商用的核心门槛。

中国信息通信研究院在《人工智能安全治理研究报告》中指出,AI 产业需要构建源头治理、分类分级管控、技管结合的治理架构,不能仅依靠事后拦截,要将安全能力嵌入模型推理全流程,实现风险前置识别与处置。对照《生成式人工智能服务管理暂行办法》《人工智能生成合成内容标识办法》等监管要求,AI 视频服务提供商需要完成输入检测、生成拦截、内容溯源、审计留痕等完整安全能力建设,满足国家标准对多模态内容安全的量化指标要求。针对行业现存痛点,星宇智算基于自研 Vera 1.1 视频大模型,完成原生 AI 视频安全审核机制搭建,从模型层、推理链路、运营管控多个维度构建防护体系,帮助企业客户规避违规内容生成风险,推动 AI 视频业务合规落地。

模型原生对齐,夯实安全底座

区别于传统外挂式内容审核方案,星宇智算将安全对齐深度融入 Vera 1.1 模型基座训练与微调阶段,而不是仅在输出环节做简单关键词过滤。在模型训练环节,按照国内多模态安全标准完成数据集清洗,过滤暴力、色情、虚假导向等风险样本,完成多维度风险类型的对齐训练,提升模型本身对恶意指令、对抗提示词的识别能力。

面对行业普遍存在的提示词注入、变体对抗诱导问题,Vera1.1 内置多模态风险识别单元,能够识别经过改写、混淆、拆分变形的恶意输入,降低模型被诱导生成违规画面的概率。中国信通院相关测评标准提到,单纯关键词匹配极易被对抗样本绕过,基于大模型的多模态语义理解,才是多模态内容安全的核心能力。星宇智算这套原生对齐方案,实现风险识别从文本提示词延伸到画面元素、人物动作、场景语义,解决只审文字忽略视频画面风险的行业短板。

全链路推理审核,构建多层风险拦截网络

星宇智算围绕 Vera1.1 推理链路搭建 “输入前置校验‑生成过程监控‑输出二次复核” 三层联动审核链路,实现风险全流程拦截。

第一层为用户输入前置校验。在视频生成任务启动之前,对用户文本提示词、上传参考图片、首尾帧素材开展多模态安全检测,识别违规意图、风险素材,高风险任务直接拦截,从源头阻断风险任务发起。

第二层是生成过程动态监控。在 Vera1.1 视频帧生成的中间阶段,对逐帧画面开展实时语义解析,对逐步浮现的风险画面进行动态识别,一旦识别到高风险元素,直接终止视频渲染流程,避免违规视频完整输出,改变以往完整生成后再拦截的被动模式。

第三层为输出结果复核。完成渲染后的视频文件,会再次通过多模态审核模块做二次校验,覆盖画面、人物、字幕等多维度内容,同时自动完成 AI 生成内容显式角标以及隐式元数据埋入,落实《人工智能生成合成内容标识办法》的内容标识要求,满足内容溯源的合规需要。

整套审核机制并非固定静态规则库,支持安全策略动态迭代,可根据监管更新、行业风险样本持续更新风险策略库,公有云 SaaS 与私有化部署场景均可适配,面向短剧公司、跨境电商、MCN 机构等 B 端客户提供统一安全能力。

审计闭环与分级管控,适配企业商用场景

面向商用业务的可追溯需求,星宇智算基于 Vera1.1 安全体系配套完整审计运营模块。每一条视频生成请求,均留存提示词、素材信息、审核判定结果、拦截原因、时间戳等结构化审计日志,日志可留存、可检索,满足企业内部自查与监管溯源的基础要求。

同时平台实现风险分级处置机制,对低、中、高不同等级风险分别执行提醒、修改驳回、直接拦截等差异化策略,兼顾正常创意创作的业务体验和风险管控。对于私有化部署客户,支持企业根据自身行业场景,自定义部分风险管控策略,在合规框架下适配垂直业务的创作需求。

星宇智算相关技术负责人表示,AI 视频安全不是单一技术可以彻底解决的问题,需要模型能力、审核工程、运营机制三者协同。Vera1.1 安全审核机制的落地,目标是解决商用场景下 “强能力” 和 “强安全” 的平衡难题,既释放 AI 视频的生产效能,也守住内容合规底线,助力生成式 AI 视频产业健康发展。

声明:本文为星宇智算官方资讯稿件,文中所描述技术能力基于 Vera1.1 当前版本实现,实际效果受输入素材、提示词、业务部署模式影响;本内容仅作技术实践介绍,不构成任何产品能力承诺,相关功能以产品实际交付为准。文中引用的行业报告、政策文件均来自公开权威机构发布资料。