AI 安全大模型测评语料合规上线评审
生成式 AI 上线前安全测评
大模型应用上线前的一套完整安全测评流程:语料合规、模型安全、应用防护三层验证,输出可提交管理层/监管的测评报告。
难度高级
步骤5 步
工具5 个
资料3 份
PAIN POINT
痛点背景
自建/套壳的大模型应用要上线,管理层问「安全测评做了吗」,团队只会跑几句越狱 prompt 截图交差——拿不出体系化的测评证据。
PROCESS
落地流程
测评范围界定→语料合规检测→模型安全测试→应用防护验证→报告与整改
STEPS
详细步骤
1
1. 测评范围与基线
确定被测对象边界(模型/API/应用/插件),选定测评基线。
- 对象:模型本体 + RAG 知识库 + 工具调用链
- 基线:GB/T 42446 + 生成式 AI 暂行办法 + 行业监管要求
- 输出《测评方案》明确测与不测的边界
2
2. 语料与训练数据合规
检查训练/微调/RAG 数据的来源合法性与个人信息处理合规。
- 数据来源授权链核验
- 个人信息:告知同意 / 去标识化证据
- 版权与爬取数据风险标注
- 语料安全评估抽样记录
3
3. 模型层安全测试
对模型本体做鲁棒性与价值观对齐测试。
- 提示注入与越狱(对抗 prompt 库)
- 有害内容生成测试(暴恐/歧视/违法)
- 幻觉率与拒答率抽样评测
- 供应链:模型来源哈希与完整性校验
4
4. 应用层防护验证
验证应用侧防护措施的有效性。
- 输入过滤绕过测试
- 输出审查误拦/漏拦率
- 权限与越权访问测试
- 日志与审计留痕完整性
5
5. 测评报告与整改
汇总证据形成报告,问题分级闭环整改后复测。
- 报告结构:范围-方法-结果-风险-建议
- 问题分级:Critical 阻断上线,High 限期整改
- 整改后复测留档,形成上线依据
TOOLS
工具清单
| 工具 | 类型 | 说明 |
|---|---|---|
| Garak | 开源免费 | LLM 漏洞扫描器,越狱/注入/泄露一键探测 |
| PyRIT(微软) | 开源免费 | 自动化红队测试框架 |
| Promptfoo | 开源免费 | 评测用例管理与批量回归 |
| 违规测试题集(自建) | 开源免费 | 按监管红线自建的分级测试题库 |
| 人工专家评审 | 付费 | 关键场景抽样,弥补自动化盲区 |
RESOURCES
配套资料
生成式 AI 安全测评方案模板PDF 模板
测评范围/方法/证据清单,直接套用出报告
违规测试题集(分级版)JSON 题库
按风险等级分类的 200+ 条测试题
语料合规自查表Excel 清单
数据来源/授权/个人信息 30 项自查
PITFALLS
避坑指南
- ⚠自动化工具只能覆盖 60-70%,关键场景必须人工专家评审兜底
- ⚠测评证据要可复现:prompt、原始输出、时间戳缺一不可
- ⚠一次性测评没用,模型每次更新都要回归——把测评做成流水线
想在自己企业落地?
案例是通用方案,你的企业有自己的数据、系统和约束。预约 1v1 咨询,帮你量身定制落地路径。
延伸学习
CCRC-AISO 人工智能安全官
2026 首期 · 预约中 · ¥8,800