观潮 AI
首页/AI 落地案例库/生成式 AI 上线前安全测评
AI 安全大模型测评语料合规上线评审

生成式 AI 上线前安全测评

大模型应用上线前的一套完整安全测评流程:语料合规、模型安全、应用防护三层验证,输出可提交管理层/监管的测评报告。

难度高级
步骤5
工具5
资料3
PAIN POINT

痛点背景

自建/套壳的大模型应用要上线,管理层问「安全测评做了吗」,团队只会跑几句越狱 prompt 截图交差——拿不出体系化的测评证据。

PROCESS

落地流程

测评范围界定语料合规检测模型安全测试应用防护验证报告与整改
STEPS

详细步骤

1

1. 测评范围与基线

确定被测对象边界(模型/API/应用/插件),选定测评基线。

  • 对象:模型本体 + RAG 知识库 + 工具调用链
  • 基线:GB/T 42446 + 生成式 AI 暂行办法 + 行业监管要求
  • 输出《测评方案》明确测与不测的边界
2

2. 语料与训练数据合规

检查训练/微调/RAG 数据的来源合法性与个人信息处理合规。

  • 数据来源授权链核验
  • 个人信息:告知同意 / 去标识化证据
  • 版权与爬取数据风险标注
  • 语料安全评估抽样记录
3

3. 模型层安全测试

对模型本体做鲁棒性与价值观对齐测试。

  • 提示注入与越狱(对抗 prompt 库)
  • 有害内容生成测试(暴恐/歧视/违法)
  • 幻觉率与拒答率抽样评测
  • 供应链:模型来源哈希与完整性校验
4

4. 应用层防护验证

验证应用侧防护措施的有效性。

  • 输入过滤绕过测试
  • 输出审查误拦/漏拦率
  • 权限与越权访问测试
  • 日志与审计留痕完整性
5

5. 测评报告与整改

汇总证据形成报告,问题分级闭环整改后复测。

  • 报告结构:范围-方法-结果-风险-建议
  • 问题分级:Critical 阻断上线,High 限期整改
  • 整改后复测留档,形成上线依据
TOOLS

工具清单

工具类型说明
Garak开源免费LLM 漏洞扫描器,越狱/注入/泄露一键探测
PyRIT(微软)开源免费自动化红队测试框架
Promptfoo开源免费评测用例管理与批量回归
违规测试题集(自建)开源免费按监管红线自建的分级测试题库
人工专家评审付费关键场景抽样,弥补自动化盲区
RESOURCES

配套资料

生成式 AI 安全测评方案模板PDF 模板

测评范围/方法/证据清单,直接套用出报告

违规测试题集(分级版)JSON 题库

按风险等级分类的 200+ 条测试题

语料合规自查表Excel 清单

数据来源/授权/个人信息 30 项自查

PITFALLS

避坑指南

  • 自动化工具只能覆盖 60-70%,关键场景必须人工专家评审兜底
  • 测评证据要可复现:prompt、原始输出、时间戳缺一不可
  • 一次性测评没用,模型每次更新都要回归——把测评做成流水线

想在自己企业落地?

案例是通用方案,你的企业有自己的数据、系统和约束。预约 1v1 咨询,帮你量身定制落地路径。

延伸学习

CCRC-AISO 人工智能安全官

2026 首期 · 预约中 · ¥8,800

查看课程 →