大模型风险不是上线前做一次安全检查就能解决的问题,而需要贯穿数据、模型、知识、工具和运营全过程。
一、先区分内容风险与行动风险
回答不准确属于内容风险,错误调用系统则可能转化为行动风险。企业应根据人工智能能否接触敏感信息、影响业务决策或执行操作,对场景进行风险分级。
低风险场景可以强调使用提示和抽样检查,高风险场景则需要严格权限、人工确认和完整审计。
二、数据与隐私风险
用户输入可能包含客户、员工或经营信息,知识库也可能混入超出访问范围的内容。企业需要明确哪些数据可以进入模型、是否允许留存,以及如何进行脱敏。
检索系统必须继承原有权限,不能因为文档进入统一知识库就向所有用户开放。
三、幻觉与知识时效性
大模型可能生成表达流畅但事实不准确的内容。知识检索可以降低风险,却不能保证所有答案正确。系统应展示来源、标识不确定性,并为关键结论设置核验步骤。
过期知识同样危险。知识内容需要负责人、有效期和更新机制,不能只关注首次导入。
四、提示攻击与权限越界
外部文本可能包含诱导模型忽略规则的指令,用户也可能尝试访问未授权信息。系统不能只依赖提示词约束,而要在模型之外执行身份校验、参数检查和工具授权。
智能体使用的工具应采用最小权限,并限制可调用范围、次数和关键参数。
五、成本、供应商与运行风险
模型调用成本会随输入长度、并发量和任务复杂度变化。架构需要设置预算、限流、缓存和模型路由策略。
同时应考虑模型服务变化、接口依赖和迁移难度,保留可替换的模型接入层和关键场景的降级方案。
六、建立持续治理闭环
上线前评测只能覆盖已知样本,真实运行会持续出现新问题。企业需要采集失败案例、用户反馈、安全事件和成本数据,定期更新评测集。
治理的目标不是消除所有不确定性,而是让风险被识别、被限制,并在出现问题时能够追溯和纠正。
治理要覆盖“进入前、运行中、变化后”
进入前需要判断场景是否适合使用大模型,数据是否允许被处理,错误会造成什么影响,以及是否存在更简单可靠的方案。运行中要管理身份、权限、知识来源、敏感信息、输出校验和人工接管。模型、知识库或提示规则更新后,还要重新评测关键场景,防止局部优化造成其他能力退化。
建立按风险分级的准入机制
知识查询、内部材料草拟等低风险场景,可以采用较轻的审核;对外发布、客户承诺、经营决策和业务执行,应设置更严格的质量门槛和确认流程。分级的目的不是增加审批层级,而是让治理投入与潜在影响相匹配。
治理对象不能只有模型
很多错误并非来自模型本身,而是知识过期、检索不相关、上下文缺失、工具参数错误或权限配置不当。因此,企业需要分别记录模型版本、知识版本、提示规则、工具调用和最终结果,并建立可回放的运行链路。
为退出和降级提前设计
当模型不可用、效果低于门槛或业务风险上升时,系统应能够切换到人工处理、固定规则或只读模式。能够安全停止,是企业级人工智能架构成熟的重要标志。