标题、普通文案、格式整理、基础总结。错了影响小,速度优先。
06 幻觉与可靠回答
评测 + 人工审核
Prompt、RAG 和参数控制都能降低幻觉,但不能保证 AI 永远正确。真正把 AI 用到企业和产品里,还要有评测发现问题,用人工审核拦住高风险错误。
一句话速览
评测负责发现系统问题,人工审核负责拦住高风险错误。真正成熟的 AI 产品,不是赌 AI 永远不犯错,而是让错误能被发现、拦截、修复和复测。
PM 需要设计的三个环节
product safety loop
评测台 × 人工审核
control desk
当前演示:评测基线,先用真实问题量化系统风险。
哪些内容该交给人
risk routing
价格、产品参数、企业制度、客服口径。需要来源、日志和抽检。
合同、医疗、金融、退款赔偿、账号权限。不能让 AI 自动拍板。
完整防线怎么串起来
reliable answer stack
Prompt减少乱答
RAG拿资料回答
参数降低随机性
评测发现系统问题
人工审核拦住高风险错误
可复用审核规则
copy ready
回答前先判断风险等级。涉及金额、合同、法律、医疗、投资、退款赔偿、账号权限或用户隐私时,不要直接给最终结论;请标注“需要人工确认”。如果知识库没有明确资料,请回答“当前资料无法确认”,不要自行补全。
最后总结
final rule
好的 AI 产品,不是要求 AI 永远不犯错,而是让系统能发现、拦截和纠正错误。
AI 错起来最危险的地方,是错误答案看起来也很专业。所以产品不能只看回答速度,还要看错误成本、风险等级、人工介入规则和上线后的持续评测。
本节小结
- 评测看的是整个 AI 系统是否稳定,不是某一次回答漂不漂亮。
- 人工审核不是全部重做,而是在关键节点兜底。
- 低风险自动,中风险抽查,高风险人工确认,是最实用的产品原则。
- Bad Case 不是脏数据,而是优化 Prompt、知识库和流程的燃料。