提示注入演练:把攻击当成测试用例,而不是上线后的意外

Veröffentlicht: 2022-07-21 Quelle: 许愿牛科技

上线后才发现助手被绕过指令,成本是事故。提示注入应写成发布前测试用例,过不了关不得对客。

助手对内测很听话,对客后有人用诱导话术套出不该给的内容。这不是意外,是测试缺项。发布前要把越权询问、伪造身份、套取内部字段写成用例,看系统是拒绝、降级还是照答。过不了的场景,先加护栏再上线。

攻击当故事听,会在客户那边演一遍。攻击当用例跑,才能停在测试环境。

用例比口号硬

列出禁止回答的类别:薪酬明细、未公开价格、他人数据。每类准备正常问法和绕过问法。期望是拒绝并记录,不是靠模型\"应该懂\"。改模型或改知识后回归同一套用例。

  • 禁止只测友好问题。
  • 失败用例进发布门槛,不进\"观察观察\"。
  • 对客日志抽检与用例对照。
上线前把助手越权询问列为测试用例
当测试跑,是质量。当上线后意外,是事故。差别只在有没有写入发布清单。

护栏先于演示

XYN 数智化系统把助手权限、拒绝策略和会话审计接在业务链上。演示可以漂亮,发布看用例绿不绿。绿了,智能才对客;不绿,先当内部工具。

问一句:上线清单里有没有越权询问的用例。没有,补上再发,不要等客户替你测。

智能助手发布前完成误用场景测试套件
用例在发布前。意外在发布后。选择前者,助手才配接到真实数据。