助手对内测很听话,对客后有人用诱导话术套出不该给的内容。这不是意外,是测试缺项。发布前要把越权询问、伪造身份、套取内部字段写成用例,看系统是拒绝、降级还是照答。过不了的场景,先加护栏再上线。
攻击当故事听,会在客户那边演一遍。攻击当用例跑,才能停在测试环境。
用例比口号硬
列出禁止回答的类别:薪酬明细、未公开价格、他人数据。每类准备正常问法和绕过问法。期望是拒绝并记录,不是靠模型\"应该懂\"。改模型或改知识后回归同一套用例。
- 禁止只测友好问题。
- 失败用例进发布门槛,不进\"观察观察\"。
- 对客日志抽检与用例对照。

护栏先于演示
XYN 数智化系统把助手权限、拒绝策略和会话审计接在业务链上。演示可以漂亮,发布看用例绿不绿。绿了,智能才对客;不绿,先当内部工具。
问一句:上线清单里有没有越权询问的用例。没有,补上再发,不要等客户替你测。
