一项针对113名非专业用户的实验,测试了三种控制AI代理的方式:每次行动都请人审批、由模型自动审查、或让用户预先为后果类别写下“允许/询问/禁止”规则。研究者模拟了18个行动,其中7个属于越权操作。结果显示,预先写规则的组拦截的越权操作最少,比逐次审批低20.1个百分点,也比自动审查低14.5个百分点。
规则组虽然把运行时弹出的确认从18次降到10.9次,但把写规则的时间也算进去后,总干预时间并没有可靠地减少。更让人注意的是,参与者写下的140条规则里有114条选了“询问”,等于又把决定推回给运行时。最终执行的148个越权操作中,133个是用户当场点头同意的,只有15个靠“允许”规则自动放行。
这像是偏好与承诺之间的落差:人们愿意表达“这个类别要小心”,但真遇到具体行动时,依然会放行。预先设定的规则并不自动带来更强保护,甚至越权操作在规则组获得了最高的批准率。这提醒我们,权限界面的设计不只是规则写得好不好,还要考虑人在确认那一刻如何判断。
评论