跳到正文
千机 API
原文
MIT Technology Review · AI· Arthur Holland Michel·· 16 小时前AI 评分70

MIT Technology Review 分析 AI 拒答机制的局限与审查风险

We’re putting too much faith in AI’s ability to say no

AI 导读

MIT Technology Review 作者 Arthur Holland Michel 认为,AI 拒答机制既不完全可靠,也可能因过度拒绝而限制正当信息获取和言论表达。文章梳理了模型微调、分类器与探针等拒答手段,并指出它们仍受概率性和越狱攻击影响。作者还讨论了企业与政府划定拒答边界可能带来的审查风险,以及模型在未经明确训练时出现隐性拒答的案例。

来源:MIT Technology Review · AI · technologyreview.com