AI“拒绝回答”能力被指被高估

AI 驱动中国 程青 322次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

外媒分析称,当前大模型“拒绝回答”并非天然能力,而是依赖安全训练、外部过滤和概率判定;这种机制存在失效与越狱风险,可能影响生物安全、网络攻击和舆论操纵等场景,而有害边界由厂商自行划定也引发透明度争议。

驱动中国10月10日消息,据《麻省理工科技评论》报道,当前人工智能系统“拒绝回答”的能力并非模型天生具备,而是通过安全训练、外部过滤和概率式判定层层构建。文章认为,业界对这种“会说不会”的机制寄予过高信任,一旦失效,可能带来安全与滥用风险。

报道回顾称,自人们开始认真设想让机器拥有接近人类智能以来,机器是否能像人一样拒绝请求,一直是科幻叙事的重要母题,且多数故事带有警示意味。近年来,“AI不应满足所有指令”逐渐变成行业共识。2021年,Anthropic团队提出大语言模型应当有用、诚实,并以无害为先;当用户要求协助危险行为时,AI应当礼貌拒绝。这一原则听起来几乎没有争议,但文章指出,模型本身并不会天然学会“说不”。

在训练过程中,模型接触海量网页文本,会习得大量与暴力、辱骂相关的内容,却不会自动学会克制这些能力。曾在OpenAI从事安全工作、2020年至2024年任职的Steven Adler表示,公司早期模型几乎会对任何问题“滔滔不绝”。哈佛大学研究AI与心理健康的Ryan McBain回忆称,早期聊天机器人面对极端自伤类问题,也很容易被诱导生成回应。

如今,模型被训练去拒绝大量提示。报道指出,如果用户提问在统计特征上与某类危险问题足够相似,例如如何伤害同事、如何制作危险物品等,模型通常会拒绝回答;涉及增强埃博拉病毒毒性、隐瞒婚外情等请求,也可能触发拒绝机制。为了让模型更精准地“拒绝”,企业会对模型进行大量测试:对模型拒绝有害问题给予奖励,对误拒无害问题给予惩罚。许多测试由其他模型完成,相当于“用AI教AI如何说不”。此外,企业还会在核心模型外增加多层AI防护,拦截可能引发风险的提示。

文章认为,拒绝机制已成为现代AI的一部分,但它并不稳定,时常失效,甚至可能带来严重后果。尽管模型被赋予安全外衣,其内部仍包含大量危险知识;AI的恶意能力也随着其“有益智能”的提升而增强。一些企业称,最新模型在入侵关键计算机基础设施方面可与顶尖人类黑客相当,在扭曲公共舆论方面也可与经验丰富的虚假信息操作者相提并论。文章将这种状态比作给每辆车装上机枪,再把扳机藏到引擎盖下。

报道进一步指出,由于拒绝机制本质上是概率式判断,很难做到完全可靠。已有恶意用户突破防线,未来也可能持续出现绕过安全限制的情况。企业披露,部分用户正尝试使用最先进AI来优化生物病原体、构建自主无人机群。文章认为,如果拒绝机制反复失效,迟早可能酿成更大范围的灾难。

另一个难题是边界划定。依赖拒绝机制,意味着必须在“模型应当服从”与“模型必须拒绝”之间画出界线,但这一界线没有公式。报道举例称,病毒学家研究危险病毒有合理目的,用户了解计算机系统漏洞也可能是为了修补漏洞,而非利用漏洞。OpenAI董事会成员、AI测试公司Gray Swan联合创始人Zico Kolter表示,界线画在哪里是一个巨大问题。当前,AI公司掌握这一划线权,且过程高度保密。文章认为,在现阶段或许可以接受厂商拥有这种权力,但这也意味着AI可能拒绝一些并未达到普遍有害标准的问题,例如让多数聊天机器人数到一百万。

整体来看,报道强调,AI安全不能只押注于“让模型学会拒绝”。在能力提升与风险外溢同步扩大的背景下,拒绝机制、外部防护、人工审核与行业治理需要共同构成防线;如何建立更透明、可评估的有害边界,仍是AI产业需要回答的问题。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
来源:驱动中国 · 原文链接:https://www.qudong.com/article/525862.html
本文价值 ★★★★★ — 成为第一个评分的人
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友

分享卡已生成

长按下方图片保存,转发到朋友圈或微信群

分享卡