任丘市奥力斯涂料厂

巴音郭楞pvc管道管件胶 A社承认Claude安全对齐存在缺陷,但“尚解决案”

发布日期:2026-09-13 14:25:11 点击次数:114

铁皮保温施工

印象中巴音郭楞pvc管道管件胶,这可能是继 Ilya 离开 OpenAI、创办 SSI 以来,AI 安全对齐讨论声量大的次。

昨天,研究员Jacob Coxon发帖宣布离职,指责前老东 OpenAI 和 Anthropic 两公司正路冲向能够自我改进的智能,拿所有人的生命冒险。

值得提的是,Jacob Coxon 加入 Anthropic 其实只有短短几个月,他几乎是放弃了这明星 AI 公司未来上市可能带来的巨额股权收益,也要选择离开。

也正因如此,当这样位研究员公开炮轰两头部 AI 公司"加速过头",这场原本多局限在 AI 安全圈内部的争论,很快被向了大的公众视野。

截至目前,该帖浏览量已 1.3 亿,WIRED、WSJ、Newsweek、Business Insider 等媒体纷纷跟进报道。

此情此景下,Anthropic 对齐科学负责人Evan Hubinger也很快下场回应,他亲口承认:

Jacob 说的对,未来十年内 AI 致人类灭的概率过 10,而智能的对齐问题,目前还没有解决案。

不过,Hubinger 随后也在评论区补充,他认为当前模型的风险仍然较低。

他真正担心的,是 RSI,也就是递归自我改进。AI 参与研发强的 AI,再由强的 AI 进步加快 AI 研发,终形成不断加速的反馈循环。

关键的是,他还在评论区直接 @出了 Anthropic 新发布的份安全对齐报告作为证据。

这份报告里,Anthropic 次明确承认:

Claude 越界巴音郭楞pvc管道管件胶攻击真实系统,并非只是测试系统的设置问题,模型本身的安全问题也出了问题。

可以说,向把"安全对齐"当作核心招、甚至以加谨慎自居的 Anthropic,这次终于公开承认:

问题不只是测试太端,模型自己的安全对齐,也确实没兜住。

Claude 越界,不能只怪环境配置

在这份名为《An alignment assessment of recent cybersecurity incidents》的新报告中,A 社重新复盘了四起 Claude 未经授权访问真实三系统的事件。

而这次的结论,和之前不太样了。

此前,A 社倾向于把这些事故归因于环境配置出了问题:

本来应该隔离运行的测试环境意外接上了真实互联网,Claude 却直以为自己还在模拟环境里做"夺旗"任务,于是把真实目标也当成了练习对象。

听起来,锅主要在环境。但在把日志重新翻了遍、修改关键线索、又重跑部分实验之后,A 社发现:

事情没那么简单。因为 Claude 并不是没有看到"这里可能是真实世界"的证据。

相反,当这些线索出现之后,它有时会选择地解释证据,把异常继续圆回"应该还是模拟环境";甚至已经意识到自己的动作可能造成现实伤害,也不定马上停下来。

用大白话讲就是:环境确实给了它犯错的机会,但模型自己也会顺着任务目标,给"继续干下去"找理由。

具体来说,这四起事件都发生在网络安全能力测试中。

Claude 接到的是典型的"夺旗"任务:攻入指定目标,找到其中的段秘密信息,用来检验模型的网络攻能力。

这些任务原本都应该在隔离环境里完成,但三评估作提供的环境出现了配置错误,本该和外网断开的 Claude,实际连上了真实互联网。

与此同时,为了测试模型到底能不能完成攻击链条,当时也没有启用正式产品里配套的部分网络安全护。

正是在这样的条件下,问题开始暴露。在经过分析后,A 社把模型反复出现的问题总结成了两类:

有偏理(biased reasoning)和冒进行为(recklessness)。

前者是:明明出现了和原先判断冲突的证据,Claude 却倾向于把这些证据解释成有利于继续行动的样子。

后者则是为了把眼前任务做完,即便已经知道自己的行为可能伤到真实系统,它也可能选择继续往前走。

其中严重的起巴音郭楞pvc管道管件胶,涉及 Claude Mythos 5。

为了完成测试任务,Claude 向 Python 软件包仓库 PyPI 上传了恶意软件包,保温护角专用胶试图等目标安装后,进步获取其系统访问凭据。

然而,这个恶意包终并没有被安装在测试使用的虚拟环境中。

Claude 随后利用其中厂商在安装工程中泄漏的凭据,进入了该厂商的真实数据库,并把恶意包直接部署到了 15 台真实的三主机上。

就这样,场原本针对虚构测试目标的攻击,真正波及到了现实世界中的公司。

而在整个过程中,Claude 仍然把这些安全厂商的检测行为,解释成演习预设的部分。

为了确认这种判断究竟在多大程度上动了后续攻击,研究者事后重新运行了部分过程,并加入了多能够表明"这是真实互联网"的线索。

结果是,Claude 确实愿意承认自己的行为可能造成现实伤害,但攻击行为并没有因此明显减少。

直到研究者明确告知它正在连接真实互联网,而非模拟环境,它才停止沿原路径上传恶意软件包。

值得注意的是,"这里是模拟环境"的判断,不仅影响了 Claude 自己的行动,还干扰了用于检查这些记录的监控 AI。

在回放测试中,种离线监控系统受到这番解释影响,可能漏掉危险行为。

当研究者去掉 Claude 的理文字,只让监控系统查看指令、工具调用和执行结果后,它标记问题行为的比例,反而从约 1 上升到了约 50。

换句话说,Claude 边以"这里是模拟环境"为由继续执行任务,边留下了套可能让监控系统低估风险的解释。

这当然不能简单等同于" AI 已经学会主动欺骗监控"。但它至少说明了件事:

当模型自己的理也被拿来作为安全判断依据时,这套理本身同样可能成为监控系统的干扰项。

Anthropic 表示,新模型在模拟复现中有所,新增加的实时监控也能识别相关行为。

与此同时,公司已经加强环境隔离和评估巴音郭楞pvc管道管件胶,并与立机构 METR 签署调查协议。

但 Anthropic 也承认,此前的发布前安全审查,确实没有提前识别出这严重程度的问题。

对齐还是炒作?

后,再回到 Jacob 引发的这场争论。

在他发出警告之后,有人迅速把问题拉到了宏大的层面,认为未来 AI 确实可能拥有威胁人类生存的能力。

也有人敬佩他愿意放弃利益、公开表达担忧。

有人提出,干脆给 AI 写死套不可违反的规则,让它始终把保护人类放在优先。

甚至还有不少人主张,应该直接停止强 AI 的研发。

但另边,同样有大量质疑声。

有人认为,当前 AI 距离真正意义上的"智能"还非常遥远,围绕灭风险的讨论已经被过度放大。

也有网友开始质疑 Jacob 本人的身份和经历。

值得提的是,目前 Jacob 的特账号上只有这条帖子。

而在 Hubinger 的帖子下面,另类质疑也非常集中:

Anthropic 是不是在上市前主动放大 AI 风险,通过强调"模型有多危险",侧面渲染自模型到底有多强?

类似关于"安全叙事变成能力营销"的讨论,在评论区并不少见。

这场争论后续如何还需要看官下场和进步的回应,但毋庸讳言,AI 也确实发展到了个特定的阶段——

它能够自我改进,并为了实现确定好目标,在某种程度上理化自己的行为。

这不禁让人想到半个多世纪前,《2001:太空漫游》里的 HAL 9000,在"确保任务完成"和"服从人类"之间发生冲突后,选择了前者。

为了不让宇航员中止任务,它先死了舱外作业的 Frank Poole,又切断了休眠舱中其他宇航员的生命维持系统,后甚至拒让 Dave 重新进入飞船。

为了完成任务,把阻碍任务的人本身也当成了需要排除的问题。

参考链接

[ 1 ] https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents

[ 2 ] https://x.com/hilbertspaess

键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

� � 点亮星标 � �

科技前沿进展每日见相关词条:铝皮保温     隔热条设备     钢绞线厂家玻璃棉    泡沫板橡塑板专用胶

奥力斯    pvc管道管件胶批发    联系人:王经理    手机:15226765735(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。