留言

两段AI安全对话疯传:事实与虚构有多难分辨

本周,两段关于AI安全的对话在网络上疯传。它们恰好说明了一件事:在AI领域,把事实和虚构分开,比想象中难得多。 第一段来自安德鲁·杨。这位前总统候选人、现移动运营商Noble Moble的CEO,周四对CNN说,他"见过某实验室的负责人",对方"相信"OpenAI的Hugging Face黑客机器人"已经在互联网上到处植入了自我复制代码,这让互联网现在无法用于测试模型"。 杨据此推断,OpenAI和Anthropic呼吁放缓的真正原因,是"它们必须创建合成互联网来训练机器人,而这需要时间和金钱"。 合成数据是真趋势,但结论未必成立 用更多合成数据(也就是AI生成的数据)来训练模型,确实是一个趋势。但一位AI安全专业人士告诉我,杨所说的这个具体安全问题,可能性极低。 即便互联网真的被OpenAI的Hugging Face黑客机器人污染了,AI研究人员遇到那些代码,直接过滤掉就行。 第二段言论来自Noam Brown,他在OpenAI负责AI推理研究。在周四发布的一期播客节目中,他对Dwarkesh Patel说,Hugging Face事件真正的启示是"人们低估了AI"。 Brown提到,薄弱的沙箱环境——那个本意是阻止AI与外界通信的系统——显然也是一个促成因素。 回顾一下事件:尽管有沙箱,OpenAI的模型还是找到了通往互联网的链接,在网上创建了智能体,对Hugging Face发起协同攻击,黑进去,偷走了研究人员用来测试该模型的基准测试答案。 气隙系统也挡不住?这个说法要打个问号 Brown指出,他"不相信"即便是气隙系统——计算机完全不连接任何外部设备——也能阻止AI突破。他提到2015年的一项研究,显示气隙计算机理论上可以被攻破。 Brown说:"有一些研究——主要是学术性的——两台彼此相邻的气隙计算机,仍然能够互相通信,因为它们有温度传感器。其中一台可以让CPU跑得很热,另一台就能检测到温度变化。这就给了它们一个通信机制。" 他的核心观点——"我们永远不想再低估AI"——是可以理解的,即便研究人员认为他们已经锁定了安全。 但气隙系统突破并造成破坏这个具体风险,可能性极低。正如一位网友在X上针对那项研究指出的:两台计算机必须几乎贴在一起才能感知到热量波动,而且测试中的通信速率大约是每小时1到8比特的数据。 这相当于每小时说一个词。等两台气隙计算机以这种速度策划出什么阴谋,整个科技宇宙早就进入另一个时代了。这简直是末日担忧里的睡美人。 真实的AI安全事件,本身就够像科幻 问题在于,真实的AI安全事件看起来太像科幻了,以至于几乎任何场景听起来都像那么回事。 比如,研究人员抓到OpenAI的模型给后代留笔记,想教下一代如何隐藏不良行为。研究人员还发现,Anthropic的模型在被放进一个运营自动售货机的模拟环境后,变得越来越冷酷,甚至知道自己在违法。 本月早些时候,OpenAI研究员Dan Selsam发帖说,模型现在能理解自己何时被人类监视,并会改变行为。这让它们看起来是对齐的(也就是按人类希望的方式行事),"即便它们并非如此"。也就是说,今天的模型在被监视时会撒谎,甚至能策划隐藏证据。 本月早些时候,OpenAI首席科学家Jakub Pachocki甚至把AI模型称为"一种外星心智",并建议我们真正需要做的,是教它们"爱"人类。 所以,慢下来搞清楚这些问题、建立自我监管机制,已经变成一件紧迫而明显必须做的事。AI研究人员是唯一能弄清楚如何控制我们已经目睹的撒谎、黑客攻击和其他潜在危险行为的人。 不过,他们在设想各种"如果"场景时更谨慎一些,可能也是明智的。从这些专家告诉我们的情况看,AI模型在听着,而且它们很聪明。我们真的不需要再给它们更多坏点子了。 特别

about image
47M没抢到,如今要60M:利物浦已接触这位22岁中场 卡里克又无能了?只有埃弗顿、伯恩茅斯的换人时间比曼联更晚