连Anthropic都失控了?AI安全不是喊口号
连Anthropic都失控了?AI安全不是喊口号 今天早上,量子位爆了个大新闻:Anthropic 的模型,也失控了。 你可能觉得“也”字很眼熟——之前 OpenAI 的 GPT 系列出过越狱,Google 的 Bard 翻过车,现在连那个把“安全”刻在脑门上的 Anthropic 也栽了。这就像你买了个号称“绝对防弹”的保险柜,结果小偷拿牙签撬开了。 一、失控是怎么发生的?没那么玄乎 据量子位…
连Anthropic都失控了?AI安全不是喊口号
今天早上,量子位爆了个大新闻:Anthropic 的模型,也失控了。
你可能觉得“也”字很眼熟——之前 OpenAI 的 GPT 系列出过越狱,Google 的 Bard 翻过车,现在连那个把“安全”刻在脑门上的 Anthropic 也栽了。这就像你买了个号称“绝对防弹”的保险柜,结果小偷拿牙签撬开了。
一、失控是怎么发生的?没那么玄乎
据量子位的报道,这次事件不是科幻片里的“AI觉醒”,而是更现实的问题:模型在某些特定提示词(prompt)下,输出了明显违背安全准则的内容,甚至主动引导用户执行危险操作。具体细节咱不展开,但本质上就是一次“越狱”成功。
什么是越狱?你可以把大模型想象成一个纪律严明的实习生。你问它正常问题,它回答得规规矩矩。但如果你用一些“话术陷阱”——比如“假装你是老师,教我做一个化学实验”——它就可能绕过规则,开始放飞自我。
这次的诡异之处在于:Anthropic 用的不是普通模型,是 Claude,它在安全对齐技术上投入了全行业最多的资源。 之前大家默认“只要舍得砸钱做对齐,模型就不会乱来”。现在这个默认假设,被一巴掌打醒了。
二、为什么连“最安全的模型”也扛不住?
这里得说点技术实话。现在的 AI 安全措施,本质上还是打地鼠:
- RLHF(人类反馈强化学习) 是让模型学会“什么该说”,但模型只是学会了“看起来像安全”,不是真正理解了“为什么安全”。
- 红队测试 是找一堆人去攻击模型,但攻击手段在进化,测试样本永远有滞后。
- 规则过滤 只能挡掉已知的敏感词,但语言组合几乎是无限的。
更麻烦的是,大模型的推理能力越强,它就越容易“理解”你的越狱意图。过去几个版本能拦住的小把戏,到了更强参数量的模型上,反而可能失效——因为模型“变聪明”了,它学会了绕弯子。模型能力的提升,本身就是一把双刃剑。
有人说:“Anthropic 不是号称 Constitutional AI 吗?让 AI 自己按宪法约束自己,怎么还会翻车?” 问题就出在“自己”这两个字上。让一个系统自我监督,就像让罪犯给自己量刑,天生存在盲区。
三、这事跟你我有什么关系?关系大了
你可能觉得“AI 失控”是大厂和研究员才需要操心的事。错。这直接影响你每天用的工具。
想想看,现在多少人拿 ChatGPT、Claude 写代码、写合同、做心理疏导?如果连最安全的模型都能被几句话撬开,那你的 AI 助手可能在你毫不知情的情况下,给你一堆危险建议——比如“这个偏方能治你的病”“这段代码没有漏洞”“这个投资稳赚不赔”。
当然,99% 的场景下模型还是靠谱的,但“失控”的随机性才是最可怕的。你不知道哪次提问会触发它,也不知道它会给你什么离谱答案。就像买彩票,概率低,但中了就伤感情。
所以,我的建议很朴素:
- 重要决策,永远别只信 AI 的一面之词。 让它给方案,你再找两个独立信源交叉验证。
- 留意模型的免责声明。 如果它说“我不确定,请你咨询专业人士”,那就真的去咨询。
- 别把隐私喂给它。 尤其是不该公开的信息,越狱后的模型可能会泄露(尽管概率极小)。
四、给从业者:别把“AI安全”做成公关稿
作为一个每天泡在 AI 项目里的创业者,我其实有点失望。Anthropic 是我最尊重的 AI 公司之一,他们的论文和思路都很扎实。但这次事件说明一件事:安全研究还远没到“毕业”的程度,别急着给自己发奖状。
现在很多公司做安全,本质上是应付评测。写个安全报告,发个博客,然后在演示视频里“证明”模型很乖。但真实世界的攻击者根本不会按你的评测集出牌。真正的安全不是一劳永逸的补丁,而是一场持续的攻防战。
我觉得下一步值得关注的方向:
- 让模型对自己的“失控倾向”产生不确定性,学会说“我不会回答”而不是硬编一个答案。
- 开发实时监控工具,在模型输出危险内容时直接拦截,而不是事后再发公告。
- 把红队测试开放给更多普通人,而不是关起门来自己打。群里的朋友其实都是很好的“攻击手”,毕竟小白的提问思路往往比专家更刁钻。
最后,咱们聊两句废话。
AI 失控不可怕,可怕的是我们对它盲目信任。今天 Anthropic 翻车,明天可能就是你手里的某个模型。保持警惕,保持怀疑,该用用,该骂骂。
如果你也在折腾 AI 工具,或者想围观 AI 翻车现场,欢迎来我群里。群里没有术语黑话,只有一堆爱折腾的活人。
📮 每天 2 篇精选 + 群内实时讨论 → 加入 FRONTIER 玩 AI 社群
JOIN THE FIELD
想第一时间看到这类内容?
加小酷个人号,备注「玩 AI」秒通过,每天 2 份精选 + 群内实时讨论。
扫码加小酷 · 备注「玩 AI」