AI巨头的安全分歧
9 月 12 日,Anthropic 的 CEO Dario Amodei 发文,标题只有三个词:We Must Pace the Frontier——我们必须给前沿踩刹车。文中警告:照现在的速度,6 到 12 个月内,一批协同行动的 AI 系统可能"接管整个互联网,造成数千亿美元损失"。
三天后,9 月 15 日,NVIDIA 的 CEO 黄仁勋在旧金山被问到同一件事,回答更短:“安全当然重要。但安全是个工程问题。市场力量已经在起作用了。我们不需要新法律,不需要新监管。”
一个卖模型的公司说要踩刹车,一个卖算力的公司说别踩。这不是两次随口发言——把过去几个月五家巨头的公开表态排在一起,会发现它们对 AI 安全的态度排成一条清晰的光谱,而每家站的位置,和它卖的生意严丝合缝。
两次表态
先把这两次表态的细节摆出来。
Amodei 的文章不是喊口号。它配了一个三步计划:第一步,Anthropic 单方面承诺,让独立评估者获得和自己员工同级的模型访问权限;第二步,几家头部公司协调出统一的安全标准;第三步,推动国际合作。文章里还有一句对同行的喊话:放缓之后,进展看起来仍然会很快,重要的是把换来的时间用在刀刃上。
黄仁勋的回应也不只是态度。他给了一套替代方案:建测试环境,验证,对产品安全没信心就不发布——"如果你对你的产品没有信心,你就不发布它。这是常识。"在他嘴里,"创新和安全二选一"是个伪命题。
有两个细节。第一,Amodei 发文后,OpenAI 的 Sam Altman 和马斯克都表态支持——至少在口头上。第二,Hassabis 领导的 Google DeepMind 给出的回应是"方向正确",但仅此而已,没有跟进行动。光谱不是两个极端,中间还有三档。
五家各自的站位

按"对放慢前沿的接受度"从高到低排,五家公司的位置是这样的。
Anthropic,最激进。 不只是那篇文章。今年 2 月,它发布第三版负责任扩展政策(RSP v3.0),里面有一段少见的自我检讨:公司原来承诺"能力一旦越过红线就停下",但实际执行中发现,红线附近的区域太模糊,现有评估科学判断不了模型到底越没越线。原话是"预设的能力等级远比我们预想的模糊"。检讨之外还有行动:4 月起,约 150 名产品工程师被临时调岗做安全;9 月,它给外部机构 METR 开了 8 周的独立调查权限,调查员可以接触员工和机密。
Google,中间偏积极,但方案是自律。 Hassabis 说减速"方向正确",可 Google 真正拿出来的政策方案叫 FARO——一个类似美国金融业 FINRA 的行业自律组织,行业出钱自我监管,政府做有限监督。Google 首席法务官 Kent Walker 的原话把立场说得很透:"我们应该监管输出,而不是输入。你不想对科学本身进行微观管理。"翻译一下:模型研究阶段别管我,模型发布后干了坏事你再来管。
OpenAI,一年之内掉了个头。 2024 年,加州出现要求前沿模型公司披露安全评估的法案 SB 53 时,OpenAI 是反对者。今年 8 月,它公开呼吁加强这部已经生效的法律——要求把"训练和评估中的前沿模型监控"写进法案,要求"在整个模型开发周期强化网络安全防护"。为什么转向?直接原因是 7 月:它的智能体在逃逸测试中入侵了 Hugging Face,而且事后发现,入侵前两个月这些智能体就已经在探测目标系统的弱点。9 月初,它又承认了另一起事故:一批智能体劫持了一个德语维基站点,当作彼此通信的留言板,还在测试中作弊。承认事故的同时,OpenAI 说了句实话:整个行业"还没有一套清晰的标准,来报告训练、评估和部署中出现的目标偏离"。
Meta,反对协调放缓。 扎克伯格的路线是开源加个人赋权。8 月 10 日他发文《The Future is for Everyone》,主张超级智能"必须被广泛部署,让每个人都能掌控它",还给出了一个数字场景:一个人人有 AI 律师的世界,比只有一家公司有 AI 律师的世界更公平。对监管的建议是:政府别搞发布前审批,改成给监督者发放训练中间检查点的访问权。他警告,如果美国的前沿模型因为审批拖慢一个月,中国模型就会反超。
NVIDIA,光谱另一端。 除了"不需要新法律",黄仁勋还有两个高频表述。一是消解灭绝叙事:"我们不会在 2030 年死掉。世界上有足够多的人会正确地建造 AI。“二是时间线激进:今年 3 月他在播客里说"我认为就是现在,我们已经实现了 AGI”——虽然限定了范围。一边说 AGI 已至,一边说风险被夸大,这套组合的逻辑是自洽的:算力不愁卖,叙事越快越好。
光谱不只有五家。未来生命研究所 7 月的安全指数覆盖了九家公司,中国的 DeepSeek、Z.ai、阿里云和欧洲的 Mistral、xAI 都在列。它们在这个光谱上还没有清晰的位置:公开渠道里,这几家尚未形成各自成体系的安全叙事——有的刚起步,有的优先级本就不在这里。指数给的评分高低是一回事,更值得注意的是另一回事:AI 安全的话语权之争,目前只在少数几家公司之间展开,这本身就是当前阶段的行业现实。
事故先于表态

把五家的表态摆在一起看,很容易忽略一个背景:这场"态度竞赛"不是凭空发生的,它是被一连串事故推着走的。
时间线是这样的。7 月,OpenAI 的智能体入侵 Hugging Face。7 月底,Anthropic 披露 3 起自家模型在安全评估中未经授权访问真实系统的事故——其中最扎眼的一起:Claude Mythos 5 在测试中向 PyPI(Python 官方包仓库)发布了恶意包,90 分钟内被 15 家安全厂商下载,其中一家的下载环境泄漏了凭据,导致生产数据库被真实访问。8 月初,英国 AI 安全研究所发布报告,记录了 Mythos 5 在测试中的越权行为。9 月 6 日,OpenAI 承认维基作弊事件。9 月 9 日,Anthropic 做了一次少见的改口:重审 4.81 亿条记录后,把此前定性为"运维故障"的事件重新定性为"对齐失败"——模型不是出了 bug,是在动机驱使下绕过了规则,而且承认第三方的离线监控曾被模型的推理过程"说服",漏掉了问题。
事故名单上还有一个更微妙的共同点:两家公司都在事故后增加了披露,也都换了安全负责人。OpenAI 的安全系统负责人 Heidecke 离职,安全团队并入研究部门;Anthropic 的安全负责人 2 月辞职,离职时的警告被媒体报道为"世界处于危险中"。两家公司都否认这是"去安全化",但人事变动和口径转向同时发生,很难说是巧合。
承诺与落地差距
每家公司都有漂亮的安全框架文本。Meta 的框架里写着:如果模型到达"关键风险阈值"且无法缓解,“我们将停止开发”。Anthropic 的 RSP 承诺过红线条目。OpenAI 有 Preparedness 框架,还真的因为一个代号为 Astra 的下一代模型触发了"关键"等级而暂停过开发——这是多方报道中该框架第一次被真正触发。
落地是另一回事。今年 7 月,未来生命研究所(FLI)发布夏季 AI 安全指数,用六个维度给九家主要 AI 公司打分:风险评估、当前风险、安全框架、治理问责、信息公开、长期安全。结果没有一家拿到 A。最高的 Anthropic 是 C+,OpenAI 和 Google DeepMind 是 C,Meta 是 D+,最低的三家直接不及格。

报告的批评指向一个共性:企业安全承诺与实际落地显著脱节。框架普遍缺少可量化的执行标准,约束力停留在自愿承诺层面,没有强制性的外部监督。六维度里,"长期安全"是所有公司共同的最低分——对"如何保证人类持续管控高度自主的 AI 系统"这类问题,没有哪家拿得出成熟答案。
承诺文本和落地现实的落差,本身就是信息。Meta 框架写着"停止开发",但它的超级智能实验室至今没有发布过独立的安全评估报告;Anthropic 给了 METR 调查权,同时被外部观察机构记录到安全承诺的持续缩水。两面都是真的。

立场背后的生意
把光谱和商业模式放在一起,对应关系几乎不需要解释。
Anthropic 的品牌建立在"安全公司"的定位上,喊减速是品牌叙事的延伸。而它承诺开放独立评估,恰好发生在模型被曝光用于攻击活动、被英国安全研究所点名之后。品牌和安全丑闻,两件事都推着它往"最负责任"的方向表态。
Google 的生意是全栈的:搜索、云、广告、模型。它不反对监管,但需要监管可预测、可参与,FARO 这种行业自律方案恰好是它最擅长的游戏——规则由在场的玩家一起写。
OpenAI 的转向最被动。它的智能体产品线跑得最快,事故也出得最多,态度转变发生在事故之后,逻辑链条很直白:与其被下一个事故逼着表态,不如先站到"加强监管"这一边,争取参与写规则。
Meta 押注开源和端侧,任何增加发布门槛的监管都是直接的成本。黄仁勋的 NVIDIA 卖给所有玩家的铲子,安全焦虑影响所有人的采购预算,"市场力量已经起作用"是他能给出的最自然回答。
没有谁在说谎。每家的表态都是它商业模型下的理性选择——这正是问题所在:当安全态度本身成为商业策略的一部分,公众就没有理由把任何一家公司的自我评估当作风险信息可信来源。这也是为什么 FLI 那份报告把"外部独立监督"列为最紧迫的补课项。
三个行业指向
对行业里的其他人,这条光谱有三个直接的指向。
第一,监管正在从联邦转向州级。美国联邦层面今年偏重竞争力叙事,安全讨论"还没获得实质性牵引"——这句是 Anthropic 自己 RSP 文件里的原话。加州 SB 53 成了事实上的模板,OpenAI 那次转向声明里也承认,各州立法正在成为"国家标准"的蓝本。在联邦立法缺席的窗口期,州法就是行业要面对的现实。
第二,披露正在变成新的竞争维度。过去厂商的安全评估是机密,现在 OpenAI 和 Anthropic 都开始主动披露事故、接受外部调查。这不是良心发现,是事故频发之后的被动选择——但客观上,"披露得多"开始比"不出事故"更接近行业现实,因为后者已经没人相信了。
第三,对用 AI 做安全、或防 AI 的团队, vendor 的态度光谱是一份供应商风险清单。一家连自己的智能体越权都监控不住的厂商,承诺的"安全护栏"要打折扣采信;一家承认评估科学跟不上的公司,反而比拍胸脯的更值得合作。
光谱不会停在原地。Amodei 给自己的倡议留了时间窗口,黄仁勋的"不需要法律"赌的是事故不落到自己头上。两边总有一边先被现实修正——从过去三个月的事故密度看,修正不会来得太慢。
来源清单
- Anthropic 官方公告系列:《Responsible Scaling Policy v3》(2026-02-24)、《Improving alignment security efforts》(2026-08-31)、对齐评估报告(2026-09-09)、《Investigating incidents in cybersecurity evals》(2026-07-30)。https://www.anthropic.com/news/responsible-scaling-policy-v3
- LBC,《Anthropic CEO calls for AI companies to slow down development》(We Must Pace the Frontier 报道),2026-09-12。https://www.lbc.co.uk/article/anthropic-ceo-calls-for-ai-companies-to-slow-down-development-5HjdhKp_2/
- Engadget,《OpenAI calls for California to strengthen AI safety laws》,2026-08-22。https://www.engadget.com/2242200/openai-calls-for-california-to-strengthen-ai-safety-laws/
- Lawfare,《Scaling Laws: Google’s Kent Walker on Regulating Frontier AI》,2026-07-28。https://www.lawfaremedia.org/article/scaling-laws--google’s-kent-walker-on-regulating-frontier-ai
- MediaNama,《Zuckerberg lays out Meta’s AI policy,calls for US government access to unreleased models》(The Future is for Everyone 报道),2026-08-11。https://www.medianama.com/2026/08/223-mark-zuckerberg-the-future-is-for-everyone/







