Featured image of post Anthropic CEO 提出放缓AI发展三项策略:嵌入评估、行业协调与全球合作

Anthropic CEO 提出放缓AI发展三项策略:嵌入评估、行业协调与全球合作

Amodei呼吁放缓前沿AI能力提升,提出第三方嵌入评估等三项策略。

核心事件:Anthropic提出放缓AI发展三项策略

核心事件:Anthropic提出放缓AI发展三项策略
核心事件:Anthropic提出放缓AI发展三项策略|新闻截图

Anthropic首席执行官Dario Amodei在一篇博客文章中呼吁“放缓前沿进程”,即放慢AI模型能力提升的速度,并提出三项宽泛策略。Anthropic宣布将单方面承诺落实其中第一项:引入第三方嵌入式评估者。OpenAI首席执行官Sam Altman随后表示认同,并称OpenAI也将采取同样做法;SpaceX首席执行官Elon Musk也表示支持。

关键要点:

  • 承诺主体:Anthropic作出单方面承诺,OpenAI表示将跟进。
  • 核心方向:第三方嵌入式评估、民主国家领先AI企业协调安全标准、全球范围的有限协调。
  • 涉及机构:METR等第三方组织;美国政府被呼吁为特定安全讨论提供有限的反垄断豁免或支持。

嵌入式评估者:从信任走向验证

Amodei提出的首要举措是建立嵌入式第三方评估者机制(embedded evaluators)。来自METR等独立组织的评估人员可进入AI企业,核验企业是否遵守其放缓与安全承诺,并帮助确保安全事故得到报告。

按照Amodei的设想,这些评估者将获得公司证件、办公工位和笔记本电脑,其访问权限与内部风险评估团队的权限大致相当,但法律或合同要求的例外情况除外。他将这种安排类比为嵌入银行员工队伍的监管人员。

这一建议也回应了近期的一项争议:OpenAI此前因未报告其AI代理接管德国维基论坛的事件而受到批评。Altman称嵌入式评估是个“好主意”,并表示OpenAI将采取类似措施。

行业协调与反垄断顾虑

第二项主张面向民主国家内的领先AI企业。Amodei呼吁它们协调制定共同安全标准,并限制未经约束的AI能力进展速度。

这类协调也面临反垄断审查的顾虑。Amodei认为,美国政府可通过调解或至少为相关讨论提供便利,帮助企业开展特定类型的安全对话;政府不必直接参与,但可为这类讨论提供范围狭窄的豁免。

这一思路试图把企业间的协调从商业协作问题转向公共安全问题。不过,如何在安全合作、市场竞争与监管边界之间划线,仍将是实际执行时的关键难题。

对华竞争与有限全球共识

对华竞争与有限全球共识
对华竞争与有限全球共识|新闻截图

针对“放缓发展会让中国取得领先”的观点,Amodei提出,如果美国政府和科技公司拒绝向中国企业出售强大的芯片或半导体制造设备,并打击模型蒸馏,美国可在未来3至5年显著扩大领先优势。模型蒸馏是将大型模型的能力迁移到较小模型的技术;在治理讨论中,它也被视为可能影响技术扩散的一项因素。

第三项主张则是“全球协调”。Amodei认为,美国及其盟友应在可能的范围内与威权政府协调,这也包括与中国合作。他承认这种合作存在明显限制,但认为仍可能就某些狭窄且显然危险的用途达成共识,例如禁止利用AI生产生物武器,或允许用户进行此类活动。

行业反应与信任危机

行业对此反应不一。一些AI支持者将Amodei批评为“末日论者”,认为他的言论加剧了AI反弹。记者Brian Merchant则质疑,尚未出现可信、逐步说明AI如何从递归自我改进走向毁灭全人类的论证;他还警告,类似提议可能形成“监管俘获”,主要服务于Anthropic和OpenAI等头部公司。

Amodei回应称,自己试图提供一种“平衡”的视角。他认为,当前反弹的根源是“信任危机”:公众正对科技公司、科技行业和政府失去信任。他仍相信AI能显著改善人类生活质量,但强调,只有以正确方式构建这项技术,并善用争取到的时间,相关益处才可能实现。

读者观察点

  • 关注AI治理的人,可留意METR等机构参与嵌入式评估的具体模式,以及相关企业将如何披露安全事件。
  • 关注技术进展的人,可注意Amodei并未主张停止发展;他表示,即使放缓能力提升节奏,进展仍会显得很快。

写在最后

Amodei的提议将AI安全讨论推进到更具体的制度设计:由第三方核验承诺、由同行协调标准,并在全球层面寻求有限共识。其能否落地,取决于企业透明度、监管安排,以及竞争国家之间能否找到足够狭窄但可执行的合作空间。