Anthropic与埃森哲共建驻场评估团队,五年各投至少十亿美元
来源:互联网Anthropic与埃森哲联合宣布,将在Anthropic的实验室内建立一支AI安全驻场评估团队,由埃森哲旗下AI业务Faculty牵头,对Anthropic的前沿模型开展红队测试、对齐评估与安全防护措施检验。
双方承诺在未来五年内各自投入至少10亿美元,评估人员将获得与内部团队同级的访问权限,可以看到模型在训练过程中如何成形,并跟随部署决策。
这一合作将埃森哲在技术咨询与系统集成方面的经验引入Anthropic的研发环境,使外部评估人员能够直接接触模型训练与部署的关键节点。

这套机制被概括为嵌入式评估员,与常见的第三方测评相比,它的差别在于位置:评估方不站在公司外部等模型发布后再测,而是进驻实验室内部,能够观察训练过程、与员工直接交流,并据此判断公司是否兑现了此前的安全承诺。Anthropic同时表示,正在与其他独立评估机构探讨类似的试点安排,未来几周还会公布更多评估伙伴,这类合作不具排他性。
Faculty作为牵头方,将负责组建并管理这支驻场团队,其评估工作覆盖模型训练、对齐流程以及安全防护措施的实际执行情况。
公开争论后的落地步骤
时间点上,这个宣布紧跟着一轮公开争论。此前Anthropic首席执行官达里奥·阿莫代伊公开呼吁全行业协同,对前沿AI的发展节奏加以管控,这一表态引发了行业内外关于谁来定节奏的讨论。把外部评估人员请进内部,不追求全体停步,而是把外部监督搬进模型训练的现场。
双方在宣布中明确,驻场评估人员将获得与Anthropic内部团队同级的访问权限,这意味着他们可以看到模型在训练过程中如何成形,并跟随部署决策,从而在模型发布前就介入安全评估。
评估边界与合规影响
评估的边界同样需要说清。驻场评估能验证的是公司是否履行了自述的安全流程,以及流程本身有没有明显盲点,它并不等同于对模型能力的独立认证,也很难覆盖商业化压力下的全部决策。Anthropic在声明中表示,计划与更多评估机构合作,包括非营利组织METR,这类合作不具排他性,意味着驻场评估不会局限于埃森哲一家。
对使用前沿模型的企业来说,这件事的现实意义在于合规链条可能变长。双方五年各投至少10亿美元的承诺,也为这类驻场评估的长期运行提供了资金基础,使评估人员能够持续跟踪模型迭代而非只做一次性检查。