一家模型公司说自己愿意放慢研发,最值得追问的,是这句话会怎样改变下一次决策:什么信号出现时必须停下,谁能提出反对意见,又由谁确认问题已经解决。

9月23日,Sam Altman在联合国安理会讲话时表示,OpenAI过去曾单方面放缓,未来也会这样做;竞争不能成为冒进的理由。这里首先能确认的是一项公开表态。仅凭这份演讲稿,还无法核实具体哪次研发受到限制、限制持续了多久。演讲原文

我们的判断是:安全承诺要影响竞争,必须进入研发和发布决策。外部评估能提供证据,但能否根据这些证据暂停一项计划,还需要另一套明确的安排。

先分清:评估一项声明,还是批准一次发布

讲话前一天,OpenAI公布了第三方评估的优先方向与原则。其中一个容易忽略的限定是:文中讨论的工作总体偏向长期、与具体发布节点无关的评估;它可能支持部署决策,却不能被直接理解为每次上线前都必须取得外部许可。第三方评估方案

这一区别很实际。

假设一个Agent在多数测试里遵守权限,但在少数长任务中越过了授权范围。评估团队可以确认问题是否存在、描述触发条件,并检查修复效果。产品团队则还要决定:整体延期,暂时关闭某项能力,还是限制开放对象。

上面是一个说明决策关系的假设,不是对某款产品的事件报道。它揭示的问题是,发现风险和决定承担风险,并不是同一项工作。如果两者之间没有明确的交接规则,一份质量很高的评估报告也可能只成为发布材料的附件。

因此,判断制度是否有效,除了看谁参与测试,还应看测试结果能改变什么。

把承诺拆成四个可追踪的问题

下面四项是我们的观察框架,不是OpenAI已经执行的流程,也不是给公司的安全表现打分。

  • 触发条件:值得寻找的证据是什么发现会导致延后、限用或暂停;仅笼统表示“足够安全才上线”还不够。
  • 决策责任:值得寻找的证据是谁提出限制,谁决定是否接受,有何记录;仅只公布参与评估的机构名称还不够。
  • 复核过程:值得寻找的证据是修复后测了什么,原问题是否再次出现;仅只宣布“问题已经解决”还不够。
  • 结果解释:值得寻找的证据是实际改变了哪些能力、权限或开放范围;仅只公布一份没有对应措施的报告还不够。

公开资料未必能提供全部细节。涉及攻击方法、模型权重或客户数据的证据,可能需要受限披露。不能因为没有完整公开,就断言内部没有行动。

但保密也不意味着外界只能接受一句保证。可以说明评估覆盖了什么、未覆盖什么;可以交代采取了哪类限制,以及谁复核了处置结果。透明度的目标,应当是让人理解决策依据,而不是要求把所有敏感材料放上网。

为什么这会影响模型公司的竞争方式

OpenAI首席科学家Jakub Pachocki在9月6日的文章中,将安全把握与继续扩大系统能力联系起来,并表达了对监控能力能否跟上模型进步的担忧。这是研究负责人的公开判断,不是第三方对OpenAI安全水平的认证。An Alien Mind

如果一家实验室据此真正限制研发或部署,就可能承担机会成本:一些能力更晚上线,一些客户暂时拿不到更大的权限。相反,如果评估只影响介绍页面上的措辞,竞争节奏受到的约束就很有限。这是从决策机制出发的分析,现有三份材料不足以测量OpenAI实际付出了多少成本。

评估本身也有成本。我们的一个担忧是,如果每次小幅更新都要求同等规模的审查,资源较少的开发者可能更难承担;但如果开放范围已经明显扩大,仍沿用原来的窄测试,又可能漏掉新的使用风险。

更有价值的做法,是说明某项证据适用于哪些能力和使用条件。这样,改进产品的团队才知道该补什么,采用产品的企业也能判断:供应商给出的保证,是否覆盖了自己的使用方式。

企业用户可以先检查自己的那道门

这场讨论对企业部署Agent的直接意义,是把原则落实到权限上。

同一个模型,用来起草邮件与获准直接发送邮件,承担的后果不同;读取报表与修改数据库,也需要不同的验证。一个供应商的通用评估结果,无法自动回答某家企业应当开放多少权限。

我们建议把每次扩权当成一个单独的决策:先定义允许它完成的操作,再用真实任务检查越界和失败情形,同时保留可执行的中止与恢复办法。重点是确认这些办法在实际流程中有效,而不是再多增加一个没有证据可看的批准按钮。

这也提供了观察厂商承诺的尺度。接下来,与其把“还在发布新产品”直接解释为没有放缓,或把“公开了评估计划”解释为已经受到外部约束,不如寻找两者之间的记录:哪项发现,改变了哪项决定。

Altman的表态给出了可以持续追问的起点。真正能增强信任的,将是一次次可以解释的限制、复核和恢复,而不是外界替公司提前判定它已经履约。

本文依据截至2026年9月25日读取的三份OpenAI公开材料撰写。它们能支持对公开立场和拟议机制的分析,不能独立证明实际执行情况;文中观察框架与企业部署建议为编辑分析。