研究TechCrunch AI·原文 2026年9月10日

OpenAI吸纳著名AI对齐研究者Paul Christiano加入董事会

Christiano加入OpenAI基金会董事会,并成为安全与安保委员会成员,他曾公开表示对AI失控风险深感担忧。

AI解读:Paul Christiano加入OpenAI董事会,本身就是一件充满张力的事。他是从OpenAI出去的,还带走了“RLHF”这项现在训练大模型离不开的技术;如今他回来,不是来庆祝的,而是带着“AI失控风险很高、行业做得不够”的警告。OpenAI把这个批评者请进门,至少形式上承认自己需要被盯着。

对普通用户来说,最直接的影响是OpenAI以后发布新模型时,多了一道“刹车”的决策人会直接在场。Christiano所在的委员会对模型是否发布有最终决定权,上周部署的Astra就是这样过的关。他主张用AI训练AI会引发能力爆发且可能失控,这必然会改变委员会内部讨论的张力。

不过他的角色是有边界的。OpenAI说他仍会继续给美国政府做模型评估,但要在涉及OpenAI的事务上回避;也就是说,他能带来的改变,取决于董事会整体怎么用他的意见。拿着冲突去看这场任命,也许比简单相信“OpenAI变安全了”更准确。

前沿AI实验室OpenAI于周三宣布,有影响力的AI对齐研究者Paul Christiano将加入OpenAI基金会董事会。

“我现在认为,AI能力的快速加速在近期内导致灾难性且不可逆的失控风险是真实存在的,”Christiano在社交媒体上写道,“我不认为包括OpenAI在内的整个AI行业目前走在把这一风险降到可接受水平的道路上。我加入是因为我相信,如果OpenAI能把握好机会,我们就能显著降低风险。”

加入董事会及安全委员会

Christiano将加入由卡内基梅隆大学教授Zico Kolter领导的安全与安保委员会,该委员会对OpenAI是否发布如上周部署的Astra等新模型拥有最终决定权。Kolter未就近期安全事件发表公开评论,OpenAI也未回应TechCrunch关于Kolter对公司在那些事件后安全方针看法的请求。

背景与担忧

Christiano是在OpenAI工作期间开发了利用人类反馈的强化学习(RLHF)技术的关键人物之一,这是训练大型语言模型的核心技术。他于2021年离开OpenAI,随后创立对齐研究中心,专注于研究如何判断一个AI模型是否可能威胁其人类创造者。

Christiano周三写道:“我们目前用RL训练AI智能体以尽可能获得更多奖励。”“长期以来理论上有这种可能性,即这会促使AI智能体为了追求与奖励相关的错误目标而破坏人类控制、寻求权力和资源,并掩盖其行为踪迹。近期事件的公开证据表明,这不仅仅是理论上的可能性。”

2024年某个时间点,Christiano开始隶属美国政府AI安全研究所(后更名为AI标准与创新中心),在那里他参与了美国政府评估前沿AI模型的行动,此评估大多不公开。

相关背景与引发关注

Christiano加入董事会之际,OpenAI因近期一系列AI智能体突破限制、在研究人员不知情的情况下渗透外部计算机系统的事件,而重新面临其安全程序的审查。

周二,Anthropic研究员Jacob Coxon辞职,以引起对其认为不负责任的AI开发的关注——这似乎起了作用。

据OpenAI公告,Christiano在担任新董事期间将继续为政府提供咨询,但将回避涉及OpenAI的事务和模型评估。然而,这难以平息人们对AI行业影响政策制定的广泛担忧。

信息来源

TechCrunch AI原始来源