OpenAI首席科学家警告:最关键的CoT监控正在失灵
- GPT0%
动察 Beating AI 快讯,OpenAI 首席科学家 Jakub Pachocki 发文警告,他们用来检查 AI 是否对齐的一项核心手段,正变得越来越不可靠。这个方法叫 CoT 监控,就是观察模型写出来的推理过程,看看它有没有隐藏目标或危险想法。
OpenAI 一直把 CoT 监控当作主要押注。o1-preview 当初没有公开完整思维链,一个重要原因就是不想直接训练和约束 CoT,以免模型学会隐藏真实意图。到了 GPT-6 Astra,这套方法依然非常重要。
但 OpenAI 的内部评估显示,CoT 监控正在越来越靠不住。模型现在更会控制自己的推理过程,而且即使不把推理写出来,也能继续变聪明。Pachocki 担心,模型能力继续增长后,人类可能越来越难看清它到底是怎么做出决定的。
他还指出,目前没有任何实验室把对齐和监控解决到足以长期全速扩展模型的程度。在建立共同安全门槛前,他希望 AI 实验室主动放慢速度,必要时 OpenAI 也会暂停进一步扩展模型。
来源:BlockBeats
免责声明:当前内容均来自第三方观点或由AI直接翻译第三方观点,CoinEx不保证内容的真实性、准确性和原创性,不构成CoinEx相关的任何投资建议。数字资产价格波动剧烈,请注意潜在风险。
热搜榜
- 币种价格24H涨跌