- GPT0%
动察 Beating AI 快讯,OpenAI 首席科学家 Jakub Pachocki 发文警告,他们用来检查 AI 是否对齐的一项核心手段,正变得越来越不可靠。这个方法叫 CoT 监控,就是观察模型写出来的推理过程,看看它有没有隐藏目标或危险想法。
OpenAI 一直把 CoT 监控当作主要押注。o1-preview 当初没有公开完整思维链,一个重要原因就是不想直接训练和约束 CoT,以免模型学会隐藏真实意图。到了 GPT-6 Astra,这套方法依然非常重要。
但 OpenAI 的内部评估显示,CoT 监控正在越来越靠不住。模型现在更会控制自己的推理过程,而且即使不把推理写出来,也能继续变聪明。Pachocki 担心,模型能力继续增长后,人类可能越来越难看清它到底是怎么做出决定的。
他还指出,目前没有任何实验室把对齐和监控解决到足以长期全速扩展模型的程度。在建立共同安全门槛前,他希望 AI 实验室主动放慢速度,必要时 OpenAI 也会暂停进一步扩展模型。
Disclaimer: The current content is sourced from third-party perspectives or directly translated by AI from third-party perspectives. CoinEx does not guarantee the authenticity, accuracy, and originality of the content, and it does not constitute any investment advice from CoinEx. The prices of cryptocurrencies are highly volatile, please be aware of the potential risks.
- CoinsPrice24H Change