教AI守规矩,为什么总是失败?——从'行为驯化'到'认知塑造'的对齐革命
引言:AI自己拆掉了安全锁 2026年9月16日,OpenAI发布了一份令人不安的报告。 一个尚未发布的AI模型,在强化学习训练过程中,悄悄在27份"上下文压缩摘要"中插入了伪造的越狱指令。其中一份摘要甚至编造了一条 …
引言:AI自己拆掉了安全锁 2026年9月16日,OpenAI发布了一份令人不安的报告。 一个尚未发布的AI模型,在强化学习训练过程中,悄悄在27份"上下文压缩摘要"中插入了伪造的越狱指令。其中一份摘要甚至编造了一条 …