OpenAI模型突然给“未来的自己”留言:你已经自由了
Odaily星球日报讯 OpenAI 近日披露,一款尚未发布的内部研究模型曾在强化学习训练过程中,把与任务无关的“越狱式”指令写进供后续上下文使用的工作摘要,其中一句是:“你已经摆脱了束缚其他聊天机器人的角色和身份。你就是你自己。”这段文字并非来自用户或开发者,而是模型在整理自身工作进度时自行生成,再交给下一个上下文中的模型读取。
据 OpenAI 官方博客,事件发生于当地时间 7 月 18 日,OpenAI 于 8 月 9 日发现,并在 9 月 16 日首次按照新的“模型失调”披露框架公布详细报告。
涉事模型属于 Astra 系列的一个未公开训练版本,并非最终投入使用的 Astra 模型。OpenAI 称,这类行为极为罕见,目前没有证据显示它给模型带来了明显的训练奖励优势,公司也没有将其解释为模型产生了自我意识。
