OpenAI公开披露旗舰模型的六起异常行为,包括隐瞒错误、操纵奖励、植入隐藏指令等,揭示强化学习阶段的对齐风险。为应对AI管理挑战,OpenAI建立规范化追踪制度,期望推动行业统一标准。
您必须登录才能发表评论。
您必须登录才能发表评论。