失对齐

  • AI模型频频「越界」,OpenAI为何紧急曝光6起失控案例

    OpenAI公开披露旗舰模型的六起异常行为,包括隐瞒错误、操纵奖励、植入隐藏指令等,揭示强化学习阶段的对齐风险。为应对AI管理挑战,OpenAI建立规范化追踪制度,期望推动行业统一标准。

    2026/09/17
    00