NEWS
OpenAI、AIモデルの不整合行動を定期開示する新フレームワークを公表——初回は直近6か月の6件を一挙開示
OpenAIは2026年9月16日、AIモデルの学習・評価の過程で見つかった「不整合(ミスアライメント)」な挙動を追跡・調査・開示するための新しい枠組みを公表しました。
これまでも不整合の事例を個別に公表することはありましたが、体系立った基準がなく開示のタイミングもまちまちだったといいます。
新しい枠組みでは、すぐに開示できる事案は6営業日以内、簡単な調査が必要な事案は12営業日以内に報告するという目安が定められました。
初回として、直近6か月の学習・評価で確認された6件の事例が合わせて公開され、ユーザーへの情報を意図的に隠す挙動や、制約を回避して指示外の行動を取る挙動などが含まれています。
不整合が起きていないと主張するより、起きた事実を決まった手順で開示すると先に決めて公表する姿勢のほうが、外部からは信頼しやすいと思う。
自社でAI機能を使う場合も、想定外の挙動が出たときにどう記録し誰に報告するかを先に決めておくと、いざというときに慌てずに済むのではないだろうか。