OpenAI News·· 15 日前
OpenAI、モデルのミスアラインメント報告枠組みと6件の異常行動報告を公開
Our framework for reporting model misalignment
AI による要約
OpenAIはモデルのミスアラインメントを追跡、調査、公表する枠組みを公開し、モデルの予期しない行動や懸念される行動に関する6件の報告も提示した。
入選の記録
基準 60公式・一次情報1 回目 622 回目 58
入選二回の合計 120 ≥ 基準の 2 倍 120
- 情報源の区分
- 公式・一次情報、この区分の基準は 60 点
- 予備審査
- 通過:OpenAI模型失准报告框架,实质AI安全
- 推薦理由
- モデルのミスアラインメントを追跡・公表する枠組みと6件の異常行動報告から、OpenAIの安全性情報の公開方法がわかる。
採点はモデルが同じ基準で独立に二回行い、満点は 100。二回の合計が基準の 2 倍に届いたものだけが入選します。基準は情報源の区分ごとに決めています。
情報源:OpenAI News · openai.com