エントリーの編集
エントリーの編集は全ユーザーに共通の機能です。
必ずガイドラインを一読の上ご利用ください。
Anthropic、AIに「AIの安全性研究」を任せる実験 うそ、迎合などの問題行動を性能落とさず改善
記事へのコメント0件
- 注目コメント
- 新着コメント
このエントリーにコメントしてみましょう。
注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています
- バナー広告なし
- ミュート機能あり
- ダークモード搭載
関連記事
Anthropic、AIに「AIの安全性研究」を任せる実験 うそ、迎合などの問題行動を性能落とさず改善
AIに「AIの安全性研究」を任せても、人間顔負けの成果が出る――米Anthropicは8月28日(現地時間)、AIモ... AIに「AIの安全性研究」を任せても、人間顔負けの成果が出る――米Anthropicは8月28日(現地時間)、AIモデル「Claude」に他のAIの問題行動を直す研究を任せたところ、うそや追従(おべっか)など10種類の問題行動において、性能を落とさずに行動を改善する手法を発見できたと発表した。 実験には、問題行動の種類ごとに公開ベンチマークを利用。Claudeが文献調査、手法の提案、学習、テストのループを繰り返してモデルを訓練した。Claudeは全種の問題行動において安全性能を向上させ、これは人間の安全性研究者28人の提案を上回る成績だったという。

