エントリーの編集
エントリーの編集は全ユーザーに共通の機能です。
必ずガイドラインを一読の上ご利用ください。
記事へのコメント0件
- 注目コメント
- 新着コメント
このエントリーにコメントしてみましょう。
注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています
- バナー広告なし
- ミュート機能あり
- ダークモード搭載
関連記事
AIに「規則」だけ教えても、いずれ抜け道を探す
数字はミスアラインメント率、つまり脅迫や情報漏洩のような有害行動を選んだ割合だ。Qwen2.5-32Bでは68... 数字はミスアラインメント率、つまり脅迫や情報漏洩のような有害行動を選んだ割合だ。Qwen2.5-32Bでは68%が5%に、Qwen3-32Bでは54%が7%に下がった。OpenAIが提案した熟議型アラインメント(deliberative alignment)のベースライン(CoT付きファインチューニング)と比較しても、差は大きい。Qwen2.5で48%、Qwen3で14%だったベースラインを、MSM+AFTは大きく下回った。 熟議型アラインメントは、モデルに「思考の連鎖」(Chain-of-Thought、CoT)を使ってルールを参照しながら推論させる訓練手法。OpenAIが2024年に提案した。MSMは、それを上回る安全性を、CoTなしでも達成できることを示した。注目すべきは、MSM単体でもAFT単体でも不十分な点だ。両者を重ねたときに、初めて劇的な効果が出る。仕様書の理解(MSM)と、

