エントリーの編集
エントリーの編集は全ユーザーに共通の機能です。
必ずガイドラインを一読の上ご利用ください。
On-policy のはずが Off-policy になる:LLM 強化学習 の rollout mismatchと対策(rollout correction) - ABEJA Tech Blog
記事へのコメント1件
- 注目コメント
- 新着コメント
注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています
- バナー広告なし
- ミュート機能あり
- ダークモード搭載
関連記事
On-policy のはずが Off-policy になる:LLM 強化学習 の rollout mismatchと対策(rollout correction) - ABEJA Tech Blog
ABEJAでデータサイエンティストをしている服部です。 今回はGRPOなどのLLMの強化学習の中で実際に起こり... ABEJAでデータサイエンティストをしている服部です。 今回はGRPOなどのLLMの強化学習の中で実際に起こりうる少しマイナーだけど重要かもしれない強化学習のRollout時に発生するトピックについての記事です。 過去にもAgenticRLに関しての記事も書いてますので、こちらも興味ある方いましたら読んでいただけると幸いです。 tech-blog.abeja.asia 本記事は何となくでもGRPOなどの手法で何をしているか知っている前提の記事になっています。 上記記事をベースにした内容をW&B様のホワイトペーパーにも寄稿しており、こちらには強化学習の基礎から書かれているのでこちらももし良ければご確認いただければです。 wandb.ai 学習とRolloutでのズレ 実際にズレが起こりうるかを見てみる。 同じtokenでも、確率は一致しない ズレの大きさの分布を見てみる 今回の範囲で言えそう



2026/06/21 リンク