記事へのコメント1

    • 注目コメント
    • 新着コメント
    tomonagata
    RolloutバックエンドにvLLM、学習バックエンドにFSDPなどを使う構成が一般的だが、実装差により確率比計算に歪みが生じる。実験ではQwen3-4BでvLLMとTransformersの確率が一部のTokenで最大0.2以上乖離することを確認。

    その他

    注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています

    アプリのスクリーンショット
    いまの話題をアプリでチェック!
    • バナー広告なし
    • ミュート機能あり
    • ダークモード搭載
    アプリをダウンロード

    関連記事

    On-policy のはずが Off-policy になる:LLM 強化学習 の rollout mismatchと対策(rollout correction) - ABEJA Tech Blog

    ABEJAでデータサイエンティストをしている服部です。 今回はGRPOなどのLLMの強化学習の中で実際に起こり...

    ブックマークしたユーザー

    • tomonagata2026/06/21 tomonagata
    すべてのユーザーの
    詳細を表示します

    同じサイトの新着

    同じサイトの新着をもっと読む

    いま人気の記事

    いま人気の記事をもっと読む

    いま人気の記事 - テクノロジー

    いま人気の記事 - テクノロジーをもっと読む

    新着記事 - テクノロジー

    新着記事 - テクノロジーをもっと読む

    同時期にブックマークされた記事

    いま人気の記事 - 企業メディア

    企業メディアをもっと読む