エントリーの編集
エントリーの編集は全ユーザーに共通の機能です。
必ずガイドラインを一読の上ご利用ください。
VQAからDocument Parsingへ:Nemotron-3-Nano-Omniに対する日本語文書の構造化出力Post-training - Stockmark Tech Blog
記事へのコメント0件
- 注目コメント
- 新着コメント
このエントリーにコメントしてみましょう。
注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています
- バナー広告なし
- ミュート機能あり
- ダークモード搭載
関連記事
VQAからDocument Parsingへ:Nemotron-3-Nano-Omniに対する日本語文書の構造化出力Post-training - Stockmark Tech Blog
本記事では、Nemotron-3-Nano-Omni-30B-A3B-Reasoningに日本語文書の構造化出力能力を注入しつつ、もと... 本記事では、Nemotron-3-Nano-Omni-30B-A3B-Reasoningに日本語文書の構造化出力能力を注入しつつ、もともと持っている日本語文書読解におけるVisual Question Answering (VQA:視覚的質問応答)能力をできるだけ維持する方法を検討します。比較したのは、主に次の2つの手法です。 構造化データのみを用いて教師あり微調整(Supervised Fine-Tuning、SFT)を行うこと まず構造化データとVQAデータを混合してSFTを行い、その後、構造化能力に対して強化学習(Reinforcement Learning、RL)を適用すること(mixed SFT + RL)です。 実験の結果、構造化データのみのSFTでも構造化出力能力は注入できますが、VQA性能の低下が生じます。一方、構造化データとVQAデータを混合したSFTにより忘却を緩和でき

