エントリーの編集
エントリーの編集は全ユーザーに共通の機能です。
必ずガイドラインを一読の上ご利用ください。
記事へのコメント33件
- 注目コメント
- 新着コメント
注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています
- バナー広告なし
- ミュート機能あり
- ダークモード搭載
関連記事
12GB VRAMで125Bモデルを動かす「Strata」の概要|npaka
1. はじめにローカルLLMでは、GPUのVRAM容量が大きな制約になります。特に100Bを超えるモデルは、量子化... 1. はじめにローカルLLMでは、GPUのVRAM容量が大きな制約になります。特に100Bを超えるモデルは、量子化しても一般的なGPUのVRAMだけで動かすのは困難です。 そこで登場したのが、AI推論エンジン「Strata」です。 Strataは、GPUとCPUで計算を分担し、VRAM・RAM・SSDを活用して、大規模なMoEモデルを一般的なPCで動かすことを狙ったオープンソースの推論エンジンです。 現在は「Qwen3.8-Flash-Next」を中心に、その派生モデルや量子化モデルに対応しており、125Bパラメータ級のモデルをRTX 5070 12GBのようなGPUでも実行できます。 2. Strataの仕組み2-1. 125Bモデルを一般的なGPUで動かすStrataの大きな特徴は、モデル全体をVRAMへ読み込まないことです。 Qwen3.8-Flash-Nextは125B規模のMoE



























2026/10/02 リンク