記事へのコメント2

    • 注目コメント
    • 新着コメント
    misshiki
    “AirLLM は推論メモリの使用を最適化し、量子化、蒸留、プルーニングなしで 70B の大規模言語モデルを単一の 4GB GPU カードで推論できるようにします。また、8GB VRAMで405B Llama3.1 を実行できるようになりました。”

    その他
    stealthinu
    4GBでLlama3 70Bが動くといううりなんだけど、なんでそんなことが可能になってるんだろう?事前quantize不要と書かれてるが内部でquantizeしてる感じ/transformerのレイヤごとに計算してるらしい。動くが遅い

    その他

    注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています

    アプリのスクリーンショット
    いまの話題をアプリでチェック!
    • バナー広告なし
    • ミュート機能あり
    • ダークモード搭載
    アプリをダウンロード

    関連記事

    GitHub - lyogavin/airllm: AirLLM 70B inference with single 4GB GPU

    You signed in with another tab or window. Reload to refresh your session. You signed out in anoth...

    ブックマークしたユーザー

    • tasukuchan2026/08/04 tasukuchan
    • igrep2026/08/02 igrep
    • manboubird2026/02/22 manboubird
    • misshiki2024/11/05 misshiki
    • dhesusan46492024/11/04 dhesusan4649
    • bbnsd2024/11/03 bbnsd
    • mole-studio2024/11/03 mole-studio
    • toshikish2024/11/03 toshikish
    • ryoma_robo2024/11/03 ryoma_robo
    • stealthinu2024/11/02 stealthinu
    • cutc-mt2024/11/02 cutc-mt
    すべてのユーザーの
    詳細を表示します

    いま人気の記事

    いま人気の記事をもっと読む

    いま人気の記事 - テクノロジー

    いま人気の記事 - テクノロジーをもっと読む

    新着記事 - テクノロジー

    新着記事 - テクノロジーをもっと読む

    同時期にブックマークされた記事

    いま人気の記事 - 企業メディア

    企業メディアをもっと読む