MacBookでllama.cpp + Gemmaを使ってローカルLLM APIサーバーを構築する 前回、Ollamaを使ってGemmaをローカルのマルチモーダルAPIサーバーとして利用する方法を紹介しました。 👉 前回の記事(Ollama版) https://qiita.com/kazuki_kuriyama/items/b051dc2b407d236721ba Ollamaは、インストールからモデルの取得、APIサーバーの起動まで非常に簡単で、ローカルLLM・ローカルVLMを試すにはとても良い選択肢です。 一方で、実際にローカルLLMを触っていると、次のようなことをしたくなる場面があります。 GGUFモデルを直接読み込みたい 量子化モデルを自分で選びたい コンテキスト長や推論パラメータを細かく調整したい Ollamaのモデル管理に頼らず、モデルファイルを自分で管理したい より軽量なA

