並び順

ブックマーク数

期間指定

  • から
  • まで

1 - 40 件 / 64件

新着順 人気順

llama cpp server githubの検索結果1 - 40 件 / 64件

  • とほほのローカルAI入門 - とほほのWWW入門

    docker run -it --name hf python:3.14 bash apt update apt -y install vim pip install transformers torch from transformers import pipeline pipe = pipeline(task="text-generation", model="distilgpt2") print(pipe("Hello")) Can I Run AI locally? 概要 https://www.canirun.ai/ WebGPU などの技術を用いてアクセス元 PC のスペックを調べ、スペックに応じたモデルをリストアップしてくれるサイトです。 ダウンロードサイズやメモリ消費量・速度などの目安も提示してくれます。 Llama.cpp 概要 LLaMa, Mistral, Gemma

    • DeepSeek R1をほぼ準備なしからローカルGPUで動かす|しぴちゃん

      しぴぴぴ! Vtuberのしぴちゃん (https://www.youtube.com/@CP-chan)です。普段はゲーム配信しかしてませんが、たまにAIについて発信することがあります。今日はAIの記事の方。 現在はローカルAIモデルに関する連載をしています。 第一弾 本記事(DeepSeek R1をほぼ準備なしからローカルGPUで動かす) 第二弾 Cline+ローカル版DeepSeek R1でAIコーディングを使い放題にする(高スペックマシン向け) 最近話題のローカルで動くLLM、DeepSeek R1 をローカルGPU環境(NVIDIA)で動かしてみましょう。 多少のコマンドラインの操作ができれば、事前にローカルLLMを触ったことがなくてもインストールできるように書くつもりです。 サムネはDeepSeek R1くんに画像を生成してもらおうとしたところです(そんな機能はありません)。

        DeepSeek R1をほぼ準備なしからローカルGPUで動かす|しぴちゃん
      • わずか4GBの実行ファイル1つで大規模言語モデルによるAIを超お手軽に配布・実行できる仕組み「llamafile」をWindowsとLinuxで簡単に実行してみる方法

        「llamafile」は大規模言語モデルのモデルやウェイトの情報が1つの実行ファイルにまとまった形式のファイルです。Linux・macOS・Windows・FreeBSD・NetBSD・OpenBSDという6つのOS上でインストール不要で大規模言語モデルを動作させることが可能とのことなので、実際にWindowsおよびLinuxディストリビューションの1つであるDebian上で動かしてみました。 Mozilla-Ocho/llamafile: Distribute and run LLMs with a single file. https://github.com/Mozilla-Ocho/llamafile#readme Introducing llamafile - Mozilla Hacks - the Web developer blog https://hacks.mozilla

          わずか4GBの実行ファイル1つで大規模言語モデルによるAIを超お手軽に配布・実行できる仕組み「llamafile」をWindowsとLinuxで簡単に実行してみる方法
        • How to Setup a Local Coding Agent on macOS

          I'd had my internet fail a few times recently leaving me stranded without a coding agent, and so when I saw the "Gemma 4 now runs 2x faster with MTP" Multi-Token Prediction update for Gemma 4 I decided to have a go at getting it running. I wanted a local coding agent setup that: was fast enough to actually use on my Mac worked through an OpenAI compatible API (so I could use it in other tools) and

            How to Setup a Local Coding Agent on macOS
          • ローカルLLMで「Pi」エージェントを動かす

            数年前、LLMがコードを書いてくれるようになった当初は、チャットインターフェースでAIとやり取りするのが当たり前でした。しかし、2025年を境にその常識は一変しました。今やチャット形式でのプログラミングは「非効率」とされ、AIエージェントが自律的にタスクをこなす時代になっています。 ただ、この「エージェント時代」には大きな悩みがあります。それは課金です。 なぜ今、ローカルLLMエージェントなのか 現在、市場で最もシェアが高いと思われる「Claude Code」などの商用エージェントサービスは、サブスクリプション費用が月に200ドル(約3万円以上)かかることも珍しくありません。大学生や新社会人の個人開発において、この出費は無視できない重荷です。 もちろん、より安価なプランやAPI利用料を抑えたOpenモデルも存在しますが、クラウドモデルを使う以上、データが分析や学習に利用されるリスクはゼロで

              ローカルLLMで「Pi」エージェントを動かす
            • Qwen3 の概要|npaka

              以下の記事が面白かったので、簡単にまとめました。 ・Qwen3: Think Deeper, Act Faster 1. Qwen3本日 (2025年4月28日) 、「Qwen3」をリリースしました。「Qwen3-235B-A22B」は、「DeepSeek-R1」「o1」「o3-mini」「Grok-3」「Gemini-2.5-Pro」などの他のトップティアモデルと比較して、コーディング、数学、一般的な機能などのベンチマーク評価で競争力のある結果を達成しています。さらに、小型のMoEである「Qwen3-30B-A3B」は、10倍のアクティブパラメータを持つ「QwQ-32B」を凌駕し、「Qwen3-4B」のような小さなモデルでさえ、「Qwen2.5-72B-Instruct」の性能に匹敵します。 2つのMoEモデルをオープンウェイト化しています。「Qwen3-235B-A22B」は、総パラメ

                Qwen3 の概要|npaka
              • gpt-oss の使い方|npaka

                以下の記事が面白かったので、簡単にまとめました。 ・Welcome GPT OSS, the new open-source model family from OpenAI! 1. gpt-oss「gpt-oss」は、OpenAIによる待望のオープンウェイトリリースであり、強力なReasoning、エージェントタスク、そして多様な開発者ユースケース向けに設計されています。117Bのパラメータを持つ大規模モデル「gpt-oss-120b」と、21Bのパラメータを持つ小規模モデル「gpt-oss-20b」の2つのモデルで構成されています。どちらも「MoE」(Mixture-of-Experts) であり、MXFP4を使用することで、リソース使用量を抑えながら高速推論を実現します。大規模モデルは単一のH100 GPUに収まり、小規模モデルは16GBのメモリ内で動作し、コンシューマーハードウェア

                  gpt-oss の使い方|npaka
                • チャットAI「LLaMA」を一発でローカルにインストールして「文章の続きを書く機能」を試せる「Dalai」使い方まとめ

                  FacebookやInstagramの運営元であるMetaが開発した言語モデル「LLaMA」は、単体GPUで動作する手軽さとChatGPTに匹敵する性能を両立しているとして話題になっています。そんなLLaMAをApple シリコン搭載Macで動作可能にした「llama.cpp」をGUI付きで簡単に動作させられる「Dalai」が登場したので、実際にインストールして「文章の続きを書く機能」を試してみました。 dalai https://cocktailpeanut.github.io/dalai/ Dalaiを使うには、JavaScript実行環境「Node.js」や開発者向けツール詰め合わせパック「Command Line Tools」を先にインストールしておく必要があります。今回はiMacを使って、必要なソフトウェアから順番にインストールしてみます。既に環境が整っている場合は、「Dalai

                    チャットAI「LLaMA」を一発でローカルにインストールして「文章の続きを書く機能」を試せる「Dalai」使い方まとめ
                  • 8GBメモリでOK!Raspberry Pi 5で使える日本語対応ローカルLLM一覧 - uepon日々の備忘録

                    以前のエントリなどでも触れていましたが、Raspberry Pi 5(8GB RAM)でリアルタイム対話可能な日本語LLMは実現可能となりつつあります。それも、特別なハードウェアを使用することなしにです。 これは、1B〜3Bパラメータのモデルでもかなり優秀になってきているからです。そのなかでもGemma3:1b、TinySwallow-1.5B(日本語特化)、Qwen2.5:1.5b〜3bといったモデルが有力な候補となるでしょう。 (7Bクラスは動作はしますがかなり遅く実用性に難あり) また、プラットフォーム的な話としては、llama.cppはOllamaより10〜20%高速ですが、セットアップの容易さではOllamaが優れています。Ollamaで試してみて、更なる高速化が必要となればllama.cppに乗り換えるというのがいいかもしれません。 今回想定しているハードウェア・OSの要件 R

                      8GBメモリでOK!Raspberry Pi 5で使える日本語対応ローカルLLM一覧 - uepon日々の備忘録
                    • 第905回 新年度特別企画 llama.cppでコマンドラインベースのローカルLLM入門[VRAM容量別編] | gihyo.jp

                      Ubuntuのバージョンは24.04.4 LTSです。 llama.cppの準備 LLMを動作させるのはllama.cppとします。バイナリの用意はGPUのメーカー別に分かれるので個別に紹介します。 NVIDIA CUDA llama.cppではUbuntuのNVIDIA CUDA用バイナリは配布していないので、自前でビルドする必要があります。 おおむね第891回のとおりですが、NVIDIAドライバーのバージョンは現時点で最新バージョンの590としています(図1)。 図1 執筆段階での最新版は590 CUDAのバージョンも最新の13.2としています。インストール方法は次のとおりです。 $ ~/Downloads/ $ wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2404/x86_64/cuda-ke

                        第905回 新年度特別企画 llama.cppでコマンドラインベースのローカルLLM入門[VRAM容量別編] | gihyo.jp
                      • 第883回 Minisforum AI X1 PROでLLMを高速に動作させる | gihyo.jp

                        今回はベアボーンのMinisforum AI X1 PROにUbuntu 24.04.3をインストールし、さらにROCm 6.4.4とllama.cppを組み合わせてLLMを高速に動作させます。 ミニPCでLLM 筆者はこれまで、主にディスクリートGPU(グラフィックボード、以下dGPU)でLLMを動作させていましたが、昨今はミニPCで使用することも当たり前になりました。ミニPCとなれば当然統合GPU(CPU/SoCに内蔵しているGPU、以下iGPU)です。Ryzen AI Max 300シリーズが性能としては最高峰で、GMKtek EVO-X2やMinisforum MS-S1 MAXなど各社から搭載PCが発売されていますが、価格が高いのでなかなか手が出ません。 性能は1ランク落ちるものの、Ryzen AI 300シリーズ搭載であればベアボーンモデルもあるAI X1 PROであれば、まだ

                          第883回 Minisforum AI X1 PROでLLMを高速に動作させる | gihyo.jp
                        • ローカルで各種AIモデルを実行できる無料ソフト「llama.cpp」がマルチモーダル入力をサポートし画像の説明などが可能に

                          AIモデルをローカルで実行できるオープンソースソフトウェア「llama.cpp」が画像の入力に対応しました。画像とテキストを同時に入力して「この画像には何が写っている?」といった質問に回答させられます。 server : vision support via libmtmd by ngxson · Pull Request #12898 · ggml-org/llama.cpp · GitHub https://github.com/ggml-org/llama.cpp/pull/12898 llama.cpp/docs/multimodal.md at master · ggml-org/llama.cpp · GitHub https://github.com/ggml-org/llama.cpp/blob/master/docs/multimodal.md Trying out ll

                            ローカルで各種AIモデルを実行できる無料ソフト「llama.cpp」がマルチモーダル入力をサポートし画像の説明などが可能に
                          • GitHub - drumih/turbo-fieldfare: Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook

                            Gemma 4 26B-A4B inference in about 2 GB of RAM A custom Swift + Metal runtime for any Apple Silicon Mac, even the 8 GB ones. Quick start · Local server · Benchmarks · Contribute results · How it works · Experiments · References Memory got expensive. So I gave a 26-billion-parameter model a ~2 GB budget. TurboFieldfare runs the instruction-tuned Gemma 4 26B-A4B without loading the entire 14.3 GB mo

                              GitHub - drumih/turbo-fieldfare: Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook
                            • GitHub - antirez/ds4: DeepSeek 4 Flash local inference engine for Metal and CUDA

                              DrawfStar 4 is a small native inference engine specific for DeepSeek V4 Flash. It is intentionally narrow: not a generic GGUF runner, not a wrapper around another runtime: it is completely self-contained. Other than running the model in a correct and fast way, the project goal is to provide DS4 specific loading, prompt rendering, tool calling, KV state handling (RAM and on-disk), and server API, a

                                GitHub - antirez/ds4: DeepSeek 4 Flash local inference engine for Metal and CUDA
                              • ローカルLLMをEVO X2でホストする方法まとめ

                                最近買ったEVO X2でローカルLLMを動かそうと色々試してみていました。 ollama LM Studio llama.cpp などがよく聞く手段でしょうか。NVIDIA製のGPUであれば上記のどれでも安定して動くと思います。 しかしEVO X2はAMD製のGPUなため微妙に安定しません。特にrocmというNVIDIAでいうところのCUDA相当のライブラリはまだryzen ai max+ 395のGPUには対応していないようで、うまく認識されないようです。 結論: llama-cppのllama-serverが安定 GPUアクセスの方法は2種類ある rocmはまだ安定しているといえない vulkanは安定している ollamaのrocmで色々動かそうとすると安定しない LM Studioは安定して動作するがGUIを起動していないといけないので外部からアクセスさせたりする場合には不便。wa

                                  ローカルLLMをEVO X2でホストする方法まとめ
                                • 📖 vLLMのコードを読んでみよう - ENGINEERING BLOG ドコモ開発者ブログ

                                  こんにちは、NTTドコモR&D戦略部の門間です。 この記事では、vLLMのコードを追いつつその中身の動きに迫りたいと思います。 最近、業務やプライベートでLLM関連のいろいろを触っていますが、 OSSのコードリーディングを通じてLLMの推論処理への理解を深めたいというモチベーションです。 🤖 vLLMって? 📚 前提知識 Attention Is All You Need Paged Attention Continuous Batching 📦 vLLMの開発用インストール (Pythonコード開発のみ) Wheelのインストール リポジトリのクローン 起動確認 Pythonコードの改変 デバッガを使ったOSSのコードリーディングのススメ 🧩 vLLMのソフトウェアアーキテクチャ オンライン推論 : FastAPIサーバの立ち上げとEngineClientの生成 1. Engin

                                    📖 vLLMのコードを読んでみよう - ENGINEERING BLOG ドコモ開発者ブログ
                                  • Things we learned about LLMs in 2024

                                    31st December 2024 A lot has happened in the world of Large Language Models over the course of 2024. Here’s a review of things we figured out about the field in the past twelve months, plus my attempt at identifying key themes and pivotal moments. This is a sequel to my review of 2023. In this article: The GPT-4 barrier was comprehensively broken Some of those GPT-4 models run on my laptop LLM pri

                                      Things we learned about LLMs in 2024
                                    • Friends Don't Let Friends Use Ollama | Sleeping Robots

                                      > April 15, 2026 by Zetaphor updated April 18, 2026 Friends Don't Let Friends Use Ollama Ollama gained traction by being the first easy llama.cpp wrapper, then spent years dodging attribution, misleading users, and pivoting to cloud, all while riding VC money earned on someone else's engine. Here's the full history, and why the alternatives are better. Ollama is the most popular way to run local L

                                        Friends Don't Let Friends Use Ollama | Sleeping Robots
                                      • We Got Claude to Fine-Tune an Open Source LLM

                                        We gave Claude the ability to fine-tune language models using a new tool called Hugging Face Skills. Not just write training scripts, but to actually submit jobs to cloud GPUs, monitor progress, and push finished models to the Hugging Face Hub. This tutorial shows you how it works and how to use it yourself. Claude Code can use "skills"—packaged instructions, scripts, and domain knowledge—to accom

                                          We Got Claude to Fine-Tune an Open Source LLM
                                        • GitHub - antoinezambelli/forge: A Python framework for self-hosted LLM tool-calling and multi-step agentic workflows

                                          A reliability layer for self-hosted LLM tool-calling. You give forge a set of tools; the model calls whichever it wants in whatever order. Workflow structure is opt-in — required_steps, prerequisites, and terminal_tool let you constrain the loop when you need to, but forge's guardrails (rescue parsing, retry nudges, response validation) apply with zero required steps too. Forge takes an 8B local m

                                            GitHub - antoinezambelli/forge: A Python framework for self-hosted LLM tool-calling and multi-step agentic workflows
                                          • Running Google Gemma 4 Locally With LM Studio’s New Headless CLI & Claude Code

                                            Why run models locally?Cloud AI APIs are great until they are not. Rate limits, usage costs, privacy concerns, and network latency all add up. For quick tasks like code review, drafting, or testing prompts, a local model that runs entirely on your hardware has real advantages: zero API costs, no data leaving your machine, and consistent availability. Google’s Gemma 4 is interesting for local use b

                                              Running Google Gemma 4 Locally With LM Studio’s New Headless CLI & Claude Code
                                            • Llama.cpp の HTTPサーバー機能を試す|npaka

                                              「Llama.cpp」のHTTPサーバー機能を試したのでまとめました。 ・Mac M1 1. モデルの準備今回は、「vicuna-7b-v1.5.ggmlv3.q4_K_M.bin」を使います。 ・TheBloke/vicuna-7B-v1.5-GGML ・TheBloke/vicuna-7B-v1.5-16K-GGML ・TheBloke/vicuna-13B-v1.5-GGML ・TheBloke/vicuna-13B-v1.5-16K-GGML 2. ローカルPCでの実行ローカルPCでの実行手順は、次のとおりです。 (1) Llama.cppのインストールとビルド。 $ git clone https://github.com/ggerganov/llama.cpp $ cd llama.cpp $ make(2) modelsフォルダにモデルを配置。 今回は、「vicuna-7b-

                                                Llama.cpp の HTTPサーバー機能を試す|npaka
                                              • OpenInterpreter をMetalを使ったローカルのCode Llamaで使ってみた|alexweberk

                                                OpenInterpreter はデフォルトだと GPT-4 が使われるが、ローカルの Code Llama を使うこともできるということで、 試しに設定して使ってみました。 設定をする上で何点かつまづいたので、解決に繋がったものをメモします。 今回使ったハードウェア環境は、M1 Macbook Pro 16GB です。 ローカルの Code Llama を使うにはOpenInterpreter は、ローカルの Code Llama を使うことができます。 ローカルの Code Llama を使うには、以下のようにします。 interpreter --local使いたいモデルのパラーメータを聞かれるので、今回は「7B」「Medium」「GPU あり」を選択しました。 Open Interpreter will use Code Llama for local execution. Use

                                                  OpenInterpreter をMetalを使ったローカルのCode Llamaで使ってみた|alexweberk
                                                • Qwen3.5 Smallシリーズ完全ガイド — 0.8Bから9Bまで、ローカルLLMの新時代が来た|zephel01

                                                  はじめに:なぜ今「小さいモデル」が熱いのか2026年2月、Alibaba CloudのQwenチームがQwen3.5を発表しました。注目を集めたのは397Bパラメータの巨大なフラッグシップモデルだけではありません。同時にリリースされた「Smallシリーズ」——0.8B、2B、4B、9Bの4つの小型モデルが、ローカルLLMの世界に静かな衝撃を与えています。 さらに、量子化の最適化で知られるUnslothがDay Zeroアクセスを得て、これらのモデルのGGUF量子化版を即座に公開。3〜4bit量子化によって、手元のノートPCやコンシューマGPUで実用的に動かせる世界が現実のものになりました。 この記事では、Qwen3.5 Smallシリーズの技術的な革新から、各サイズの具体的なユースケース、そしてUnslothの量子化による実用的なVRAM要件まで、ローカルLLMに関心のあるすべての人に向け

                                                    Qwen3.5 Smallシリーズ完全ガイド — 0.8Bから9Bまで、ローカルLLMの新時代が来た|zephel01
                                                  • Fast and Portable Llama2 Inference on the Heterogeneous Edge

                                                    Fast and Portable Llama2 Inference on the Heterogeneous EdgeNov 09, 2023 • 12 minutes to read The Rust+Wasm stack provides a strong alternative to Python in AI inference. Compared with Python, Rust+Wasm apps could be 1/100 of the size, 100x the speed, and most importantly securely run everywhere at full hardware acceleration without any change to the binary code. Rust is the language of AGI. We cr

                                                      Fast and Portable Llama2 Inference on the Heterogeneous Edge
                                                    • WSL2でDeepSeek-R1-Distill-Qwen-32B-Japaneseをllama.cppで試してみる|noguchi-shoji

                                                      株価を暴落させているDeepSeekの蒸溜モデルをCyberAgentさんが追加学習したモデルであるDeepSeek-R1-Distill-Qwen-32B-Japanese。これをmomongaさんが量子化したモデル、を試してみます。 momongaさん、ありがとうございます。 使用するPCはドスパラさんの「GALLERIA UL9C-R49」。スペックは ・CPU: Intel® Core™ i9-13900HX Processor ・Mem: 64 GB ・GPU: NVIDIA® GeForce RTX™ 4090 Laptop GPU(16GB) ・GPU: NVIDIA® GeForce RTX™ 4090 (24GB) ※外付け ・OS: Ubuntu22.04 on WSL2(Windows 11) です。 1. llama.cppのセットアップllama-cpp-pyth

                                                        WSL2でDeepSeek-R1-Distill-Qwen-32B-Japaneseをllama.cppで試してみる|noguchi-shoji
                                                      • ローカルLLMで自動コーディングエージェントを作ってみた - LangChain + llama.cpp

                                                        まとめ ローカルLLM(llama.cpp)+ LangChainで自動コーディングエージェントを作成 プロンプトを入れると 設計書 → 実装コード → テストコード を自動生成 Dockerサンドボックスでテストを実行し、失敗したら自己修正するエージェント 実際にTodoアプリのコードが自動生成された(動くかは別として...) はじめに 「AIにコードを書かせたい」という夢、誰しも一度は抱いたことがあるのではないでしょうか。 GitHub CopilotやClaude Codeの登場で、AIによるコーディング支援は当たり前になりつつあります。しかし、完全に自律的にコードを書いて、テストして、自己修正するローカルエージェントは、まだ発展途上です。Claude Codeはかなり近いところに来ていますが、Proだとすぐに上限に達してしまいますね。 今回は、ローカルLLM(llama.cpp)と

                                                          ローカルLLMで自動コーディングエージェントを作ってみた - LangChain + llama.cpp
                                                        • 第902回 FirefoxのAIチャットボットをローカルLLMで使用する | gihyo.jp

                                                          諸般の事情で第891回とは替えています。 OSはもちろんUbuntu 24.04.4 LTSです。 ローカルLLMを動作させる LLM 今回使用するRD-RX9060XT-E16GB/DFはVRAMが16GBです。がんばって大きなモデルを使用するのではなく、第891回のようにVRAMに収まるくらいのものにします。 真っ先に考慮すべきはgpt-oss-20bです。しかし、この記事にあるように2025年8月リリースで、今となってはやや古くなっています。gpt-ossを改変したGPT-OSS Swallowにするのも手です。というわけで、両方紹介します。 gpt-oss-20b ggml-org/gpt-oss-20b-GGUFからダウンロードします(直リンク⁠)⁠。 GPT-OSS Swallow 公式には現在のところllama.cppで使える形式では配布されていません。実はそれはgpt-os

                                                            第902回 FirefoxのAIチャットボットをローカルLLMで使用する | gihyo.jp
                                                          • Reddit - The heart of the internet

                                                            Subreddit to discuss AI & Llama, the large language model created by Meta AI. Here is the thing, the expert layers run amazing on CPU (~17T/s 25T/s on a 14900K) and you can force that with this new llama-cpp option: --cpu-moe . You can offload just the attention layers to GPU (requiring about 5 to 8GB of VRAM) for fast prefill. KV cache for the sequence Attention weights & activations Routing tabl

                                                            • GitHub - koyasi777/mozkey: Mozc(Google日本語入力)をベースに、遅延付きライブ変換・ローカル Zenz 補正・ダークテーマ対応・句読点単打確定・学習ロジックの改善・文脈を見た変換補正などを統合した、ローカルファーストな日本語入力 fork です。

                                                              現時点で公開しているビルド済みパッケージと実機確認済み環境は Windows です。 macOS / Linux については、upstream Mozc 自体は対応していますが、この fork で追加した機能、ビルド設定、Zenz 同梱構成、インストーラーまわりについては、まだ実機確認できていません。 Windows 用のビルド済み MSI は Releases からダウンロードできます。 通常の 64-bit Windows では、Releases にある最新の Mozkey_v*_x64.msi を使用してください。 本 fork のリリースは個人用の experimental build として公開しています。 Zenz 同梱版は、ローカル推論 runtime と GGUF model を含むため、従来の offline MSI よりファイルサイズが大きくなります。 Windows

                                                                GitHub - koyasi777/mozkey: Mozc(Google日本語入力)をベースに、遅延付きライブ変換・ローカル Zenz 補正・ダークテーマ対応・句読点単打確定・学習ロジックの改善・文脈を見た変換補正などを統合した、ローカルファーストな日本語入力 fork です。
                                                              • What I learned building an opinionated and minimal coding agent

                                                                What I learned building an opinionated and minimal coding agent 2025-11-30 It's not much, but it's mine Table of contents In the past three years, I've been using LLMs for assisted coding. If you read this, you probably went through the same evolution: from copying and pasting code into ChatGPT, to Copilot auto-completions (which never worked for me), to Cursor, and finally the new breed of coding

                                                                  What I learned building an opinionated and minimal coding agent
                                                                • What I learned building an opinionated and minimal coding agent

                                                                  What I learned building an opinionated and minimal coding agent 2025-11-30 It's not much, but it's mine Table of contents In the past three years, I've been using LLMs for assisted coding. If you read this, you probably went through the same evolution: from copying and pasting code into ChatGPT, to Copilot auto-completions (which never worked for me), to Cursor, and finally the new breed of coding

                                                                    What I learned building an opinionated and minimal coding agent
                                                                  • OpenCode × Ollama でローカル完結のセルフホスト型コーディングエージェントを構築する - Qiita

                                                                    Deleted articles cannot be recovered. Draft of this article would be also deleted. Are you sure you want to delete this article? はじめに ターミナルで動く AI コーディングエージェントが一気に増えました。なかでも OpenCode は、GitHub スター 17万超(2026年6月時点)で 最も多くのスターを集めた OSS コーディングエージェント です。Claude Code に似た使い勝手を、特定ベンダーに縛られず・自分のインフラ上で動かせるのが大きな特徴です。 この記事では、OpenCode を導入し、Ollama でローカルの LLM につないで「コードがクラウドに出ていかない」自己ホスト型のコーディングエージェント環境 を構築する手順を、実際の設定フ

                                                                      OpenCode × Ollama でローカル完結のセルフホスト型コーディングエージェントを構築する - Qiita
                                                                    • So you want to build your own open source ChatGPT-style chatbot… – Mozilla Hacks - the Web developer blog

                                                                      So you want to build your own open source ChatGPT-style chatbot… (Expanded from a talk given at DWeb Camp 2023.) Artificial intelligence may well prove one of the most impactful and disruptive technologies to come along in years. This impact isn’t theoretical: AI is already affecting real people in substantial ways, and it’s already changing the Web that we know and love. Acknowledging the potenti

                                                                        So you want to build your own open source ChatGPT-style chatbot… – Mozilla Hacks - the Web developer blog
                                                                      • 第904回 ミドルレンジのグラフィックボードで生成AI入門[Intel編] | gihyo.jp

                                                                        B760M Pro RS/D4 WiFiのPCIeは4.0対応ですが、H670M-ITX/axはPCIe 5.0対応ということで入れ替えてみたものの、PCIe 5.0でリンクしているようには見えませんでした。UEFI BIOSの設定をいじったりはしてみたのですが。 OSはもちろんUbuntu 24.04.4 LTSです。 ドライバーのインストール 24.04.4のカーネル6.17はB580に対応しているので、ドライバーのインストールは必須ではありませんが、ここではドキュメントの内容を少々アレンジしてインストールします。次のコマンドを実行してください。 $ sudo add-apt-repository -y ppa:kobuk-team/intel-graphics $ sudo apt-get install -y libze-intel-gpu1 libze1 intel-metric

                                                                          第904回 ミドルレンジのグラフィックボードで生成AI入門[Intel編] | gihyo.jp
                                                                        • GPUなしで動く!1GB小型LLM「LFM 2.5」の導入方法と実力検証 - uepon日々の備忘録

                                                                          2026/01/21追記あり:LM Studioから直接モデルのダウンロードができる様になりました。 2026/01/21追記あり:N100CPUでの動作スピードを追記(約8tokens/s)。 最近、ローカルLLMを動かすためのGPUやメモリの価格が高騰していて、「新しくPC環境を揃えるのはちょっと厳しいな…」と感じることが増えました。「大きいモデルを動かすには、それなりのスペックが必要」という前提でやってきましたが、そろそろ別の戦略を考える必要がありそうです🤔 そんな中、最近よく耳にするようになったのが SLM(Small Language Model) という言葉です。小型だけど実用的なモデルが少しずつ増えてきていますね。今どんな感じなのか気になって情報を探していたところ、面白いモデルを見つけました。 Liquid AI が公開した 「LFM 2.5(Liquid Foundati

                                                                            GPUなしで動く!1GB小型LLM「LFM 2.5」の導入方法と実力検証 - uepon日々の備忘録
                                                                          • なんJLLM部 避難所

                                                                            0001名無しさん@ピンキー 転載ダメ (ワッチョイ e249-iArR)2023/12/17(日) 21:48:59.66ID:???0 !extend::vvvvv:1000:512 !extend::vvvvv:1000:512 AIに色々なことをしゃべってもらうんやで そこそこのデスクトップPC(できれば+3060 12GB以上)でもなんぼか楽しめるで 自薦・他薦のモデルやツールは>>2以降 本スレ なんJLLM部 ★6 https://fate.5ch.net/test/read.cgi/liveuranus/1701542705/ VIPQ2_EXTDAT: default:vvvvv:1000:512:: EXT was configured 0002名無しさん@ピンキー (ワッチョイ e249-iArR)2023/12/17(日) 21:50:26.11ID:???0 初心

                                                                            • Windows環境で、Llama.cppを用いてローカルLLMを動作させてみた|ハカセ

                                                                              なお、最新の12.3でも動作しました。 2A-1B. Cudaがインストールされている場合、 バージョン情報を確認してください。 バージョンが、12.2.0 または11.7.1ではない場合(12.3でも動作しました)、上記Cudaリンクよりダウンロードインストールしてください。 2B.llama.cppをインストールする以下リンクより、対応したzipファイルをダウンロードします。 現行の最新バージョンは、b1988です。(2024年1月29日時点) Cuda12.2.0の場合、「llama-b1988-bin-win-cublas-cu12.2.0-x64.zip」を、Cuda11.7.1の場合、「llama-b1988-bin-win-cublas-cu11.7.1-x64.zip」をダウンロードしてください。 ダウンロード後、解凍しておきます。 3.Llama.cppを動作させるhtt

                                                                                Windows環境で、Llama.cppを用いてローカルLLMを動作させてみた|ハカセ
                                                                              • Mac全対応!16GB/32GB/64GB別ローカルLLM実践ガイド(MacBook&Mac mini 2026年4月版)|zephel01

                                                                                Mac全対応!16GB/32GB/64GB別ローカルLLM実践ガイド(MacBook&Mac mini 2026年4月版) プライバシー重視・API課金ゼロ・オフライン完結で、Python、JavaScript、TypeScriptなど多言語開発を加速させる実践ガイド はじめにClaude Opus や Gemini をよく使うけど、毎回 API 課金がかかる、インターネット接続が必須、データ漏洩のリスク...こういった悩みはありませんか? 実は 2026 年現在、MacBook や Mac mini の Apple Silicon(M1~M5 シリーズ) があれば、ローカル環境で ほぼ同等の体験 を実現できるようになりました。メモリサイズ(16GB/32GB/64GB)に応じて、最適なモデルを選ぶだけで OK です。 「本当に?」と疑う気持ちも分かりますが、最新のモデル(Qwen3-Co

                                                                                  Mac全対応!16GB/32GB/64GB別ローカルLLM実践ガイド(MacBook&Mac mini 2026年4月版)|zephel01
                                                                                • Continue + Ollama でタブ補完(β)を機能させるまで

                                                                                  ローカルLLMでGitHub Copilotのような開発ができるようにしました。 Continue と Ollama を用いましたが、タブ補完がβ版ということもあってか設定で躓いたので、記事にしました。 TL;DR Ollamaを起動し、API経由のアクセスが有効か確かめます ~/.continue/config.json の設定後、VSCodeを再起動します(2024-05-02時点では必要) Continueのタブ補完実行時、VSCodeのOutputタブとOllamaのserver.logでデバッグを行います。 技術選定 GitHub Copilotに代わるアシスタントとしては、Cursor, Continue, Tabby を比較しました。 今回は完全ローカルで動作するContinueを選択しました。 Cursorは2024‐05‐02時点ではCursorのサーバーを経由してLLM

                                                                                    Continue + Ollama でタブ補完(β)を機能させるまで