NVIDIA DGX Spark 互換機 (以下 Spark) を 2 台購入し、クラスター起動して ローカルで DeepSeek V4 Flash 0731 の運用を開始したので雑感を書いて行く。 前提そもそもコスパを検討するなら API 利用をすべきなので、コスト面でのメリットはとても薄い。 速度まずローカル LLM の一番気になっていた「速度」だが「仕事で十分利用できるレベル」という判断になった。 最大 114 tok/s まで確認した 安定している ローカル LLM は主に社員に使って貰っており、社員からは「今まで API で利用していたのと特に違和感なく利用できている。API の料金やサブスクの制限を考えず、完全クローズド環境で使える安心感はとても良い」とのフィードバックを貰った。 安定面以下のレシピを使わせて頂いている。FP8 重み + NVFP4 MLA KV 。 Commi

