AI generated thumbnail

llama.cppとGGUFでローカルLLMを動かす Pythonによる実装ガイド

所要時間: 約40分 | 難易度: ★★★☆☆ この記事で作るもの Llama 3などの最新LLMを「手元のPCのメモリ量に合わせて量子化」し、Pythonから高速に呼び出して対話するチャットスクリプトを作成します。 APIを使わずに完全オフラインで動作し、1文字ずつテキストが流れるストリーミング出力に対応した実用的な基盤を構築するのがゴールです。 Pythonのライブラリインストールから、モデルファイルの選定、VRAM(ビデオメモリ)を使い切るための最適なパラメータ設定までを網羅します。 ...

2026年6月14日 · 9 分 · 4078 文字 · Negi AI Lab
AI generated thumbnail

llama.cppでKVキャッシュを最適化し推論を高速化する方法

所要時間: 約40分 | 難易度: ★★★★☆ この記事で作るもの llama.cppの最新最適化(KVキャッシュのコピー回避)を適用した、長文コンテキストに強いローカルLLM推論環境を構築します。 具体的には、GitHubの最新ソースコードからビルドを行い、Pythonから高速化されたKVキャッシュの恩恵をフルに受けるためのベンチマーク兼推論スクリプトを作成します。 この記事を読み終える頃には、あなたのPCでLLMのレスポンスが物理的に「軽く」なっているはずです。 ...

2026年6月8日 · 10 分 · 4584 文字 · Negi AI Lab