AI generated thumbnail

Jetson Orin NXでローカルAIエージェント「Hermes」を動かす実践ガイド

所要時間: 約60分 | 難易度: ★★★★☆ この記事で作るもの Jetson Orin NXという省電力なエッジデバイス上で、外部APIを一切使わずに自律的に思考・実行する「Hermes Agent」を構築します。この記事の手順を完了すると、デバイス内で完結したプライベートなAIアシスタントがコマンドラインから利用可能になります。 ...

2026年6月9日 · 8 分 · 3940 文字 · Negi AI Lab
AI generated thumbnail

llama-cpp-pythonで自分だけのLLM推論ベンチマークを計測する方法

所要時間: 約40分 | 難易度: ★★★☆☆ この記事で作るもの 自分のPC上でローカルLLMの推論速度(Tokens Per Second)と応答遅延(TTFT)を正確に計測するPythonスクリプト 特定のモデル(Llama 3やQwen 2など)が自分の業務で使い物になるかを「数字」で判断する基準 前提知識:Pythonの基本的な構文(変数、関数)がわかり、ターミナルでコマンド操作ができること 必要なもの:NVIDIA製GPU(VRAM 8GB以上推奨)またはApple Silicon搭載Mac、Python 3.10以降 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年6月9日 · 9 分 · 4062 文字 · Negi AI Lab
AI generated thumbnail

llama.cppでGemma 4のMTPを動かす方法

所要時間: 約30分 | 難易度: ★★★★☆ この記事で作るもの llama.cppの最新機能を活用し、Gemma 4(およびMTP対応モデル)の推論速度を最大化するローカル実行環境を構築します。単に動かすだけでなく、Multi-Token Prediction(MTP)の恩恵をフルに受けるためのビルド設定と、Pythonから高速に呼び出すためのAPIサーバー化までを完結させます。 ...

2026年6月8日 · 9 分 · 4270 文字 · Negi AI Lab
AI generated thumbnail

llama.cppでKVキャッシュを最適化し推論を高速化する方法

所要時間: 約40分 | 難易度: ★★★★☆ この記事で作るもの llama.cppの最新最適化(KVキャッシュのコピー回避)を適用した、長文コンテキストに強いローカルLLM推論環境を構築します。 具体的には、GitHubの最新ソースコードからビルドを行い、Pythonから高速化されたKVキャッシュの恩恵をフルに受けるためのベンチマーク兼推論スクリプトを作成します。 この記事を読み終える頃には、あなたのPCでLLMのレスポンスが物理的に「軽く」なっているはずです。 ...

2026年6月8日 · 10 分 · 4584 文字 · Negi AI Lab
AI generated thumbnail

Gemma 4 12Bを12GB VRAMで120 tok/s駆動させる方法

所要時間: 約40分 | 難易度: ★★★★☆ この記事で作るもの 12GB VRAMの一般向けGPU(RTX 3060等)で、最新モデルGemma 4 12Bを爆速(120 tok/s超)で動作させる推論環境 QAT(量子化を意識した学習)とMTP(複数トークン同時予測)を組み合わせたllama.cppのビルドと実行手順 PythonからAPI経由でこの爆速モデルを叩き、実用的なアプリに組み込むためのベースコード 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年6月7日 · 9 分 · 4312 文字 · Negi AI Lab
AI generated thumbnail

GPU不要でGemma-4-26Bを動かす方法:中古PCをAIサーバー化する

所要時間: 約40分 | 難易度: ★★★☆☆ この記事で作るもの 高価なGPUを一切使わず、数年前の型落ち中古PC(i5クラス)を使って、最新の26BクラスのLLM「Gemma-4-26B-A4B」を実用的な速度で動作させるローカル推論サーバーを構築します。 最終的には、外部のPythonプログラムからこのサーバーをAPIとして叩き、レスポンスを取得する仕組みまでを完成させます。 ...

2026年6月7日 · 8 分 · 3686 文字 · Negi AI Lab
AI generated thumbnail

DeepSeek V4 Flash 使い方!llama.cppで最新モデルをローカル構築する手順

所要時間: 約45分 | 難易度: ★★★★☆ この記事で作るもの DeepSeek V4 Flashをllama.cppの最新プルリクエスト(PR #24162)を適用してビルドし、自分のPCローカル環境で対話ができる「専用CLIチャット環境」を作ります。 公式リリース前の開発途上版を動かすため、最新技術の内部構造を理解しながら、誰よりも早く次世代モデルの挙動を確認できる状態を目指します。 ...

2026年6月6日 · 9 分 · 4508 文字 · Negi AI Lab
AI generated thumbnail

OpenLumaraの使い方!ローカルLLMで爆速AIエージェントを構築する完全ガイド

所要時間: 約45分 | 難易度: ★★★☆☆ この記事で作るもの ローカルLLM(Llama 3など)を使用して、ウェブ検索やファイル操作をトークン消費を最小限に抑えつつ実行する「超軽量AIエージェント」を構築します。 既存のフレームワークのようにプロンプトを数百行詰め込むのではなく、最小限の指示で的確にツールを使いこなすスクリプトを完成させます。 ...

2026年6月6日 · 9 分 · 4308 文字 · Negi AI Lab
AI generated thumbnail

Nvidiaのマーケティングに惑わされない!LLMの推論性能を実測・可視化する計測ツール自作ガイド

所要時間: 約45分 | 難易度: ★★★☆☆ この記事で作るもの 手元のGPU環境でLLMが「1秒間に何トークン生成できるか(tokens/sec)」を厳密に計測し、グラフ化するPythonスクリプト LinkedInなどで拡散される「Nvidia最高!」という宣伝文句ではなく、実測値に基づいた投資判断基準 必要なもの:Nvidia製GPU(VRAM 8GB以上)、Python環境(3.10以上)、Hugging Faceのアカウント 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年6月5日 · 8 分 · 3930 文字 · Negi AI Lab
AI generated thumbnail

Qwen2.5 32BとKV Cache最適化で自律型AIエージェントを構築する方法

所要時間: 約40分 | 難易度: ★★★★☆ この記事で作るもの ローカルLLMのQwen2.5-32B-Instructを使い、KV Cache(キー・バリュー・キャッシュ)を最適化することで、複雑なツール利用(MCP連携など)を高速にこなす自律型エージェントの基盤を構築します。 PythonのコードからOllamaのAPIを叩き、長いシステムプロンプトを保持したまま、レスポンス速度を維持する設定を実装します。 この記事を読み終える頃には、手元のPCで「思考が速く、指示を忘れない」実用レベルのAIエージェントが動いています。 ...

2026年6月5日 · 10 分 · 4614 文字 · Negi AI Lab