AI generated thumbnail

Qwen 2.5 32B 使い方|エージェント開発でQ4量子化を避けるべき理由と安定化手順

所要時間: 約45分 | 難易度: ★★★★☆ この記事で作るもの Qwen 2.5 Coder 32Bを使い、量子化による精度低下を抑えつつ、関数の呼び出し(Tool Use)を100回連続で成功させるための安定したエージェント実行環境を構築します。 安定性の高い量子化モデル(GGUF)の選定と導入 PythonとPydanticを用いた「壊れない」構造化出力の実装 VRAM不足を回避しながら精度を維持するオフロード設定 前提知識:Pythonの基本的な文法がわかること、Dockerまたは仮想環境の操作ができること。 必要なもの:VRAM 24GB以上のGPU(RTX 3090 / 4090)またはメモリ32GB以上のMac、OpenAI API互換サーバー(llama.cpp / Ollama)。 ...

2026年5月27日 · 9 分 · 4178 文字 · Negi AI Lab
AI generated thumbnail

Qwen3.5 35B A3B 使い方と環境構築ガイド

所要時間: 約40分 | 難易度: ★★★★☆ この記事で作るもの Qwen3.5 35B A3B(MTP保持版)をローカル環境で立ち上げ、PythonからAPI経由で高速に推論を行うシステム。 35Bという中規模モデルながら、MTP(Multi-Token Prediction)の恩恵で40B〜70Bクラスに匹敵する論理性能を体感できる環境を構築します。 PythonからOpenAI互換APIサーバーとして呼び出し、実際の業務(コードレビューや長文要約)に即投入できる状態を目指します。 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年5月27日 · 9 分 · 4251 文字 · Negi AI Lab
AI generated thumbnail

Qwen2.5-122Bクラスの巨大なローカルLLMを、サーマルスロットリング(熱による速度低下)を起こさずに安定稼働させるための推論環境を構築します。

この記事の手順を完了すると、GPU温度を監視しながら最適なパフォーマンスで巨大モデルを回し続ける「温度管理機能付き推論サーバー」が手に入ります。 Redditで話題になった「DGXを水道水で冷やす」という極端な事例をヒントに、実務で100GB超のモデルを扱う際の現実的な冷却戦略と設定を解説します。 ...

2026年5月12日 · 8 分 · 3736 文字 · Negi AI Lab
AI generated thumbnail

UnslothのMTP対応モデルでローカルLLMの推論速度を2倍にする方法

所要時間: 約40分 | 難易度: ★★★★☆ この記事で作るもの Unslothが公開したMTP(Multi-Token Prediction)対応のGGUFモデルを使い、従来の1.5倍から2倍の速度でテキスト生成を行うローカル推論環境を構築します。 実行には、llama.cppの最新ビルドと、Pythonによる制御スクリプトを使用します。 前提知識として、基本的なLinuxコマンド操作とPython環境(VenvやConda)の構築ができることを想定しています。 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年5月12日 · 8 分 · 4000 文字 · Negi AI Lab
AI generated thumbnail

Skymizer HTX301活用ガイド 384GB VRAMで巨大LLMを動かす環境構築

所要時間: 約45分 | 難易度: ★★★★☆ この記事で作るもの Llama-3-405Bクラスの超巨大モデルを単一ノードで動作させるための、llama.cppベースの推論環境を構築します。 現在のGPUメモリ不足を解消し、将来的にHTX301のような384GB VRAM環境へ即座に移行できる設定ファイルを完成させます。 Pythonから巨大モデルを制御し、メモリ使用量を動的に監視するスクリプトを作成します。 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年5月8日 · 9 分 · 4341 文字 · Negi AI Lab
AI generated thumbnail

Qwen3.6 27B Uncensoredをローカルで動かし制限なしの高度な推論環境を作る方法

所要時間: 約40分 | 難易度: ★★★☆☆ この記事で作るもの Qwen3.6-27B-uncensored-heretic-v2を利用し、AIの倫理ガードレールに縛られない高度なテキスト生成・コード生成を行うローカル推論環境を構築します。 具体的には、llama-cpp-pythonを使用して、MTP(Multi-Token Prediction)の特性を活かしつつ、VRAM 16GB〜24GBの環境で快適に動作するAPIサーバー兼チャットUIの実装を目指します。 ...

2026年5月7日 · 10 分 · 4606 文字 · Negi AI Lab
AI generated thumbnail

Qwen 3.6 27B 使い方 | ローカルLLM環境構築と量子化モデル比較ガイド

所要時間: 約40分 | 難易度: ★★★☆☆ Qwen 3.6 27BのQ4_K_M量子化モデルをllama.cppで動作させ、VRAM 24GB以下のシングルGPU環境で高速な推論サーバーを構築します。 BF16(元モデル)とQ4/Q8量子化の性能差を実測データに基づき比較し、業務利用において「精度を落とさずコストを抑える」最適な設定を導き出します。 この記事の手順を終える頃には、あなたのPC上でChatGPT 4o miniクラスの推論能力を持つAPIサーバーが稼働しているはずです。 ...

2026年4月28日 · 8 分 · 3677 文字 · Negi AI Lab
AI generated thumbnail

Llama.cppで最新ローカルLLMを即座にAPI化して検証する方法

所要時間: 約40分 | 難易度: ★★★☆☆ この記事で作るもの Llama.cppをサーバーモードで起動し、どんな新モデルでも5分以内にOpenAI互換APIとして公開する検証基盤を作ります。 前提知識: Linuxの基本コマンド操作、Pythonの基礎(venvの利用など)ができること。 必要なもの: NVIDIA製GPU(VRAM 8GB以上推奨)、Ubuntu等のLinux環境(WSL2可)。 📦 この記事に関連する商品 ...

2026年4月21日 · 8 分 · 3859 文字 · Negi AI Lab
AI generated thumbnail

llama.cpp高速化!Speculative Checkpointing設定ガイド

所要時間: 約30分 | 難易度: ★★★☆☆ この記事で作るもの 推測的実行(Speculative Checkpointing)を有効にしたllama.cppの構築 コーディングタスクで推論速度を最大1.5倍に引き上げるPython連携スクリプト VRAMを節約しながらレスポンスを高速化する最適なパラメータ設定の適用 📦 この記事に関連する商品 ...

2026年4月20日 · 7 分 · 3490 文字 · Negi AI Lab
AI generated thumbnail

RTX 5070 TiでQwen3.6-35B-A3Bを秒間79トークンで動かすllama.cpp最適化ガイド

所要時間: 約40分 | 難易度: ★★★★☆ この記事で作るもの RTX 5070 TiとRyzen 9800X3Dを組み合わせ、Qwen3.6-35B-A3Bを秒間79トークン(79 t/s)という実用速度で推論させるローカル環境 llama.cppのMoE専用フラグ(–n-cpu-moe)を活用した、VRAM容量の限界を超えるメモリ最適化設定 128Kコンテキストを維持しつつ、実務で耐えうるレスポンス速度を出す実行スクリプト 📦 この記事に関連する商品 ...

2026年4月19日 · 7 分 · 3486 文字 · Negi AI Lab