AI generated thumbnail

llama.cpp 使い方 入門 | GGUF量子化でローカルLLMを動かす

所要時間: 約40分 | 難易度: ★★☆☆☆ この記事で作るもの この記事を読むと、軽量なGGUF形式のモデルを使い、自分専用のローカルLLM実行サーバーをPythonで構築できます。 API料金やデータ漏洩の心配をせず、手元のPCのリソースを限界まで引き出して推論を回すスクリプトを完成させます。 具体的には、Llama 3などの最新モデルを数GBのメモリで動作させ、チャット応答を得るまでの全工程を網羅します。 ...

2026年8月6日 · 9 分 · 4508 文字 · Negi AI Lab
AI generated thumbnail

llama.cppとGGUFで自分専用の高速ローカルLLM環境を構築する方法

所要時間: 約40分 | 難易度: ★★★☆☆ この記事で作るもの この記事を読むと、手元のPC(Windows/Mac)で日本語LLMをストリーミング形式で動かし、チャットができるPythonスクリプトが完成します。 クラウドAPIを使わず、VRAMが少ない環境でもLlama 3やGemma 2といった最新モデルを実用的な速度で動かす技術が身に付きます。 ...

2026年8月5日 · 9 分 · 4393 文字 · Negi AI Lab
AI generated thumbnail

MLXを使ってApple Silicon MacでローカルLLMを爆速で動かす方法

所要時間: 約30分 | 難易度: ★★☆☆☆ この記事で作るもの Apple純正の機械学習フレームワーク「MLX」を使用し、Llama 3やQwenなどの最新LLMをMacのGPUで高速推論させるPythonスクリプトを作成します。 一般的なライブラリよりもメモリ効率が良く、ストリーミング出力(文字がパラパラ出てくる表示)に対応した実践的なチャットプログラムを構築します。 ...

2026年8月5日 · 8 分 · 3958 文字 · Negi AI Lab
AI generated thumbnail

Apple Siliconの性能を限界まで引き出し、Llama 3やGemma 2といった最新のLLMをMac上でネイティブ動作させるPythonスクリプトを構築します。

所要時間: 約30分 | 難易度: ★★☆☆☆ この記事で作るもの MLXフレームワークを用いて、毎秒50トークンを超える速度で動作するローカルLLMチャットスクリプト Hugging Faceから最適化済みモデルを自動取得し、メモリ消費を抑えた4-bit量子化で実行する環境 前提知識:ターミナルでのコマンド操作、Pythonの基本的な文法(importや変数など)がわかること 必要なもの:Apple Silicon(M1/M2/M3/M4チップ)搭載のMac、インターネット環境 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年8月4日 · 10 分 · 4910 文字 · Negi AI Lab
AI generated thumbnail

MLX 使い方 入門 Apple Silicon MacでローカルLLMを高速に動かす方法

所要時間: 約30分 | 難易度: ★★☆☆☆ この記事で作るもの この記事を読むと、Apple Silicon(M1/M2/M3チップ)を搭載したMac上で、最新のLLM(Llama 3.1やMistralなど)をMLXフレームワークを使って高速に動作させる環境が完成します。 単にチャットを動かすだけでなく、Pythonスクリプトからモデルを呼び出し、業務で使えるレベルの応答を得るための実装コードまで作成します。 ...

2026年8月4日 · 10 分 · 4705 文字 · Negi AI Lab
AI generated thumbnail

MLX 使い方 入門 Apple SiliconでローカルLLMを動かす方法

所要時間: 約30分 | 難易度: ★★☆☆☆ この記事で作るもの Apple Silicon(M1/M2/M3/M4チップ)に最適化されたフレームワーク「MLX」を使い、自分のMac上で爆速で動作するAIチャットスクリプトを作成します。 Pythonの基礎知識があれば、外部APIに1円も払わず、プライバシーを完全に守った状態で最新のLLM(Qwen2.5やLlama 3.1など)を動かせるようになります。 「ただ動かす」だけでなく、実務で使えるレベルのレスポンス速度と日本語精度を両立させる設定までを網羅します。 ...

2026年8月3日 · 10 分 · 4537 文字 · Negi AI Lab
AI generated thumbnail

UnslothでQwen2.5-32Bを17GB VRAMで動かす環境構築ガイド

所要時間: 約45分 | 難易度: ★★★☆☆ この記事で作るもの Qwen2.5-32B(または次世代27Bクラス)をVRAM 17GB以下でロードし、高速に推論・学習させるPython環境 ローカルLLM特有の「メモリ不足(OOM)」を回避しながら、商用モデル級の回答精度を引き出すスクリプト Google Colabや手元のRTX 3060/4060 Ti(16GB)でも動作を狙える最適化設定 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年8月3日 · 9 分 · 4116 文字 · Negi AI Lab
AI generated thumbnail

MLX入門:Apple SiliconでローカルLLMを爆速で動かす方法

所要時間: 約30分 | 難易度: ★★★☆☆ この記事で作るもの Apple Silicon(M1/M2/M3/M4)に最適化されたフレームワーク「MLX」を使い、Llama 3やQwenといった最新のLLMをローカル環境で高速動作させるPythonスクリプト。 Hugging Faceからモデルを自動取得し、ストリーミング形式(文字が逐次表示される形式)でチャットができるプログラムを構築します。 前提知識として、ターミナルでのコマンド操作と、Pythonの基本的な文法(importや関数の呼び出し)を理解している必要があります。 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年8月2日 · 8 分 · 3765 文字 · Negi AI Lab
AI generated thumbnail

OllamaとOpen WebUIを組み合わせて、データの外部流出を完全に防ぎながらChatGPTと同等の操作感を持つローカルLLM環境を構築します。

この記事の手順通りに進めれば、高性能なLlama 3.1やGemma 2といった最新モデルを自分のPC上で自由に、かつ無料で動かせるようになります。 API料金を気にせず、機密情報を含むコードの修正やドキュメント要約をローカルで完結させる実務環境を手に入れましょう。 ...

2026年8月2日 · 10 分 · 4525 文字 · Negi AI Lab
AI generated thumbnail

OllamaとOpen WebUIで自分専用のローカルLLM環境を構築する方法

所要時間: 約30分 | 難易度: ★★☆☆☆ この記事で作るもの インターネット不要で機密情報を放り込んでも安心な、自分専用のChatGPTクローン環境を構築します。 前提知識:ターミナルでコマンドをコピペできる、Dockerの概念をなんとなく知っている。 必要なもの:Windows/Mac/Linux PC、インターネット接続(モデルのダウンロード用)。 📦 この記事に関連する商品(楽天メインで価格確認) ...

2026年8月1日 · 8 分 · 3880 文字 · Negi AI Lab