WHY LOCAL
手元のPCでAIを動かすという選択
GitHub CopilotなどのAI支援は、コードの説明や修正案の作成を手伝ってくれます。一方、ソースコードや社内情報をクラウドサービスへ送ることに慎重になりたい場面や、ネットワークに制約がある環境もあります。VS Codeには、自分で用意したモデルをチャットに登録するBYOK(Bring Your Own Key)という仕組みがあります。ローカルモデルも、その仕組みや対応する拡張機能を通じて利用できます。
ローカルLLMは、モデルを自分のPC上で実行する仕組みです。構成を確認すれば、入力内容を外部のAIサービスへ送らずに処理する環境を作れます。GUIの管理ツールを使うと、モデルの取得や起動を画面から操作でき、コマンドラインに慣れていない人も試しやすくなります。
ローカルで動かすことと、完全なオフライン動作や安全が自動的に保証されることは別です。アプリやモデルの取得にはネット接続が必要な場合があり、端末の保護やデータの扱いも確認しましょう。
CHOOSE A TOOL
まずはモデルを動かすアプリを選ぶ
ローカルLLMを動かすアプリや実行環境には、ここで紹介するもの以外にも、たとえばOllamaやJanなど複数の選択肢があります。この記事では、GUIでローカルモデルを扱える「Lemonade Server」と「LM Studio」を例として取り上げます。どちらもモデルを準備してPC上で実行するためのツールですが、VS Codeとのつなぎ方や画面はそれぞれ異なります。対応するOSやモデル、必要な設定はツールごとに異なるため、目的に合わせて選びましょう。
Lemonade Server
ローカルモデルを管理するツールです。GitHub Copilot向けの連携手段が用意されているため、VS Codeから使うことを主な目的にする場合に検討しやすい選択肢です。利用できるモデルや設定は、導入時点の対応状況を確認します。
モデルを起動し、必要に応じてコンテキスト長を設定してから、VS Code側で連携を進めます。
LM Studio
デスクトップ画面からモデルを探してダウンロードし、チャットで試せるツールです。ローカルAPIサーバーも起動できるため、対応する開発ツールや拡張機能から接続する使い方にも向いています。
モデルをロードしてサーバーを開始すると、通常はPC内のlocalhostアドレスでAPIを利用できます。
アプリの画面、拡張機能名、モデルの対応状況は更新されることがあります。導入時には各ツールの最新の案内を確認してください。
LEMONADE & COPILOT
Copilot Chatからローカルモデルを選ぶ
Lemonade Serverを使う場合は、まずサーバーを起動して利用するモデルをダウンロードし、ロードします。公式のVS Code拡張機能「Lemonade for GitHub Copilot」を入れると、LemonadeのモデルをVS Codeのチャットで選べます。コーディング向けモデルを選ぶときは、対応言語、必要なメモリ、PCの性能を確認します。大きなモデルほど高性能なPCが必要になり、応答速度も環境に左右されます。
- Lemonade Serverを起動します。拡張機能の案内では、コンテキスト長は32k以上が推奨されていますが、必要なメモリとモデルの対応範囲に合わせて設定します。
- VS Codeの拡張機能ビューで「Lemonade for GitHub Copilot」をインストールします。VS CodeとLemonade Serverの対応バージョンも確認してください。
- VS CodeでCopilot Chatを開き、モデル選択メニューまたは拡張機能の設定から、Lemonadeのプロバイダーと利用モデルを選びます。
- 短いコードの説明などで応答を確かめます。接続できない場合は、サーバーが起動しているか、接続先やプロバイダー設定が正しいかを確認します。
ここで設定するのは、VS Codeのチャットで使うモデルです。エディター内で対話する「インラインチャット」、入力中に候補を表示する「インライン補完」、タイトル作成などには、それぞれ別のモデル設定があります。チャットで選んだモデルが自動的に反映されるわけではないため、使えるモデルはVS Codeの設定画面で確認してください。
LM STUDIO & LOCAL API
LM StudioのAPIを対応ツールから使う
LM Studioでは、アプリ内でモデルを検索・取得し、チャットで動作を確かめられます。まずはモデルがPC上で無理なく動くかを確認してから、APIサーバーを利用します。VS Codeの「Custom Endpoint」にLM StudioのOpenAI互換エンドポイントを登録すれば、モデルをチャットで選べます。これは、LM StudioをLemonade用の拡張機能へ登録する手順ではありません。
- LM Studioをインストールし、用途やPCのメモリに合ったモデルをダウンロードします。
- モデルをロードし、アプリのチャット画面で応答を試します。
- 「Developer」タブでサーバーを開始します。通常は
localhost:1234で待ち受けますが、実際の接続先とポートはLM Studioの画面で確認してください。 - VS Codeのモデルピッカーから「Manage Language Models」→「Add Models」→「Custom Endpoint」を選び、APIの種類に「Chat Completions」を指定します。案内に従って開く設定ファイルで、接続先に
http://localhost:1234/v1/chat/completions、モデルIDにLM StudioでロードしたモデルのIDを設定します。認証を有効にした場合は、VS Code側にも同じ認証情報を設定します。
ContinueやClineなど、OpenAI互換APIに対応する開発ツールから利用できる場合もあります。設定画面の項目や必要なAPI形式はツールによって異なります。サーバーをネットワークに公開する設定にすると、同じネットワークの端末から接続できるため、必要性と認証設定を確認してください。
CHECK BEFORE USE
使い始める前に知っておきたいこと
PCの性能に合わせる
モデルの規模や量子化方式、メモリ容量によって、起動できるかや応答速度が変わります。まずは小さめのモデルで動作を確かめると、必要な環境を把握しやすくなります。
出力を確認する
ローカルモデルも誤った説明やコードを生成することがあります。提案をそのまま採用せず、変更内容を読み、必要な確認やテストを行います。
通信とデータの扱いを確かめる
モデル取得やアプリ更新では通信が発生します。APIサーバーの公開範囲、ログの保存先、利用する拡張機能の通信先も確認し、扱ってよいデータを決めます。
費用や利用条件を確認する
ローカル推論ではAPIの従量料金が発生しない構成にできますが、電気代や機材費がかかります。ソフトウェアやモデルにはそれぞれ利用条件があるため、用途に合うか確認します。
WHICH ONE?
目的に合わせて選ぶ
Copilot Chatと手早く連携してみたいならLemonade Server、モデルを幅広く試したり、OpenAI互換APIを別のツールから利用したりしたいならLM Studioが候補になります。
| 比べる点 | Lemonade Server | LM Studio |
|---|---|---|
| 試しやすさ | Copilot連携を中心に始めたい人向け | アプリのチャットでモデルを試したい人向け |
| 外部ツール連携 | 対応するCopilot連携機能を利用 | ローカルAPIを対応ツールに設定 |
| 選ぶときの確認 | 拡張機能とモデルの対応状況 | API互換性と接続先の設定方法 |
OFFICIAL WEBSITES