LOCAL LLM & VS CODE

ローカルLLMを
VS Codeで使ってみる

GUIツールでモデルを動かし、VS Codeのチャットから使う方法を紹介します。

WHY LOCAL

手元のPCでAIを動かすという選択

GitHub CopilotなどのAI支援は、コードの説明や修正案の作成を手伝ってくれます。一方、ソースコードや社内情報をクラウドサービスへ送ることに慎重になりたい場面や、ネットワークに制約がある環境もあります。VS Codeには、自分で用意したモデルをチャットに登録するBYOK(Bring Your Own Key)という仕組みがあります。ローカルモデルも、その仕組みや対応する拡張機能を通じて利用できます。

ローカルLLMは、モデルを自分のPC上で実行する仕組みです。構成を確認すれば、入力内容を外部のAIサービスへ送らずに処理する環境を作れます。GUIの管理ツールを使うと、モデルの取得や起動を画面から操作でき、コマンドラインに慣れていない人も試しやすくなります。

ローカルで動かすことと、完全なオフライン動作や安全が自動的に保証されることは別です。アプリやモデルの取得にはネット接続が必要な場合があり、端末の保護やデータの扱いも確認しましょう。

CHOOSE A TOOL

まずはモデルを動かすアプリを選ぶ

ローカルLLMを動かすアプリや実行環境には、ここで紹介するもの以外にも、たとえばOllamaやJanなど複数の選択肢があります。この記事では、GUIでローカルモデルを扱える「Lemonade Server」と「LM Studio」を例として取り上げます。どちらもモデルを準備してPC上で実行するためのツールですが、VS Codeとのつなぎ方や画面はそれぞれ異なります。対応するOSやモデル、必要な設定はツールごとに異なるため、目的に合わせて選びましょう。

Lemonade Server

ローカルモデルを管理するツールです。GitHub Copilot向けの連携手段が用意されているため、VS Codeから使うことを主な目的にする場合に検討しやすい選択肢です。利用できるモデルや設定は、導入時点の対応状況を確認します。

モデルを起動し、必要に応じてコンテキスト長を設定してから、VS Code側で連携を進めます。

LM Studio

デスクトップ画面からモデルを探してダウンロードし、チャットで試せるツールです。ローカルAPIサーバーも起動できるため、対応する開発ツールや拡張機能から接続する使い方にも向いています。

モデルをロードしてサーバーを開始すると、通常はPC内のlocalhostアドレスでAPIを利用できます。

アプリの画面、拡張機能名、モデルの対応状況は更新されることがあります。導入時には各ツールの最新の案内を確認してください。

LEMONADE & COPILOT

Copilot Chatからローカルモデルを選ぶ

Lemonade Serverを使う場合は、まずサーバーを起動して利用するモデルをダウンロードし、ロードします。公式のVS Code拡張機能「Lemonade for GitHub Copilot」を入れると、LemonadeのモデルをVS Codeのチャットで選べます。コーディング向けモデルを選ぶときは、対応言語、必要なメモリ、PCの性能を確認します。大きなモデルほど高性能なPCが必要になり、応答速度も環境に左右されます。

  1. Lemonade Serverを起動します。拡張機能の案内では、コンテキスト長は32k以上が推奨されていますが、必要なメモリとモデルの対応範囲に合わせて設定します。
  2. VS Codeの拡張機能ビューで「Lemonade for GitHub Copilot」をインストールします。VS CodeとLemonade Serverの対応バージョンも確認してください。
  3. VS CodeでCopilot Chatを開き、モデル選択メニューまたは拡張機能の設定から、Lemonadeのプロバイダーと利用モデルを選びます。
  4. 短いコードの説明などで応答を確かめます。接続できない場合は、サーバーが起動しているか、接続先やプロバイダー設定が正しいかを確認します。

ここで設定するのは、VS Codeのチャットで使うモデルです。エディター内で対話する「インラインチャット」、入力中に候補を表示する「インライン補完」、タイトル作成などには、それぞれ別のモデル設定があります。チャットで選んだモデルが自動的に反映されるわけではないため、使えるモデルはVS Codeの設定画面で確認してください。

LM STUDIO & LOCAL API

LM StudioのAPIを対応ツールから使う

LM Studioでは、アプリ内でモデルを検索・取得し、チャットで動作を確かめられます。まずはモデルがPC上で無理なく動くかを確認してから、APIサーバーを利用します。VS Codeの「Custom Endpoint」にLM StudioのOpenAI互換エンドポイントを登録すれば、モデルをチャットで選べます。これは、LM StudioをLemonade用の拡張機能へ登録する手順ではありません。

  1. LM Studioをインストールし、用途やPCのメモリに合ったモデルをダウンロードします。
  2. モデルをロードし、アプリのチャット画面で応答を試します。
  3. 「Developer」タブでサーバーを開始します。通常は localhost:1234 で待ち受けますが、実際の接続先とポートはLM Studioの画面で確認してください。
  4. VS Codeのモデルピッカーから「Manage Language Models」→「Add Models」→「Custom Endpoint」を選び、APIの種類に「Chat Completions」を指定します。案内に従って開く設定ファイルで、接続先に http://localhost:1234/v1/chat/completions、モデルIDにLM StudioでロードしたモデルのIDを設定します。認証を有効にした場合は、VS Code側にも同じ認証情報を設定します。

ContinueやClineなど、OpenAI互換APIに対応する開発ツールから利用できる場合もあります。設定画面の項目や必要なAPI形式はツールによって異なります。サーバーをネットワークに公開する設定にすると、同じネットワークの端末から接続できるため、必要性と認証設定を確認してください。

CHECK BEFORE USE

使い始める前に知っておきたいこと

PCの性能に合わせる

モデルの規模や量子化方式、メモリ容量によって、起動できるかや応答速度が変わります。まずは小さめのモデルで動作を確かめると、必要な環境を把握しやすくなります。

出力を確認する

ローカルモデルも誤った説明やコードを生成することがあります。提案をそのまま採用せず、変更内容を読み、必要な確認やテストを行います。

通信とデータの扱いを確かめる

モデル取得やアプリ更新では通信が発生します。APIサーバーの公開範囲、ログの保存先、利用する拡張機能の通信先も確認し、扱ってよいデータを決めます。

費用や利用条件を確認する

ローカル推論ではAPIの従量料金が発生しない構成にできますが、電気代や機材費がかかります。ソフトウェアやモデルにはそれぞれ利用条件があるため、用途に合うか確認します。

WHICH ONE?

目的に合わせて選ぶ

Copilot Chatと手早く連携してみたいならLemonade Server、モデルを幅広く試したり、OpenAI互換APIを別のツールから利用したりしたいならLM Studioが候補になります。

比べる点Lemonade ServerLM Studio
試しやすさCopilot連携を中心に始めたい人向けアプリのチャットでモデルを試したい人向け
外部ツール連携対応するCopilot連携機能を利用ローカルAPIを対応ツールに設定
選ぶときの確認拡張機能とモデルの対応状況API互換性と接続先の設定方法

はじめから大きな環境を用意する必要はありません。まずは小さなモデルで、コードの説明や短い修正相談など身近な作業を試し、回答の質と待ち時間を見て、自分に合う使い方を探してみましょう。

OFFICIAL WEBSITES

公式サイト