LM Studio Bionicの必要スペック|ミニPCのメモリ16GB・32GB・64GBで動くモデルと内蔵GPUの実用ライン
本記事にはアフィリエイト広告(Amazon・楽天市場等)のリンクが含まれています。
メモリ32GB・内蔵GPUなら主力は9B級。27B級からは64GBとメモリ帯域が要ります
アプリは無料で、ローカルで動かす限り課金もアカウントも要りません。使えるかどうかを決めるのは、メモリの容量、そのうち内蔵GPUが使える枠、そしてメモリの帯域の3つです。
LM Studio Bionic(エルエムスタジオ バイオニック)は、ローカルLLMの定番アプリ「LM Studio」を作るElement Labsが2026年7月16日に公開した、AIエージェント用の新しいアプリです。指示をひとつ出すと、作業を分けて調べ、手元のファイルを読み書きし、成果物を保存するところまで自分で進めます。気になるのは、これを家にあるミニPCで動かして使い物になるのかどうかです。
先に結論を書くと、メモリ32GBで内蔵GPUのミニPCなら、主力にできるのは9B級のモデルまでです。27B〜30B級はモデルのファイルだけで17GB前後あり、Windowsの既定の設定では内蔵GPUが使える枠に収まりません。ここを快適に回したいなら、64GB以上でメモリ帯域の広い機種に替えるか、ゲーミングPCのグラフィックボードをネットワーク越しに借りるのが現実的です。
以下では、公式の要件、各モデルのファイルサイズ、作業の記憶に使うKVキャッシュの計算、メモリ帯域から出る生成速度の上限を順に並べ、メモリ16GB・32GB・64GB・128GBのそれぞれで何ができるかを具体的なモデル名で示します。
目次
結論メモリ容量ごとに、ローカルで回せるモデルの目安
Bionicでローカルのモデルを動かすときの目安を、メモリ容量ごとにまとめると次のようになります。モデルのサイズはいずれもLM Studioで配布されている4ビット量子化(Q4)版の値です。
| メモリ容量 | ローカルで現実的なモデル | Bionicでの使い方 |
|---|---|---|
| 16GBLM Studioの推奨下限 | Gemma 4 E4B(5.3GB)、Bonsai 27Bの1ビット版(3.8GB) | チャットと軽いファイル整理まで。重い作業はクラウドかLM Linkに回す |
| 32GB内蔵GPUの既定の枠は約16GB | Qwen3.5 9B、Ornith 1.5 9B(5.6〜5.8GB) | 9B級が主力。コンテキストは32K〜64Kトークンに抑える |
| 64GBRyzen AI Max+機は最大48GBをGPU専用にできる | Qwen3.8 27B、Muse Glimmer(約17GB)、Qwen3.5 35B-A3B(21.2GB) | 27B〜35B級を長めのコンテキストで使える |
| 128GBRyzen AI Max+機は最大96GBをGPU専用にできる | gpt-oss-120b(63.4GB)などの100B級MoE | クラウドで使う規模に近いモデルを手元で試せる |
線を引いた根拠は3つです。モデル本体に加えて、作業の記憶にあたるKVキャッシュがコンテキストの長さに比例して増えること。Windowsの既定の状態では、内蔵GPUが使えるのは搭載メモリの半分ほどであること。そして文章を書く速さの上限が、メモリの帯域で頭打ちになることです。順に数字で見ていきます。
Bionic自体は16GBのPCでも動きます。ただしエージェントは1つの指示に対して何十回もモデルを呼び出すので、チャットなら気にならない速度差が、作業全体では数分と1時間以上の差になります。
公式要件Bionicの対応OSと推奨スペック
BionicはLM Studioとは別のアプリとして配布されていて、ローカルのモデルはLM Studioと同じ実行エンジン(llama.cppとApple向けのMLX)で動きます。Bionic専用の推奨スペックは示されておらず、基準になるのはLM Studioのシステム要件です。
| 項目 | Windows・Linux | Mac |
|---|---|---|
| CPU | x64はAVX2対応が必須。ARM64(Snapdragon Xなど)にも対応 | Apple Silicon(M1〜M4)。Intel搭載のMacは非対応 |
| OS | Windowsはx64とARM64。Linuxはx64とARM64(Ubuntu 20.04以降)で、Bionicは1.1.2から対応 | macOS 14.0以降 |
| メモリ | 16GB以上を推奨 | 16GB以上を推奨。8GBでも小さいモデルと短いコンテキストなら使える |
| GPU | 専用VRAM 4GB以上を推奨 | CPUとメモリを共有するGPUで動く |
ローカルのモデルについて、Bionicのドキュメントが条件として挙げているのは「ダウンロード済みで、手元のハードウェアに収まること」だけです。モデルを探す画面には、そのPCに収まるかどうかの目安が表示されるので、最初はそこで絞り込めば大きな失敗はしません。
料金は、アプリとローカル実行が無料で、アカウントも要りません。無料プランには後述のLM Link(5台まで)が含まれ、ウェブ検索は制限付きです。クラウドのモデルを使う場合だけ課金が必要で、Bionic+が月20ドル、使用量の上限が5倍になるProが月100ドルです。画面の表示は1.1.3で日本語に対応していて、2026年10月1日時点の最新版は1.1.6です。
メモリ必要なメモリはモデル本体とKVキャッシュの足し算で決まる
ローカルのモデルを動かしているあいだ、メモリには大きく3つのものが載ります。量子化したモデル本体、画像を読むための部品、そして作業の経過を覚えておくKVキャッシュです。これにWindowsとBionic本体の分が加わります。
主なモデルのファイルサイズ
Bionicの画面で勧められているモデルと、その周辺のモデルのサイズを並べると次のとおりです。画像を読むための部品はモデルごとに0.9〜1.4GBあり、画像やPDFを扱うなら本体に足して考えます。
| モデル | Q4のファイルサイズ | 32GB機での扱い |
|---|---|---|
| Gemma 4 E4BGoogle・実効4.5B | 5.3GB(画像用1.0GB) | 余裕がある |
| Qwen3.5 9BAlibaba・9B | 5.6GB(画像用0.9GB) | 主力にできる |
| Ornith 1.5 9BQwen3.5 9Bと同じ構造 | 5.8GB(画像用0.9GB) | 主力にできる |
| Bonsai 27BPrismML・Qwen3.6 27Bの1ビット/3値版 | 1ビット版3.8GB、3値版約7.2GB | 載るが、コンテキスト次第で窮屈になる |
| Qwen3.8 27BAlibaba・27B | 16.8GB(画像用0.9GB) | 既定の内蔵GPUの枠を超える |
| Muse GlimmerMeta・30B | 16.8GB(画像用1.4GB) | 既定の内蔵GPUの枠を超える |
| Qwen3.5 35B-A3BMoE・1トークンごとに動くのは約3B | 21.2GB(画像用0.9GB) | 64GB機向け |
Bonsai 27Bだけは4ビットではなく、1ビットと3値(−1・0・+1)で重みを持つモデルで、27B級をこのサイズまで縮めています。表のサイズは重みだけの数字です。実際の使用量にはKVキャッシュや画像用の部品、実行時のバッファが加わり、コンテキストが長いほど増えます。Muse GlimmerはMetaがローカルのエージェント向けに出した30Bのモデルで、24GBと32GBのメモリを想定した量子化版が用意されています。
KVキャッシュはコンテキストの長さに比例して増える
KVキャッシュの大きさはモデルの構造で決まります。Qwen3.5系(Qwen3.8、Ornith 1.5、Bonsai 27Bも同じ系統)は、4層に1層だけが通常のアテンション層で、KVキャッシュを持つのはその層だけです。公開されている構成情報から、量子化しない16ビットのKVキャッシュの量を計算すると次のようになります。
| モデル | 32Kトークン | 128Kトークン |
|---|---|---|
| Qwen3.5 9B、Ornith 1.5 9B | 約1.1GB | 約4.3GB |
| Qwen3.8 27B、Bonsai 27B | 約2.1GB | 約8.6GB |
| Qwen3.5 35B-A3B | 約0.7GB | 約2.7GB |
上限の262Kトークンまで確保すると、9B級で約8.6GB、27B級で約17.2GBになります。27B級では、KVキャッシュだけでモデル本体と同じくらいの量を食う計算です。
本体が小さいBonsai 27Bでも32GBが窮屈になる理由
Bonsai 27Bのモデル本体は3.8〜7.2GBしかありません。ところがもとになったモデルは262Kトークンまで扱えるので、読み込みのときにコンテキストを上限近くまで取ると、上の計算どおりKVキャッシュだけで17GB前後が加わり、本体と合わせて21〜24GBになります。ここにWindowsとBionic本体、画像用の部品、実行時のバッファが乗るので、32GB機では空きがほとんど残りません。本体が軽いモデルでも、コンテキストの長さしだいでメモリは足りなくなります。
32GB機でメモリが足りなくなったら、まず読み込んだままの別のモデルや裏で動いているダウンロードを止めて空きを作り、そのうえでモデルを小さくする前にコンテキストの長さを見直してください。27B級でも32Kトークンに絞れば、KVキャッシュは約2GBで済みます。Bionicのモデルの読み込み設定には、コンテキストの長さと、それを空きメモリに合わせて自動で決める「AutoFit」の切り替えがあります。自動に任せると収まる範囲でいちばん大きな値が選ばれやすく、空いているメモリがそのままKVキャッシュに回ります。長さを自分で決めたいときは、AutoFitを切って数値を入れてください。
ただし、エージェントは作業の経過をコンテキストに積み上げながら進むので、絞りすぎると途中でやったことを忘れます。Bionicは、ローカルのモデルではコンテキストがあふれないようにウェブ検索の回数を減らすよう調整されていて、圧縮で消えたやり取りを過去の記録から探し直す仕組みも持っています。それでも9B級なら32K〜64Kトークンあたりが、32GB機で無理のない落としどころです。
内蔵GPUのWindows機(報告はCore Ultra 7 258V・32GB)で、Bionicが15.6GBのモデルを読み込むとメモリを使い切り、操作が止まりかける不具合がLM Studioの不具合報告に上がっていて、10月1日時点で未解決です。報告者はモデルの読み込み設定で「Try mmap()」をオフにし、使用量を16.7GBに収めています。コンテキストを下げても改善しないときは、この設定も確かめてください。
Bionicと並べて従来のLM Studioを入れておくと、細かい読み込み設定をそちらで調整できます。LM Studioのコマンドラインツールでlms load --estimate-only モデル名 --context-length 32768のように打つと、モデルを読み込まずに必要なメモリの見積もりだけが出ます。見積もりはコンテキストの長さや画像対応の有無を反映していて、gpt-oss-120bの例では65.68GBと表示されます。
内蔵GPU内蔵GPUで実用になるかは、使える枠と帯域で決まる
内蔵GPUが使えるメモリには上限がある
内蔵GPUは専用のメモリを持たず、メインメモリを借りて動きます。Windowsでは搭載メモリの半分ほどが「共有GPUメモリ」として内蔵GPUに開放されていて、それとは別に専用の領域が確保されます。Ryzen AI機の場合、共有は50%、専用の領域は既定で512MBです。設定を何も触っていない32GBのRyzen AIミニPCなら、内蔵GPUが使えるのは16GB強ということになります。
Q4で16.8GBある27B級は、画像用の部品とKVキャッシュを足すとこの枠を超えます。LM Studioの実行エンジンは収まらない分の層をCPU側で処理するので起動はしますが、そのぶん遅くなります。内蔵GPUと共有メモリの基本は内蔵GPUがAI時代に見直されている理由をまとめた記事で詳しく扱っています。
この枠は広げられます。Ryzen AI 300シリーズ以降は、AMD Softwareの「パフォーマンス」→「チューニング」にあるVariable Graphics Memoryで、最大でメモリの75%を内蔵GPU専用に回せます(再起動が必要)。IntelはCore Ultraシリーズ2以降で、Intel Graphics Softwareの「Shared GPU Memory Override」から共有の上限を変えられます。既定値は57%で、上げられる上限は搭載メモリが多いほど高くなります。ただ、どちらも内蔵GPUに回した分だけCPUとOSが使える量は減ります。32GB機で27B級を無理に載せると、今度はWindowsとBionic本体が窮屈になります。
文章を書く速さの上限はメモリ帯域で決まる
モデルは1トークン書くたびに、重みをメモリから一通り読み出します。このため、生成速度の上限はおおよそ「メモリ帯域÷モデルのサイズ」で見積もれます。実際の速度はここから下がりますが、機種ごとの差を比べる目安としては十分です。
| メモリ・GPU | 9B級(Q4・5.6GB) | 27B級(Q4・16.8GB) |
|---|---|---|
| DDR5-5600×2枚89.6GB/s・Ryzen AI 9 HX 370機の例 | 毎秒約16トークン | 毎秒約5トークン |
| LPDDR5X-8000128GB/s・HX 370が対応する最速のメモリ | 毎秒約23トークン | 毎秒約8トークン |
| Ryzen AI Max+ 395256GB/s | 毎秒約45トークン | 毎秒約15トークン |
| RTX 5060 Ti 16GB448GB/s | 毎秒約80トークン | VRAMに収まりきらない |
| RTX 5070 Ti896GB/s | 毎秒約159トークン | VRAMに収まりきらない |
| RTX 50901,792GB/s | 毎秒約318トークン | 毎秒約107トークン |
DDR5-5600のミニPCで27B級を動かすと、上限でも毎秒5トークンほどです。日本語なら1秒に数文字ずつ出てくる速さで、エージェントがこれを何十回も繰り返すと考えると、待ち時間の長さが想像できるはずです。同じ内蔵GPUでも、帯域が256GB/sあるRyzen AI Max+機なら約3倍になります。Ryzen AI Max+搭載ミニPCの比較記事で、この帯域の位置づけを機種ごとに整理しています。
MoE(混合エキスパート)のモデルでは、この計算が変わります。Qwen3.5 35B-A3Bは全体で35Bありますが、1トークンごとに動くのは約3B分で、Q4なら毎回読み出すのは2GB前後です。DDR5-5600の機種でも、上限は9B級より高くなります。全体を置くメモリ(21.2GB)は必要なので32GB機では窮屈ですが、64GB機なら27B級の密なモデルより軽快に動く組み合わせです。LM Studioのモデル紹介でも、手元の機器向けにはQwen3.5 9Bか35B-A3Bが勧められています。
エージェントは待ち時間が積み重なる
チャットは1回の質問に1回答えれば終わりです。エージェントは、計画を立て、検索し、ファイルを読み、書き、失敗したらやり直すという工程を、それぞれモデルの呼び出しとして繰り返します。検索結果やPDFの中身はそのたびにコンテキストへ追加され、モデルはそれを読み込んでから次の手を考えます。この読み込み(プロンプト処理)はメモリ帯域より演算性能が効く処理で、内蔵GPUと単体のグラフィックボードの差がさらに開くところです。
Qwen3.8 27Bは本体16.8GBに画像用の部品0.9GBで約17.7GBです。コンテキストを32Kトークンにすると約2.1GB、128Kトークンにすると約8.6GBのKVキャッシュが加わり、合計は約20GBから約26GBになります。これにWindowsとBionic本体が乗ると、128Kトークンでは32GBをほぼ使い切ります。Muse Glimmerも本体16.8GBに画像用1.4GBなので同じ水準です。32GB機でこの2つを主力にするのは、この計算の時点で厳しいと分かります。
物理メモリに入りきらない分はSSD上のページファイルにあふれ、そうなると生成は極端に遅くなります。SSDがメモリの代わりにならない理由はSSDをAI用のキャッシュに使うミニPCを検証した記事で詳しく書いています。
内蔵GPUのミニPCで実用になるのは、9B級のモデルで、結果を待っていられる作業です。寝ているあいだに資料をまとめさせる、外に出したくないファイルを整理させるといった使い方なら、毎秒16トークンでも十分に回ります。返事を待ちながら手を動かすような使い方には向きません。
逃がし先重い作業はゲーミングPCかクラウドに回せる
Bionicは、セッションごとに使うモデルの置き場所を選べます。手元のPCで動かすローカル、自分の別のPCで動かすリモート(LM Link)、LM Studioのサーバーで動かすクラウドの3つです。ミニPCでは重い作業だけを外に回す、という使い分けができます。
費用:無料(アカウント不要)
使えるモデル:手元のメモリに収まるもの
向く作業:待っていられる整理や要約、外に出したくないファイルの処理
費用:無料プランで5台まで
使えるモデル:相手のPCのVRAMに収まるもの
向く作業:速さが要る作業、ノートやミニPCから重めのモデルを使う
費用:Bionic+が月20ドル、Proが月100ドル
使えるモデル:Kimi K3、GLM 5.3、DeepSeek V4 Flashなど
データの扱い:処理が終われば保持しない(Zero Data Retention)
LM Linkならゲーミングのグラフィックボードを推論に使える
LM Linkは、自分の別のPCで読み込んだモデルを、手元のBionicからローカルのモデルと同じように使う機能です。通信はTailscaleのメッシュVPNの上で端から端まで暗号化され、会話の記録は手元に残り、重い推論だけが相手のPCで走ります。RTX 5070 Tiを積んだゲーミングPCなら、9B級の生成速度の上限はDDR5-5600のミニPCの約10倍です。
注意点は3つあります。相手のPCの電源が入っていて、モデルを共有しているあいだしか使えないこと。ゲームをしながら推論させるとVRAMを取り合うこと。そして、2026年10月1日時点ではプレビュー段階で、利用枠が順番に開放されていることです。VRAM 16GBのグラフィックボードでは、27B級のQ4(16.8GB)は収まりきらないので、9B級かMoEのモデルと組み合わせるのが無理のない使い方です。
クラウドは課金した分だけ、ローカルは無料のまま
クラウドのモデルを選んだセッションだけがクレジットを消費し、ローカルとLM Linkのモデルは何度使っても課金されません。普段は手元の9B級で回し、資料の作り込みやコードの大きな修正だけクラウドの大型モデルに切り替える、という使い方ができます。Claude Codeのようなクラウド型のエージェントと、手元で常に動かすPCの役割分担はClaude Code用の常時稼働ミニPCを検討した記事でも整理しています。
判断手持ちのPCごとの、Bionicの始め方
- 寝ているあいだや外出中に回す、資料の整理と要約
- 外部のサーバーに送りたくないファイルの処理
- 9B級のモデルで品質が足りる、決まった手順の作業
- 返事を待ちながら進める、対話しながらのコーディング
- 画像やPDFを大量に読ませる作業
- 27B級以上の精度がないと結果が使えない作業
おすすめ27B級以上をローカルで回すならRyzen AI Max+機
32GBの内蔵GPU機で27B級が詰まる原因は、容量と帯域の両方にあります。Ryzen AI Max+ 395は256bit幅のLPDDR5X-8000で帯域が256GB/sあり、メモリの大半をGPU専用に回せるので、両方の問題を1台で解消できます。ここでは、同じ筐体で容量だけが違うGMKtec EVO-X2の2構成を挙げます。
Bionicのローカル用に選ぶならこの2構成
※価格・在庫は変動します。最新の価格はAmazonの商品ページでご確認ください。
Q&Aよくある質問
まとめ32GBのミニPCは9B級と待てる作業、27B級からは64GBか外のGPU
LM Studio Bionicはメモリ16GBのPCでも起動しますが、エージェントとして作業を任せられるかどうかは、モデル本体とKVキャッシュの合計が内蔵GPUの使える枠に収まるか、そしてメモリ帯域で決まる生成速度に耐えられるかで分かれます。Windowsの既定の状態では、内蔵GPUが使えるのは搭載メモリの半分ほどです。
メモリ32GBで内蔵GPUのミニPCなら、Qwen3.5 9BやOrnith 1.5 9Bを主力に、コンテキストを32K〜64Kトークンに抑えるのが現実的な使い方です。27B〜30B級はQ4で約17GBあり、既定の枠に収まりません。DDR5-5600の機種では生成速度の上限も毎秒5トークンほどにとどまります。
27B級以上を手元で回したいなら、64GB以上で帯域256GB/sのRyzen AI Max+機に替えるか、ゲーミングPCのグラフィックボードをLM Linkで借りるのが近道です。クラウドのモデルは課金した分だけ使えるので、普段は手元の9B級で回し、重い作業だけ外に出す使い分けがいちばん無駄がありません。
出典:LM Studio公式ブログ「Introducing LM Studio Bionic」・LM Studio Bionic公式ドキュメント「Choose a Cloud, Local, or Remote Model」・LM Studio公式ドキュメント「System Requirements」・LM Studio Bionic 更新履歴・LM Studio料金ページ・LM Studio「Bonsai 27B」モデルページ・AMD公式ブログ「FAQs: AMD Variable Graphics Memory, VRAM, AI Model Sizes」・LM Studio不具合報告「[Bionic] Loading gemma-4-26b-a4b-qat uses up all 32GB RAM on Windows」・Intelサポート「Shared GPU Memory Override Feature and Requirements」





