RTX 5090 1枚で284BのDeepSeekが22〜25tok/s|FreeTokenは「VRAM 32GBの壁」をどう越えた?【2026年9月】
本記事にはアフィリエイト広告(Amazon・楽天市場等)のリンクが含まれています。
FreeTokenは「VRAM 32GBの壁」をどう越えた?
出典:FreeToken論文「Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution」、FreeToken Wiki「RTX 5090」、FreeToken公式GitHub、DeepSeek公式「DeepSeek-V4.1-Flash」発表、llama.cpp Discussions「DeepSeek-V4.1-Flash on one RTX 5090」にもとづきます(2026年9月25日時点で確認)。
32GBのVRAMを積んでいても、数百Bパラメータ級のAIモデルは普通なら読み込めません。それが常識でした。
2026年8月に公開されたAI推論システム「FreeToken」は、RTX 5090を搭載したゲーミングPCで、総パラメータ数284BのDeepSeek-V4-Flashを実際に22〜25トークン/秒で動作させています。ただしこれは「284BがVRAM32GBに収まった」という単純な話ではありません。GPUだけでなく、CPU・システムメモリ・PCI Expressまで含めてPC全体を一つの推論システムとして扱うことで成立しています。
FreeTokenの論文と公開資料をもとに、284BのDeepSeekを動かせた仕組み、一般的なゲーミングPCでも再現できるのか、そして2026年9月に552Bへ巨大化した最新のDeepSeek-V4.1-Flashをめぐる別の実験結果まで確認します。
FreeTokenは、RTX 5090搭載PCで総パラメータ284BのDeepSeek-V4-Flash(アクティブパラメータ約13B)を約22〜25tok/sで動作させました。ただし284Bモデル全体がVRAM32GBに収まったわけではなく、頻繁に使うExpert(MoEの部分ネットワーク)をVRAM側の高速キャッシュに置き、残りをCPU・システムRAM側で処理する仕組みです。この結果はRTX 5090単体ではなく、192GB級のシステムRAMを組み合わせた構成で確認されています。さらに2026年9月には、552Bへさらに巨大化した最新のDeepSeek-V4.1-Flashを、RTX 5090 1枚とNVMe SSDへのストリーミングで動かす別の実験も報告されており、その処理時間の54%はNVMe側が占めています。ローカルAI用PCでは、VRAM容量だけでなくシステムRAMとストレージの速度まで性能を左右する時代に入りつつあります。
目次
実測RTX 5090で284BのDeepSeek-V4-Flashを実行
FreeTokenは、研究者チームが2026年8月17日にarXivで公開したAI推論システムです。論文タイトルは「FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution」で、大規模なオープンウェイトAIモデルを、データセンターだけでなく一般ユーザーのPCでも実用的に動かすことを目的としています。論文では8GB VRAMのノートPCからRTX 5090搭載ゲーミングPC、ワークステーション向けGPUまで、複数の環境を検証しています。
ゲーミングPCとして特に興味深いのがDeepSeek-V4-Flashです。総パラメータ数284B、実際の推論で使うアクティブパラメータは約13BというMoE(Mixture-of-Experts)モデルで、RTX 5090環境では実際のエージェント系ワークロードを通じて約22〜25tok/sを維持したと報告されています。FreeToken公式の公開資料では、比較対象の既存方式に対して約1.5〜2.3倍の速度だったとされています(この倍率はQwen3.6・DeepSeek-V4-Flach両方の検証結果を合わせた範囲です)。
22〜25tok/sは、単に「起動できた」という技術デモの水準ではありません。1秒間に20トークン以上生成されるため、実際の対話にも利用できる速度です。巨大モデルを無理やりロードして1トークン生成するのに数十秒かかる、という話とは性格が異なります。FreeToken側の検証では、実際のエージェント系タスクを3種類続けて実行した場合でも、生成速度は最初のターンから12%以内の低下にとどまったとされています。比較対象とした既存方式(KTransformers)は2つ目のタスクまでに約31%速度が落ちており、単発のベンチマークだけでなく、連続した実用タスクでも速度が維持されている点が今回の結果の特徴です。
誤解注意「284Bが32GB VRAMに入った」わけではない
今回の結果だけを見ると「RTX 5090なら284Bモデルを32GB VRAMで動かせる」と思ってしまうかもしれませんが、実際にはそうではありません。FreeTokenの考え方は、巨大なMoEモデル全体をVRAMへ入れるのではなく、GPU・CPU・ホストメモリ・PCIeをまとめて利用することにあります。
FreeToken自身も、個人のPCを「小さなGPU」としてではなく「統一され、弾力的な推論プラットフォーム」として扱うという考え方を論文の中心に置いています。従来のローカルLLM運用では「モデルがVRAMに収まるか」が最初の判断基準で、収まらなければCPUへオフロードして急激に遅くなるという前提がありました。FreeTokenは最初からVRAMだけに全モデルを置くことを前提にせず、必要な部分を必要な場所で処理する設計にすることで、VRAM容量よりはるかに巨大なモデルを扱います。
技術的背景なぜMoEならこんなことができるのか
この仕組みを理解するには、DeepSeekが採用するMoEがポイントになります。MoEでは、巨大なモデルに含まれるすべてのパラメータを毎回使うわけではありません。多数の「Expert」を持ち、入力されたトークンに応じて必要なExpertだけを選択します。DeepSeek-V4-Flashの場合、43層それぞれで256個のExpertのうち6個だけが有効化される構造になっており、総パラメータ数は284Bでも実際にアクティブになるのは約13Bにとどまります。
そこでFreeTokenは、使用頻度の高いExpertをGPU側へキャッシュしながら、GPUに置かれていないExpertについてはCPUで処理するか、GPUへ転送するかを状況に応じて変えます。FreeTokenの公式GitHubでは、帯域幅に応じたCPU・GPU協調実行、グローバルLRU Expert Cache、実行中のメモリ管理などが主要機能として説明されています。つまりRTX 5090の32GB VRAMは「巨大モデルを全部収納する倉庫」ではなく、頻繁に使うExpertを置いておく高速なキャッシュに近い役割になります。この発想であれば、モデル全体が32GBを大幅に超えていても動かせます。
構成の実態RTX 5090だけ買っても同じ速度にはならない
ここは今回の結果を見るうえで最も注意したい点です。FreeTokenで重要なのはRTX 5090だけではありません。GPUに載っていないExpertを扱う以上、システムメモリの容量と帯域幅、CPU性能、PCIeの転送速度も推論性能へ影響します。FreeToken公式のRTX 5090向け資料でも、GPU・CPU・RAM・PCIe帯域を協調させることが特徴として説明されています。
実際、FreeToken関連の公開資料で紹介されているRTX 5090ゲーミングデスクトップは、Ryzen 9 9950X3D・RTX 5090 32GBに加えて192GBのDDR5メモリを搭載した構成です。RTX 5090自体はGeForceのゲーミングGPUですが、192GBのシステムメモリは一般的なゲームPCとはまったく違います。2026年現在、ゲームだけなら32GBで困らないケースが多く、64GBでもかなり余裕があるのに対し、192GBは明確にAIワークステーション寄りの構成です。今回の結果は「普通のRTX 5090ゲーミングPCがそのまま巨大AIサーバーになる」というより、「GeForceを使ったデスクトップPCでも、RAMを含めてAI向けに構成すればデータセンター級の巨大MoEを扱える可能性が出てきた」と考える方が正確でしょう。
VRAMの役割32GB VRAMの価値が下がったわけではない
一方で、「VRAM容量はもう関係ない」と考えるのも誤りです。むしろFreeTokenでもGPU側に多くのExpertをキャッシュできる方が有利です。GPU上に必要なExpertが存在すれば、システムRAMから転送したりCPU側で処理したりする必要がありません。
FreeToken公式の資料では、RTX 5090環境におけるDeepSeek-V4-FlashのExpert読み出しについて、適応型キャッシュを使った場合でも約39%がキャッシュミスだったとされています。比較対象の静的配置ではさらに高いミス率になっています。つまり32GB VRAMは「全部入らないから意味がない」のではなく、32GBという大きな高速キャッシュを持っているからこそ、巨大モデルの一部をGPU側へ保持できるということです。VRAM 8GBのGPUとRTX 5090の32GBでは、この点でも条件が大きく違います。
小規模GPUでは8GBのRTX 4060 Laptopでも35Bモデルを動かせる一方、小さなモデルには不向き
FreeTokenの研究はRTX 5090だけの話ではありません。論文では8GB VRAMのRTX 4060 Laptop GPUでもQwen3.6の35Bモデルを検証しており、NVFP4ビルドで約39.3tok/sを記録しています。これはRTX 4090の約92%に相当する速度で、比較対象とした実運用トラフィックの中央値(約33tok/s)も上回っているとされています。もちろん35Bと284Bでは規模が大きく違うため、RTX 4060でDeepSeek-V4-Flashが同じように動くという意味ではありませんが、「VRAM 8GBだから8GB以内のモデルしか実用的に使えない」という境界を緩められることは分かります。
一方でFreeTokenが常に高速というわけでもありません。RTX 5090と128GB RAMの環境でFreeTokenを検証した国内ユーザーの報告では、23.5GBクラスの比較的小さなモデルではllama.cppやvLLMの方が高速だった一方、65.2GBのgpt-oss-120bでは単発約127.1tok/s、83.5GBのQwen3.5-122B-A10Bでは約32.0tok/sで動作しています。32GB VRAMに普通に収まるモデルなら、複雑なオフロードを行わずGPUへ載せた方が単純です。FreeTokenが本領を発揮するのは、使いたいMoEモデルがVRAMを大幅に超えている場合と考えるのが妥当でしょう。
最新モデルDeepSeek-V4.1-Flashはさらに552Bへ巨大化
もう一つ注意したいのが、現在のDeepSeekとの世代差です。FreeTokenの論文でRTX 5090による22〜25tok/sが確認されているのは284BのDeepSeek-V4-Flashですが、DeepSeekは2026年9月10日に「DeepSeek-V4.1-Flash」を正式公開しました。名前は似ていますが、総パラメータ数は552Bまで巨大化しています。
DeepSeek公式によると、V4.1-Flashは新しいCausal Encoder-Decoder構造を採用し、入力時には8B、出力時には16Bのパラメータをアクティブにするマルチモーダル対応のMoEです。「RTX 5090でDeepSeekが22〜25tok/s」という数字を、そのまま最新のV4.1-Flashへ当てはめることはできません。
別の実験552BをRTX 5090 1枚で動かした実験、ボトルネックはNVMeへ
ここからがさらに興味深いところです。FreeTokenとは別に、DeepSeek-V4.1-Flash公開直後の9月、552BのV4.1-FlashをRTX 5090 1枚で実際に動作させた実験結果がllama.cppのDiscussionsで公開されました。この環境はRTX 5090の31.8GiB VRAMに加え、125.7GiBのシステムRAMとPCIe 5.0 NVMeを使用しています。モデルのExpertをNVMeからRAM、VRAMへストリーミングする専用のllama.cppフォークを使用した結果、新しい内容では約5.1tok/s、キャッシュに必要なデータが存在する条件では約21tok/sを記録しています。
この実験で特に興味深いのが処理時間の内訳です。新しい内容を処理する際、実験者は約20%が計算、約26%がPCIe、約54%がNVMeに費やされたと報告しています。つまりGPU演算が最大のボトルネックではありません。モデルが巨大すぎるため、必要なExpertをSSDから持ってくる処理の方が大きな問題になっています。ゲーム用SSDなら、PCIe 4.0からPCIe 5.0へ交換してもフレームレートが大幅に上がることは通常ありませんが、巨大MoEをストレージまで使って動かす場合、SSDはロード時間を短縮する部品ではなく、AI推論そのものに参加するメモリ階層になります。
構成の考え方「AI用PC」の構成はゲーム用PCと違ってくる
ここまでの結果から考えると、巨大なローカルLLMを動かすPCは一般的なゲーミングPCとはかなり異なる構成になります。ゲーム用PCならRTX 5090を搭載していても、メモリ32GBと2TB SSDで十分な人は多いでしょう。一方、巨大MoEを扱うなら128GB〜192GB級のシステムメモリや、大容量NVMe SSDの意味が急激に大きくなります。さらにGPUからあふれたExpertをCPU側で扱うため、CPUとメモリの帯域幅も無視できません。
ローカルAIを本格的に利用するなら、RTX 5090の32GB VRAMには依然として大きな価値があります。しかし今回の研究を理由に「284BのDeepSeekが動くからRTX 5090を買う」と考えるのはおすすめしにくいところです。現在のRTX 5090は非常に高価で、巨大MoEを使うにはGPUだけでなく128GB〜192GB級RAMや大容量SSDまで必要になります。さらにFreeTokenは一般的なゲームアプリのようにインストールして何でも高速化できるソフトではなく、PyPIでは2026年9月時点でも開発ステータスがBetaとされ、NVIDIA CUDAとLinux系環境を中心としたソフトウェアです。普通にAIとチャットしたいだけなら、クラウドAPIを利用した方が圧倒的に簡単で、ローカルで動かす意味が大きいのは、機密データを外部へ送信したくない、API料金を気にせず大量処理したい、オープンウェイトモデルを自由に改造したいといった用途でしょう。
RTX 5090そのものの入手性にも触れておきます。2026年9月時点で、米国の実売価格は発売時の1,999ドルから大きく上昇し、大手小売で単体カードの在庫が実質的に消滅する場面も報告されました。中国の業者がRTX 5090をAIワークステーション向けにパレット単位で調達しているとみられる動きも伝えられていますが、GDDR7自体の調達コスト上昇など他の要因も絡んでおり、AI需要だけが高騰の主因と断定できる段階ではありません。ただし、FreeTokenのようにコンシューマー向けGPUでローカルAIを動かす取り組みが今後広がれば、ゲーム用途以外の需要がRTX 5090へさらに重なっていく可能性はあります。価格動向の詳しい経緯はRTX 5090の品薄・高騰まとめで随時更新しています。
| あなたの立場 | 今回の結果の意味 | どうするか |
|---|---|---|
| RTX 5090だけ買えば284Bも動くと思っていた | それだけでは動きません | 実際の検証環境は192GB級RAMを併用した構成です。GPU単体の話ではありません |
| 32GB VRAMのGPUでVRAM内に収まるモデルを使いたい | FreeTokenは不要です | 複雑なオフロードを行わず、通常どおりGPUへ全体をロードした方が単純で高速です |
| 120B〜500B級のMoEモデルを個人PCで試したい | 選択肢が広がっています | GPU予算だけでなく、大容量RAM・高速NVMeへの投資も検討してください |
| 普通にAIとチャットできればよい | この技術は必要ありません | クラウドAPIの方が導入も運用も簡単です |
FAQよくある質問
FreeTokenは、RTX 5090を搭載したゲーミングPCで284BのDeepSeek-V4-Flashを約22〜25tok/sで動作させています。ただし284Bのモデルが32GB VRAMへ収まったわけではありません。MoEで毎回利用するExpertが限られる特徴を利用し、GPUを高速なExpertキャッシュとして使いながら、CPU・システムRAM・PCIeを含むPC全体でモデルを処理しています。そのため同じRTX 5090でも、一般的な32GB RAMのゲーミングPCと192GB RAMを搭載したAI向けPCを同じように考えることはできません。
さらに2026年9月には、552Bへ巨大化したDeepSeek-V4.1-Flashについても、RTX 5090 1枚・約126GiB RAM・NVMe SSDを組み合わせて約5.1tok/sで動作させる別の実験が登場しました。こちらでは処理時間の半分以上をNVMe関連が占めるケースも確認されており、巨大LLMではSSDまで推論性能を左右する領域に入っています。
RTX 5090の32GB VRAMという上限がなくなったわけではありません。むしろ重要なのは、VRAM容量を超えたら即座に「実行不可能」になる時代ではなくなりつつあることです。今後ローカルAI用PCを組む場合、「一番VRAMの多いGPUを買えば終わり」ではなく、RAM容量やメモリ帯域、大容量SSDまで含めて構成を考える必要が出てきそうです。



