RTX 5090 1枚で284BのDeepSeekが22〜25tok/s|FreeTokenは「VRAM 32GBの壁」をどう越えた?【2026年9月】

RTX 5090 1枚で284BのDeepSeekが22〜25tok/s|FreeTokenは「VRAM 32GBの壁」をどう越えた?【2026年9月】

本記事にはアフィリエイト広告(Amazon・楽天市場等)のリンクが含まれています。

GAMING PC / ローカルAI・2026年9月
RTX 5090 1枚で284BのDeepSeekが22〜25tok/s
FreeTokenは「VRAM 32GBの壁」をどう越えた?
GeForce RTX 5090は32GBのGDDR7を搭載する2026年時点の最上位コンシューマーGPUですが、それでも数百B(数千億)パラメータ級の巨大モデルを丸ごと読み込むには足りません。2026年8月に公開されたAI推論システム「FreeToken」は、RTX 5090搭載PCで総パラメータ284BのDeepSeek-V4-Flashを22〜25tok/sで動かしています。GPU・CPU・システムRAM・PCIeを一体の推論システムとして扱う仕組みを、一次情報で検証します。
284Bモデルが22〜25tok/sVRAM・RAM・NVMeを一体運用552B版の実験結果も検証

出典:FreeToken論文「Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution」、FreeToken Wiki「RTX 5090」、FreeToken公式GitHub、DeepSeek公式「DeepSeek-V4.1-Flash」発表、llama.cpp Discussions「DeepSeek-V4.1-Flash on one RTX 5090」にもとづきます(2026年9月25日時点で確認)。

32GBのVRAMを積んでいても、数百Bパラメータ級のAIモデルは普通なら読み込めません。それが常識でした。

2026年8月に公開されたAI推論システム「FreeToken」は、RTX 5090を搭載したゲーミングPCで、総パラメータ数284BのDeepSeek-V4-Flashを実際に22〜25トークン/秒で動作させています。ただしこれは「284BがVRAM32GBに収まった」という単純な話ではありません。GPUだけでなく、CPU・システムメモリ・PCI Expressまで含めてPC全体を一つの推論システムとして扱うことで成立しています。

FreeTokenの論文と公開資料をもとに、284BのDeepSeekを動かせた仕組み、一般的なゲーミングPCでも再現できるのか、そして2026年9月に552Bへ巨大化した最新のDeepSeek-V4.1-Flashをめぐる別の実験結果まで確認します。

先に結論

FreeTokenは、RTX 5090搭載PCで総パラメータ284BのDeepSeek-V4-Flash(アクティブパラメータ約13B)を約22〜25tok/sで動作させました。ただし284Bモデル全体がVRAM32GBに収まったわけではなく、頻繁に使うExpert(MoEの部分ネットワーク)をVRAM側の高速キャッシュに置き、残りをCPU・システムRAM側で処理する仕組みです。この結果はRTX 5090単体ではなく、192GB級のシステムRAMを組み合わせた構成で確認されています。さらに2026年9月には、552Bへさらに巨大化した最新のDeepSeek-V4.1-Flashを、RTX 5090 1枚とNVMe SSDへのストリーミングで動かす別の実験も報告されており、その処理時間の54%はNVMe側が占めています。ローカルAI用PCでは、VRAM容量だけでなくシステムRAMとストレージの速度まで性能を左右する時代に入りつつあります。

目次

実測RTX 5090で284BのDeepSeek-V4-Flashを実行

FreeTokenは、研究者チームが2026年8月17日にarXivで公開したAI推論システムです。論文タイトルは「FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution」で、大規模なオープンウェイトAIモデルを、データセンターだけでなく一般ユーザーのPCでも実用的に動かすことを目的としています。論文では8GB VRAMのノートPCからRTX 5090搭載ゲーミングPC、ワークステーション向けGPUまで、複数の環境を検証しています。

ゲーミングPCとして特に興味深いのがDeepSeek-V4-Flashです。総パラメータ数284B、実際の推論で使うアクティブパラメータは約13BというMoE(Mixture-of-Experts)モデルで、RTX 5090環境では実際のエージェント系ワークロードを通じて約22〜25tok/sを維持したと報告されています。FreeToken公式の公開資料では、比較対象の既存方式に対して約1.5〜2.3倍の速度だったとされています(この倍率はQwen3.6・DeepSeek-V4-Flach両方の検証結果を合わせた範囲です)。

22〜25tok/sは、単に「起動できた」という技術デモの水準ではありません。1秒間に20トークン以上生成されるため、実際の対話にも利用できる速度です。巨大モデルを無理やりロードして1トークン生成するのに数十秒かかる、という話とは性格が異なります。FreeToken側の検証では、実際のエージェント系タスクを3種類続けて実行した場合でも、生成速度は最初のターンから12%以内の低下にとどまったとされています。比較対象とした既存方式(KTransformers)は2つ目のタスクまでに約31%速度が落ちており、単発のベンチマークだけでなく、連続した実用タスクでも速度が維持されている点が今回の結果の特徴です。

誤解注意「284Bが32GB VRAMに入った」わけではない

今回の結果だけを見ると「RTX 5090なら284Bモデルを32GB VRAMで動かせる」と思ってしまうかもしれませんが、実際にはそうではありません。FreeTokenの考え方は、巨大なMoEモデル全体をVRAMへ入れるのではなく、GPU・CPU・ホストメモリ・PCIeをまとめて利用することにあります。

FreeToken自身も、個人のPCを「小さなGPU」としてではなく「統一され、弾力的な推論プラットフォーム」として扱うという考え方を論文の中心に置いています。従来のローカルLLM運用では「モデルがVRAMに収まるか」が最初の判断基準で、収まらなければCPUへオフロードして急激に遅くなるという前提がありました。FreeTokenは最初からVRAMだけに全モデルを置くことを前提にせず、必要な部分を必要な場所で処理する設計にすることで、VRAM容量よりはるかに巨大なモデルを扱います。

技術的背景なぜMoEならこんなことができるのか

この仕組みを理解するには、DeepSeekが採用するMoEがポイントになります。MoEでは、巨大なモデルに含まれるすべてのパラメータを毎回使うわけではありません。多数の「Expert」を持ち、入力されたトークンに応じて必要なExpertだけを選択します。DeepSeek-V4-Flashの場合、43層それぞれで256個のExpertのうち6個だけが有効化される構造になっており、総パラメータ数は284Bでも実際にアクティブになるのは約13Bにとどまります。

そこでFreeTokenは、使用頻度の高いExpertをGPU側へキャッシュしながら、GPUに置かれていないExpertについてはCPUで処理するか、GPUへ転送するかを状況に応じて変えます。FreeTokenの公式GitHubでは、帯域幅に応じたCPU・GPU協調実行、グローバルLRU Expert Cache、実行中のメモリ管理などが主要機能として説明されています。つまりRTX 5090の32GB VRAMは「巨大モデルを全部収納する倉庫」ではなく、頻繁に使うExpertを置いておく高速なキャッシュに近い役割になります。この発想であれば、モデル全体が32GBを大幅に超えていても動かせます。

構成の実態RTX 5090だけ買っても同じ速度にはならない

ここは今回の結果を見るうえで最も注意したい点です。FreeTokenで重要なのはRTX 5090だけではありません。GPUに載っていないExpertを扱う以上、システムメモリの容量と帯域幅、CPU性能、PCIeの転送速度も推論性能へ影響します。FreeToken公式のRTX 5090向け資料でも、GPU・CPU・RAM・PCIe帯域を協調させることが特徴として説明されています。

実際、FreeToken関連の公開資料で紹介されているRTX 5090ゲーミングデスクトップは、Ryzen 9 9950X3D・RTX 5090 32GBに加えて192GBのDDR5メモリを搭載した構成です。RTX 5090自体はGeForceのゲーミングGPUですが、192GBのシステムメモリは一般的なゲームPCとはまったく違います。2026年現在、ゲームだけなら32GBで困らないケースが多く、64GBでもかなり余裕があるのに対し、192GBは明確にAIワークステーション寄りの構成です。今回の結果は「普通のRTX 5090ゲーミングPCがそのまま巨大AIサーバーになる」というより、「GeForceを使ったデスクトップPCでも、RAMを含めてAI向けに構成すればデータセンター級の巨大MoEを扱える可能性が出てきた」と考える方が正確でしょう。

VRAMの役割32GB VRAMの価値が下がったわけではない

一方で、「VRAM容量はもう関係ない」と考えるのも誤りです。むしろFreeTokenでもGPU側に多くのExpertをキャッシュできる方が有利です。GPU上に必要なExpertが存在すれば、システムRAMから転送したりCPU側で処理したりする必要がありません。

FreeToken公式の資料では、RTX 5090環境におけるDeepSeek-V4-FlashのExpert読み出しについて、適応型キャッシュを使った場合でも約39%がキャッシュミスだったとされています。比較対象の静的配置ではさらに高いミス率になっています。つまり32GB VRAMは「全部入らないから意味がない」のではなく、32GBという大きな高速キャッシュを持っているからこそ、巨大モデルの一部をGPU側へ保持できるということです。VRAM 8GBのGPUとRTX 5090の32GBでは、この点でも条件が大きく違います。

小規模GPUでは8GBのRTX 4060 Laptopでも35Bモデルを動かせる一方、小さなモデルには不向き

FreeTokenの研究はRTX 5090だけの話ではありません。論文では8GB VRAMのRTX 4060 Laptop GPUでもQwen3.6の35Bモデルを検証しており、NVFP4ビルドで約39.3tok/sを記録しています。これはRTX 4090の約92%に相当する速度で、比較対象とした実運用トラフィックの中央値(約33tok/s)も上回っているとされています。もちろん35Bと284Bでは規模が大きく違うため、RTX 4060でDeepSeek-V4-Flashが同じように動くという意味ではありませんが、「VRAM 8GBだから8GB以内のモデルしか実用的に使えない」という境界を緩められることは分かります。

一方でFreeTokenが常に高速というわけでもありません。RTX 5090と128GB RAMの環境でFreeTokenを検証した国内ユーザーの報告では、23.5GBクラスの比較的小さなモデルではllama.cppやvLLMの方が高速だった一方、65.2GBのgpt-oss-120bでは単発約127.1tok/s、83.5GBのQwen3.5-122B-A10Bでは約32.0tok/sで動作しています。32GB VRAMに普通に収まるモデルなら、複雑なオフロードを行わずGPUへ載せた方が単純です。FreeTokenが本領を発揮するのは、使いたいMoEモデルがVRAMを大幅に超えている場合と考えるのが妥当でしょう。

最新モデルDeepSeek-V4.1-Flashはさらに552Bへ巨大化

もう一つ注意したいのが、現在のDeepSeekとの世代差です。FreeTokenの論文でRTX 5090による22〜25tok/sが確認されているのは284BのDeepSeek-V4-Flashですが、DeepSeekは2026年9月10日に「DeepSeek-V4.1-Flash」を正式公開しました。名前は似ていますが、総パラメータ数は552Bまで巨大化しています。

DeepSeek公式によると、V4.1-Flashは新しいCausal Encoder-Decoder構造を採用し、入力時には8B、出力時には16Bのパラメータをアクティブにするマルチモーダル対応のMoEです。「RTX 5090でDeepSeekが22〜25tok/s」という数字を、そのまま最新のV4.1-Flashへ当てはめることはできません。

別の実験552BをRTX 5090 1枚で動かした実験、ボトルネックはNVMeへ

ここからがさらに興味深いところです。FreeTokenとは別に、DeepSeek-V4.1-Flash公開直後の9月、552BのV4.1-FlashをRTX 5090 1枚で実際に動作させた実験結果がllama.cppのDiscussionsで公開されました。この環境はRTX 5090の31.8GiB VRAMに加え、125.7GiBのシステムRAMとPCIe 5.0 NVMeを使用しています。モデルのExpertをNVMeからRAM、VRAMへストリーミングする専用のllama.cppフォークを使用した結果、新しい内容では約5.1tok/s、キャッシュに必要なデータが存在する条件では約21tok/sを記録しています。

この実験で特に興味深いのが処理時間の内訳です。新しい内容を処理する際、実験者は約20%が計算、約26%がPCIe、約54%がNVMeに費やされたと報告しています。つまりGPU演算が最大のボトルネックではありません。モデルが巨大すぎるため、必要なExpertをSSDから持ってくる処理の方が大きな問題になっています。ゲーム用SSDなら、PCIe 4.0からPCIe 5.0へ交換してもフレームレートが大幅に上がることは通常ありませんが、巨大MoEをストレージまで使って動かす場合、SSDはロード時間を短縮する部品ではなく、AI推論そのものに参加するメモリ階層になります。

構成の考え方「AI用PC」の構成はゲーム用PCと違ってくる

ここまでの結果から考えると、巨大なローカルLLMを動かすPCは一般的なゲーミングPCとはかなり異なる構成になります。ゲーム用PCならRTX 5090を搭載していても、メモリ32GBと2TB SSDで十分な人は多いでしょう。一方、巨大MoEを扱うなら128GB〜192GB級のシステムメモリや、大容量NVMe SSDの意味が急激に大きくなります。さらにGPUからあふれたExpertをCPU側で扱うため、CPUとメモリの帯域幅も無視できません。

ローカルAIを本格的に利用するなら、RTX 5090の32GB VRAMには依然として大きな価値があります。しかし今回の研究を理由に「284BのDeepSeekが動くからRTX 5090を買う」と考えるのはおすすめしにくいところです。現在のRTX 5090は非常に高価で、巨大MoEを使うにはGPUだけでなく128GB〜192GB級RAMや大容量SSDまで必要になります。さらにFreeTokenは一般的なゲームアプリのようにインストールして何でも高速化できるソフトではなく、PyPIでは2026年9月時点でも開発ステータスがBetaとされ、NVIDIA CUDAとLinux系環境を中心としたソフトウェアです。普通にAIとチャットしたいだけなら、クラウドAPIを利用した方が圧倒的に簡単で、ローカルで動かす意味が大きいのは、機密データを外部へ送信したくない、API料金を気にせず大量処理したい、オープンウェイトモデルを自由に改造したいといった用途でしょう。

RTX 5090そのものの入手性にも触れておきます。2026年9月時点で、米国の実売価格は発売時の1,999ドルから大きく上昇し、大手小売で単体カードの在庫が実質的に消滅する場面も報告されました。中国の業者がRTX 5090をAIワークステーション向けにパレット単位で調達しているとみられる動きも伝えられていますが、GDDR7自体の調達コスト上昇など他の要因も絡んでおり、AI需要だけが高騰の主因と断定できる段階ではありません。ただし、FreeTokenのようにコンシューマー向けGPUでローカルAIを動かす取り組みが今後広がれば、ゲーム用途以外の需要がRTX 5090へさらに重なっていく可能性はあります。価格動向の詳しい経緯はRTX 5090の品薄・高騰まとめで随時更新しています。

あなたの立場今回の結果の意味どうするか
RTX 5090だけ買えば284Bも動くと思っていたそれだけでは動きません実際の検証環境は192GB級RAMを併用した構成です。GPU単体の話ではありません
32GB VRAMのGPUでVRAM内に収まるモデルを使いたいFreeTokenは不要です複雑なオフロードを行わず、通常どおりGPUへ全体をロードした方が単純で高速です
120B〜500B級のMoEモデルを個人PCで試したい選択肢が広がっていますGPU予算だけでなく、大容量RAM・高速NVMeへの投資も検討してください
普通にAIとチャットできればよいこの技術は必要ありませんクラウドAPIの方が導入も運用も簡単です

FAQよくある質問

RTX 5090のVRAM32GBだけで284Bのモデルが動くのですか
いいえ。モデル全体をVRAMに収めているわけではありません。使用頻度の高いExpertをVRAM側にキャッシュしつつ、残りをCPU・システムRAM側で処理する仕組みです。実際の検証環境も192GB級のシステムRAMを併用しています。
FreeTokenを使えばどんなモデルでも速くなりますか
いいえ。32GB VRAMに普通に収まる小さめのモデルでは、複雑なオフロードを行わないllama.cppやvLLMの方が高速な場合があります。FreeTokenが有利なのは、VRAMを大幅に超える120B〜500B級のモデルを扱う場合です。
DeepSeek-V4-FlashとV4.1-Flashは同じモデルですか
いいえ、別モデルです。FreeTokenで22〜25tok/sを記録したのは284B・アクティブ約13BのV4-Flashです。2026年9月10日公開のV4.1-Flashは552Bへ巨大化しており、同じ数字をそのまま当てはめることはできません。
今すぐRTX 5090をAI目的で買う価値はありますか
用途次第です。巨大MoEを扱うにはGPUだけでなく128GB〜192GB級のRAMや大容量SSDも必要で、投資額は大きくなります。普通にAIとチャットしたいだけならクラウドAPIの方が簡単です。RTX 5090自体の実売価格も2026年9月時点で高騰が続いており、最新の動向はGPU価格の最新動向まとめで確認できます。
総括

FreeTokenは、RTX 5090を搭載したゲーミングPCで284BのDeepSeek-V4-Flashを約22〜25tok/sで動作させています。ただし284Bのモデルが32GB VRAMへ収まったわけではありません。MoEで毎回利用するExpertが限られる特徴を利用し、GPUを高速なExpertキャッシュとして使いながら、CPU・システムRAM・PCIeを含むPC全体でモデルを処理しています。そのため同じRTX 5090でも、一般的な32GB RAMのゲーミングPCと192GB RAMを搭載したAI向けPCを同じように考えることはできません。

さらに2026年9月には、552Bへ巨大化したDeepSeek-V4.1-Flashについても、RTX 5090 1枚・約126GiB RAM・NVMe SSDを組み合わせて約5.1tok/sで動作させる別の実験が登場しました。こちらでは処理時間の半分以上をNVMe関連が占めるケースも確認されており、巨大LLMではSSDまで推論性能を左右する領域に入っています。

RTX 5090の32GB VRAMという上限がなくなったわけではありません。むしろ重要なのは、VRAM容量を超えたら即座に「実行不可能」になる時代ではなくなりつつあることです。今後ローカルAI用PCを組む場合、「一番VRAMの多いGPUを買えば終わり」ではなく、RAM容量やメモリ帯域、大容量SSDまで含めて構成を考える必要が出てきそうです。

2026 BEST BUY — ゲーミングPC
TITAN GAMING AQUA UNO RTX 5060 Ryzen 7 5700X 850W GOLD電源
エントリー

TITAN GAMING AQUA UNO

RTX 5060 + Ryzen 7 5700X

Amazon
GALLERIA FGC5M-R56-W ゲーミングPC
ミドル

GALLERIA FGC5M-R56-W

RTX 5060 + Core Ultra 5 225F

Amazon
GALLERIA XDR7A-R56T16G-WL RTX 5060 Ti 16GB Ryzen 7 9800X3D
ミドルハイ

GALLERIA XDR7A-R56T16G-WL

RTX 5060 Ti 16GB + Ryzen 7 9800X3D

Amazon
ASUS ROG G700 RTX 5070 Ryzen 7 9800X3D
ハイエンド

ASUS ROG G700

RTX 5070 + Ryzen 7 9800X3D

Amazon
Amazon PICK UP — ゲーミングライフ
final VR3000 for Gaming 有線ゲーミングイヤホン バイノーラル3Dサラウンド
VR用イヤホン

final VR3000

Amazon
Samsung microSD Express 512GB Nintendo Switch 2 動作確認済 最大800MB/s
Switch2 512GB

microSD Express 512GB

Amazon
ねんどろいど 勝利の女神 NIKKE 紅蓮 ブラックシャドウ
NIKKE

ねんど NIKKE 紅蓮

Amazon
グッドスマイルアーツ上海 勝利の女神:NIKKE Hyper Body 紅蓮:ブラックシャドウ 可動フィギュア 全高約150mm
NIKKE予約

NIKKE 紅蓮 可動

Amazon
ねんどろいど 崩壊スターレイル マダム ヘルタ
崩壊スタレ

ねんど マダム ヘルタ

Amazon
Writer
管理人アバター

ゲーミングスタイル管理人

自作PC愛好家・ゲーム歴15年超

ゲーミングPC歴は15年以上。毎年パーツを更新しながら最新トレンドを追いかけています。初心者にもわかりやすく、上級者も満足できる情報発信を心がけています。