125Bの超巨大AIをゲーミングPCで高速実行。オープンソースアプリ「Strata」が登場、VRAM 12GB環境で最大94トークン/秒を記録

ゲーミングPCの内部とモニターに表示されたAIデータ AI

結論:超巨大AIが手元のPCで動く時代の到来

近年、大規模言語モデル(LLM)のローカル実行への関心が高まっています。しかし、パラメータ数が1000億を超えるような超巨大モデルを個人向けのハードウェアで動作させることは、極めて高いハードルでした。こうした中、1250億(125B)パラメータを誇る最新モデル「Qwen3.8-Flash-Next」の量子化版を、一般的なゲーミングPCなどのコンシューマー向けハードウェアで高速にローカル実行可能にするAI実行アプリケーション「Strata」が登場しました。

Strataとは何か:MITライセンスの無料オープンソースアプリ

Strataは、125Bパラメータの「Qwen3.8-Flash-Next」モデルの量子化版をローカル環境で実行するためのAI実行アプリケーションです。ライセンスはMITライセンスが採用されており、無料かつオープンソースとして公開されています。これにより、ユーザーは高額なクラウドAPIを利用することなく、自身のローカルPC上で超巨大モデルの推論環境を構築することができます。

マザーボードに装着されたPC用RAMメモリ

動作に必要なシステム要件

Strataを動作させるためには、一定のスペックを満たしたコンシューマー向けハードウェアが必要です。具体的なシステム要件は以下の通りです。

  • グラフィックスカード(GPU):VRAM 12GB以上を搭載したもの。具体的には、NVIDIA GeForce RTX 20/30/40/50シリーズ、または指定されたAMD Radeon RX/AI PROモデルが対象となります。
  • システムメモリ(RAM):32GB以上。
  • ストレージ:約80GBの空き容量(高速な読み込みのためにSSDが推奨されています)。
  • OS:Windows 10/11、またはLinux。

RAM容量が分ける実行可能なモデル

Strataでは、搭載しているシステムメモリ(RAM)の容量によって、実行できるモデルのバリエーションが制限されます。このメモリ容量の差が、扱えるモデルの精度や用途を決定する重要な要素となります。

  • RAM 32GB環境:実行できるのは、コーディングに特化した専門モデル「Qwen3.8-Flash-Next · GSQ-RCO Coder」のみに限定されます。
  • RAM 64GB環境:より多様な量子化モデルの実行が可能になります。具体的には、2ビット量子化版の「IQ2_XS」、および3ビット量子化版の「IQ3_XXS」や「IQ3_S」などを動作させることができます。

実機デモにおける驚異的なパフォーマンス

Strataの最大の特徴は、コンシューマー向けハードウェアでありながら、実用的な速度で動作する点にあります。検証された環境(NVIDIA GeForce RTX 5070(VRAM 12GB)、Ryzen 5 7600、RAM 64GB)におけるパフォーマンス測定では、以下のような高速な回答書き込み速度が確認されています。

  • 2ビット量子化版「Q2_0」:94トークン/秒
  • 3ビット量子化版「IQ3_S」:53トークン/秒

VRAMが12GBという、ミドルハイクラスのグラフィックスカードを搭載したPCであっても、量子化技術とStrataの最適化によって、これほど高速なレスポンスを得られることは、ローカルAIの可能性を大きく広げるものです。

まとめ

Strataは、125Bの「Qwen3.8-Flash-Next」量子化版をローカルで高速動作させるという、これまでの常識を覆すパフォーマンスを提示しました。無料かつオープンソースで提供されるこのアプリは、ローカルAI環境の構築を志すユーザーにとって、新たなスタンダードとなる可能性を秘めています。

情報元

コメント