AI技術の進化は、ソフトウェアの領域に留まらず、ついにそれを動かすハードウェアの設計領域にまで及始めました。AIを用いてAI向けのハードウェアを設計するオープンソースプロジェクト「openTPU」が公開され、注目を集めています。本プロジェクトは、ソフトウェアから回路設計までが一通り網羅されており、実際のFPGAチップ上での動作検証データも公開されています。
AIが設計したオープンソースのAIアクセラレータ「openTPU」とは
AIモデルの実行を高速化するための専用プロセッサ(AIアクセラレータ)を、AI自身の手によって設計するという画期的な試みが形になりました。GitHub上のリポジトリ「FeSens/openTPU」にて公開された「openTPU」は、AIを使ってAI向けハードウェアを設計するオープンソースプロジェクトです。
本プロジェクトは、オープンソースライセンスである「Apache License 2.0」の下で公開されており、誰でも自由にソースコードの利用や改変、再配布を行うことができます。
openTPUの最大の特徴は、ハードウェアの設計データだけでなく、それを動かすためのソフトウェア環境までが包括的に提供されている点です。具体的には、以下の要素が一つのリポジトリにまとめられて公開されています。
- RTL(Register Transfer Level):論理回路を記述したハードウェア設計データ
- ISA(Instruction Set Architecture):プロセッサの命令セットアーキテクチャ
- シミュレータ:ハードウェアの動作をソフトウェア上で模擬するツール
- コンパイラ:AIモデルをopenTPUで実行可能な形式に変換するツール
- プロファイラ:性能やボトルネックを分析するためのツール
このように、ソフトウェアから回路設計までが一通り公開されているため、AIアクセラレータがどのような仕組みで動作しているのかを体系的に学ぶための教材としての利用も想定されています。
FPGAを用いた実機検証とパフォーマンス
理論上の設計に留まらず、openTPUはすでに実際のハードウェア上での動作検証が行われています。
開発者は、AMDのKintex-7を搭載したFPGA(Field Programmable Gate Array)カードにopenTPUの回路を書き込み、実際のハードウェア上で動作を検証しました。FPGAを使用することで、実際の電子回路上での挙動や処理能力を測定することが可能になります。
この検証環境において、複数のモデルを動作させた際の具体的な生成速度が報告されています。
4bitに量子化したモデルを用いた検証結果は以下の通りです。
- LFM2.5-230M:毎秒82.1トークン
- Qwen3-0.6B:毎秒30.7トークン
- Qwen3.5-0.8B:毎秒23.3トークン
さらに、開発者の報告によると、347億パラメータという規模を持つモデル「Qwen3.5-35B-A3B」についても、毎秒3.95トークンで動作させたと開発者は報告しています。

今後の展望
現時点でopenTPUは、AMD Kintex-7 FPGAカード上での動作検証が行われており、公開されているRTLやツール群を活用することで、AIアクセラレータの内部構造を学ぶための教材としての利用も想定されています。AIによるハードウェア設計のオープンソースプロジェクトとして、今後の展開が注目されます。


コメント