Googleは2026年8月11日、Raspberry Pi上でLiteRTを使用してLLM(大規模言語モデル)などのAIモデルを効率的に実行できる環境を公開しました。これにより、クラウドに依存しないローカル環境での高度なAIエージェント開発が可能になります。
CPUとGPUの並列処理による高速化
Googleは、LiteRTのWebGPU(Vulkan)バックエンドを介して、Raspberry PiでのGPU推論を可能にしました。これにより、CPUとGPUの双方にタスクを分散して実行するヘテロジニアスな並列処理が実現します。例えば、継続的なビデオやオーディオの処理をGPUに任せることで、CPUのリソースをLLMの推論などの高優先度のタスクに割り当てることが可能です。
Gemma 4 E2Bの高速な動作
軽量なオープンモデルである「Gemma 4 E2B」をRaspberry Pi 5で実行した場合、LiteRT-LMを通じて高いパフォーマンスを発揮します。具体的には、プリフィルで99トークン/秒、デコードで9トークン/秒の速度を達成し、ピークメモリ使用量は1432 MBに抑えられています。この処理能力により、通常の人間が話す速度の約2倍となる、毎分約300語のテキスト生成が可能です。
開発を効率化するツール群
開発プロセスを簡略化するため、LiteRTは変換、量子化、ベンチマーク、推論を網羅するツールセットを提供しています。特にLiteRT CLIを利用することで、複数のライブラリを個別に管理することなく、単一のコマンドセットでエッジ向けワークフローを実行できます。また、Google AntigravityなどのAIコーディングエージェントにLiteRT CLIのスキルを追加して、複雑な機械学習ワークフローを自律的に実行させることも可能です。
