Hugging Faceは2026年9月1日に、WebGPUを利用してブラウザ上でAIを高速に動かすためのライブラリ「@huggingface/kernels」と、207種類の最適化済みカーネルを公開しました。これにより、Webブラウザ上でのAI推論における計算処理の高速化が期待できます。
ブラウザでのAI推論を支える基盤技術
モデルをブラウザで動作させる際、行列演算や畳み込みといったGPUへの操作が不可欠です。WebGPUはこれらをブラウザから実行可能にするAPIですが、同じ操作でもハードウェアによって性能が大きく異なります。Hugging Faceは、これらの操作を担う「カーネル」を個別に管理・公開することで、高速な推論基盤の構築を目指しています。
207種類のカーネルと検証ツール「Fleet」
公開されたカーネルは、行列積(MatMul)やソフトマックス(Softmax)など、機械学習で多用される207種類の演算を網羅しています。各カーネルは、インターフェースやテストケース、ベンチマークを含む完全なパッケージとして配布されます。また、ユーザーのデバイス上でカーネルの性能や正当性をテストし、その結果をフィードバックできるベンチマークスイート「Fleet」も同時に提供を開始しました。
既存の実行環境を上回る高速性能
Hugging Faceは、自社のカーネルと既存のONNX Runtime Webを比較する検証を行いました。Apple M4 GPUを用いたテストにおいて、公開されたカーネルは幾何平均で2.57倍、中央値で1.90倍高速であるという結果を得ています。具体的な演算では、要素ごとの加算(Add)において3.52倍、層正規化(LayerNormalization)において2.22倍の高速化を記録しました。
