研究者が2026年8月17日、個人向けエッジデバイスで大規模混合専門家(MoE)モデルを実行する「FreeToken」を発表した。固定されたオフロード戦略を取らず、ハードウェアのリソース状況に合わせて計算とモデル状態を動的に割り当てることで、既存の端末で最先端モデルの運用を可能にする。
研究者は2026年8月17日、個人向けエッジデバイスで大規模混合専門家(MoE)モデルを実行する「FreeToken」を発表した。このシステムは、パーソナルマシンを単なる小型GPUではなく、統合された弾力性のある推論プラットフォームとして捉えることを目指している。
従来のデータセンター向けインフラの前提を超え、フリーテキストやローカルのAIエージェントワークロードが実行パターンを絶えず変化させる現実に対応する。エッジハードウェアは機種によってリソースのバランスが異なるため、FreeTokenは固定されたオフロード戦略を採用せず、利用可能なリソースに計算とモデル状態を動的にマッピングする。
システム全体をモデルレイアウトや読み込み、エージェントの状態再利用、ランタイムメモリ管理などを含めて協調設計している。8GBのラップトップGPUからワークステーション向けの単一GPUまで幅広いハードウェアで動作し、20以上のMoEモデルに対応する。これにより、ラップトップでは35Bパラメータのモデル、ゲーミングデスクトップでは284Bのモデル、ワークステーションでは753BパラメータのGLM-5.2を単一GPUで運用することが可能になる。オープンソースの重みを実用的なローカルソフトウェアへと変換し、ユーザーが既に所有する端末を最先端インテリジェンスの実行プラットフォームとして活用できる基盤を提供している。
