Z.aiは2026年8月26日、マルチモーダル対応の大規模言語モデル「GLM-5.3-Flash」を発表した。コーディングやエージェント作業で既存モデルを凌駕する性能を実現し、1タスクあたりのコストを従来比約1割に抑える。低価格ながら高い推論効率を持ち、幅広い業務フローへの導入が期待される。
Z.aiは2026年8月26日、マルチモーダル対応モデルGLM-5.3-Flashを発表した。総パラメータ3200億、アクティブパラメータ180億の設計を採用し、コーディングや自律型エージェント作業のベンチマークで既存モデルを大きく上回るスコアを記録した。複雑な処理に必要な計算資源を削減するアーキテクチャを採用したことで、高い性能を維持しつつ推論コストを劇的に引き下げている。
同モデルは初のネイティブマルチモーダル設計となり、画像やGUIの表示結果を直接解釈できる。フロントエンド開発や3Dシミュレーション、スプレッドシートやプレゼン資料の解析など、視覚情報とテキストを統合して判断する専門業務に対応する。長文コンテキストの処理では、線形注意力と疎な注意力を組み合わせたハイブリッド機構を採用し、メモリ使用量と計算コストを大幅に圧縮した。
提供価格は1タスクあたり0.045ドル(割引後)に設定されている。中国製AIチップ上で最適化された推論エンジンと分散アーキテクチャにより、最大100万トークンのコンテキスト処理も安定して実行可能だ。低コストで高水準なマルチモーダル推論を実現したため、開発効率の向上や業務自動化を目指す組織にとって、実用的な選択肢となる。
