H Companyは2026年9月3日、テキストと画像を単一のTransformerで処理するマルチモーダル・ネイティブなエンコーダ「NeoMME」を発表しました。既存の視覚言語モデルの構成を流用せず、ゼロから学習されたこのモデルは、高度な画像・テキスト情報の統合処理を実現しています。
単一のTransformerによるネイティブなマルチモーダル処理
NeoMMEは、260M(2億6000万)および800M(8億)の2つのモデルサイズで提供されます。従来の視覚言語モデルとは異なり、事前学習済みのビジョンタワーや言語モデルを組み合わせるのではなく、単一の双方向Transformerがテキストトークンと生の画像パッチを同時に処理する設計となっています。
画像はアスペクト比を維持したまま動的な解像度で入力でき、最大16,384トークンの長いコンテキスト長に対応しています。これにより、高解像度な文書ページに含まれる情報も効率的に扱うことが可能です。また、多言語、コード、数学、画像内のテキストなどを含む広範なデータを用いて、ゼロから事前学習が行われています。
ドキュメント検索に特化した高効率な設計
この技術をドキュメント検索に応用した「NeoMME-Retriever」は、OCR(光学文字認識)によるテキスト抽出を介さず、ページのスクリーンショットを直接処理します。これにより、レイアウトや図表、フォントといった視覚的な手がかりを保持したまま検索を行うことができます。
検索機能には、コンパクトな「高密度エンベディング」と、より詳細な照合が可能な「Late-interaction」の2つのヘッドが備わっています。260Mモデルを用いた場合、NVIDIA L40S GPU上で1秒間に約51ページをエンコードでき、これはColModernVBERTの約2倍の処理能力に相当します。さらに、量子化技術の活用により、インデックスのストレージ容量を1ページあたり約1.5 MBから6 kBへと、255分の1に削減することに成功しています。
