モデル・開発
効率的なマルチモーダルネイティブ・多言語エンコーダーNeoMME
原題: NeoMME: an efficient Multimodal-native and Multilingual Encoder
画像とテキストを1つのTransformerで処理
H Companyは2026年9月3日、マルチモーダル・多言語エンコーダーNeoMMEを公開しました。
260Mと800Mの2サイズがあり、画像パッチとテキストトークンを1つの双方向Transformerで処理します。
別に事前学習した画像エンコーダーや因果言語モデルを使わず、モデル全体を最初から学習しています。
テキスト、コード、数学、自然画像、文書画像を含むデータで、各モデルを約5,240億入力トークン分学習しました。
コンテキスト長は16,384トークンで、画像の縦横比と解像度を保った動的入力に対応します。
視覚文書検索向けのNeoMME-Retrieverは、1回の推論でdense表現とlate-interaction表現を出力します。
PDFをOCRでテキスト化せず、ページ画像のレイアウト、表、グラフを保ったまま検索できます。
階層的トークンプーリングと量子化を組み合わせ、late-interaction索引の保存量を1ページ約1.5MBから6KBへ削減したと報告しています。
260MモデルがNVIDIA L40S上で1秒あたり約51ページを処理したという速度と検索精度は、提供元による評価です。
全チェックポイントはApache 2.0で公開され、Hugging Face Transformersから利用できます。
基盤モデル、検索用モデル、Sentence Transformers向けのdense・late-interaction各モデルとデモが提供されています。