モデル・開発

効率的なマルチモーダルネイティブ・多言語エンコーダーNeoMME

原題: NeoMME: an efficient Multimodal-native and Multilingual Encoder

重要オープンウェイトApache 2.0

画像とテキストを1つのTransformerで処理

H Companyは2026年9月3日、マルチモーダル・多言語エンコーダーNeoMMEを公開しました。

260Mと800Mの2サイズがあり、画像パッチとテキストトークンを1つの双方向Transformerで処理します。

別に事前学習した画像エンコーダーや因果言語モデルを使わず、モデル全体を最初から学習しています。

テキスト、コード、数学、自然画像、文書画像を含むデータで、各モデルを約5,240億入力トークン分学習しました。

コンテキスト長は16,384トークンで、画像の縦横比と解像度を保った動的入力に対応します。

視覚文書検索向けのNeoMME-Retrieverは、1回の推論でdense表現とlate-interaction表現を出力します。

PDFをOCRでテキスト化せず、ページ画像のレイアウト、表、グラフを保ったまま検索できます。

階層的トークンプーリングと量子化を組み合わせ、late-interaction索引の保存量を1ページ約1.5MBから6KBへ削減したと報告しています。

260MモデルがNVIDIA L40S上で1秒あたり約51ページを処理したという速度と検索精度は、提供元による評価です。

全チェックポイントはApache 2.0で公開され、Hugging Face Transformersから利用できます。

基盤モデル、検索用モデル、Sentence Transformers向けのdense・late-interaction各モデルとデモが提供されています。

原文

← 日次まとめへ戻る