
TL;DR
NeoMME は、2.6 億パラメータモデルと 8 億パラメータモデルからなる、多言語・マルチモーダルエンコーダーシリーズです。多くの生成型ビジョン・ランゲージモデルとは異なり、NeoMME は独立した事前学習済みビジョンタワーや因果言語モデルを使用しません。単一の双方向 Transformer がテキスト token と元画像のパッチを同時に処理し、マスク付き離散拡散目標によってモデル全体をゼロから学習します。
ColPali のページ画像方式を採用し、NeoMME に視覚文書検索のファインチューニングを施しました。NeoMME-Retriever は、1 回のフォワードパスで密ベクトル埋め込みとレイトインタラクション埋め込みを返します。2 つのモデルサイズはいずれも、ViDoRe v3 の nDCG@10 とモデルサイズの指標において Pareto フロンティア上に位置します。NVIDIA L40S GPU 上で、画像入力サイズを揃えて 2048×2048 として評価した場合、2.6 億パラメータモデルは毎秒約 51 ページをエンコードでき、スループットは ColModernVBERT の約 2 倍に達します。階層型 token プーリングと非対称量子化により、レイトインタラクションインデックスのストレージ容量を 1 ページあたり約 1.5 MB から 6 kB へ削減(255 分の 1)しながら、ベースラインの nDCG@10 の 95% 以上を維持します。
NeoMME は Hugging Face Transformers で利用できます。すべてのモデルチェックポイントを Apache 2.0 ライセンスで公開しています。
なぜ、さらに別のマルチモーダルエンコーダーが必要なのか?
近年の視覚文書検索器の多くは、事前学習済みの生成型ビジョン・ランゲージモデルをベースに改良されています。まず、独立して事前学習されたビジョンエンコーダーが視覚特徴を生成し、プロジェクターがそれを言語モデルの入力空間へマッピングします。その後、因果デコーダーが画像とテキストを組み合わせた表現を処理します。しかし、検索、分類、token アノテーションでは自己回帰的なテキスト生成は必要ありません。そのため、因果デコーダーも、それに伴うパラメータおよび計算コストも不要です。
ModernBERT は、双方向エンコーダーに効率的なアーキテクチャと学習上の改良をもたらしました。視覚文書検索の分野では、ModernVBERT が双方向の ModernBERT 風テキストエンコーダーを採用しつつ、独立して事前学習された SigLIP2 ビジョンタワーを維持しています。私たちは、ビジョン・ランゲージモデルのパラメータや計算コストを引き継ぐことなく動作するマルチモーダルエンコーダーを設計・学習することで、これをさらに発展させたいと考えました。
NeoMME(「ニーオミー」と読み、国際音声記号では /ˈniː.oʊ.mi/)は、単一の Transformer エンコーダーを使用して、入力されたテキストや画像からベクトル表現を生成する、多言語・マルチモーダル基盤エンコーダーです。既存の事前学習済みビジョンタワー、テキストエンコーダー、テキストデコーダーをベースとしていません。

双塔エンコーダーやビジョン・ランゲージモデルとは異なり、NeoMME は単一の双方向 Transformer で画像パッチとテキスト token を処理し、事前学習済みのビジョンタワー、テキストエンコーダー、テキストデコーダーを使用しません。
画像とテキストに同じ計算経路を使用するため、NeoMME では 2 つのモダリティをまたいだ事前学習、ファインチューニング、並列化、サービングをより容易に実現できます。
NeoMME エンコーダーバックボーン
画像とテキストを 1 つの Transformer で処理
NeoMME には、2.6 億パラメータと8 億パラメータの 2 つのモデルサイズがあります。両バージョンは同じアーキテクチャを採用しています。
-
**ネイティブなマルチモーダル入力:**テキスト入力には因数分解 token 埋め込みを使用し、画像は重なりのない 32×32 の画像パッチに分割して、小規模な MLP で投影します。どちらも同じ Transformer エンコーダーに入力されます。
-
**動的な画像解像度:**画像のアスペクト比とサイズを維持します。これにより、高解像度で情報量の多い文書ページにはより多くの token を使用し、内容の少ない小さな画像にはより少ない token を使用できます。
-
**長距離の双方向コンテキスト:**両モデルのコンテキスト長は 16,384 token です(標準的な 3840×2160 の 4K UHD 画像を最大 2 枚収容できます)。ほとんどの層では対称なスライディングウィンドウ注意機構を使用し、6 層ごとに 1 層と最終層ではグローバル注意機構を使用します。
-
**最新のエンコーダースタック:**NeoMME は、グループ化クエリ注意(grouped-query attention)、クエリ・キー正規化(query-key normalization)、ゲート付き注意(gated attention)、2 次元回転位置埋め込み(2D rotary position embeddings)、平方 ReLU MLP など、近年のエンコーダー改良技術を採用しています。
-
**多言語テキスト:**多言語テキスト、コード、数学コンテンツ、機械生成された画像転写テキストをもとに、131k 語彙の BPE トークナイザーをゼロから学習しました。

NeoMME エンコーダースタックにおける、スライディングウィンドウ注意層とグローバル注意層の交互配置。
マスクされたテキストを通じて画像から学習
NeoMME は、離散マスク拡散型のテキストデノイザーとしてゼロから事前学習しました。各純粋テキストサンプルについて、0 から 1 の範囲で破損率を一様にサンプリングします。その後、条件を満たす各テキスト token を、その破損率に従って独立にマスクします。
マルチモーダルサンプルでは、0.3 から 1 の範囲の破損率を使用します。画像パッチは可視のままにし、NeoMME はマスクされたテキストを再構成します。マスク率が低い場合、モデルは通常、周囲のテキストだけで欠落した単語を復元できます。たとえば、画像がなくても、The [MASK] sat on the mat に「cat」を入れるのは自然です。しかし、マスク率を高くすると、マスクされていない入力テキスト token から得られる情報がほとんどない状況で、画像に基づいて説明を学習するようモデルに促せます。

テキストの破損率を高めることで、言語だけに依存する近道を排除し、NeoMME が可視の画像証拠を利用するよう促します。
事前学習データには、多言語テキスト、コード、数学コンテンツ、自然画像、文書画像を混在させています。各モデルは、純粋テキストサンプル由来の 2,900 億 token を含む、約 5,240 億個のパック済み入力 token を処理しました。ModernBERT の 2 兆 token という学習予算と比べると、テキストデータ量は比較的小規模です。そこで、学習におけるデータ効率を高めるため、NorMuon オプティマイザーを採用しました。
NeoMME-Retriever
モデルのバックボーンを意味のある形で下流評価するため、ColPali が提案したページ画像方式を採用し、NeoMME に視覚文書検索のファインチューニングを施しました。従来のテキストベース検索では通常、テキストチャンクを検索します。一方、NeoMME-Retriever は文書ページのスクリーンショットをランク付けするため、PDF からテキストを抽出する際に必要となる一連の前処理や OCR の工程を回避できます。ページを画像として処理することで、レイアウト、図、表、フォントの種類やサイズなど、完璧な OCR モデルでも捉えられない視覚的手がかりを保持できます。
密検索とレイトインタラクション検索のためのデュアルヘッド設計
NeoMME-Retriever は、NeoMME のバックボーンを再利用します。