8月28日、Alibaba Group傘下のAmapは、長期依存を持たない初の1万フレーム級ストリーミング3D再構成モデル「ABot-Recon」を正式に発表しました。このモデルは長期記憶を必要とせず、連続する12フレームの局所映像だけで、数万フレームに及ぶ3Dシーンをリアルタイムかつ安定的に再構成し、「撮影しながら構築する」ことを実現します。KITTI、Oxford Spires、VBRなどの権威あるベンチマークにおいて、ABot-Reconはいずれも誤差が最小となるSOTA性能を達成しました。

自動運転や具身知能などの技術がオープンな環境へと進展するなか、Physical AIに求められているのは、単に「見える」ことだけではありません。移動しながら空間を継続的に理解し、自分がどこにいるのか、周囲に何があるのか、次にどう進むべきかを把握する必要があります。特に、測位信号が弱く環境の変化も激しい商業施設、園区、倉庫などのプライベートな環境では、システムが一度きりのマッピングや事後の再構成に頼ることは困難です。
現在、主流となっている解決策は、ストリーミング3D再構成技術によって3次元シーンをリアルタイムに再構成する方法です。しかし、この技術は誤差の累積やGPUメモリ使用量の増大など、さまざまな問題の影響を受けます。長距離シーン全体の整合性を維持するため、従来のストリーミング3D再構成では通常、再構成の過程にメモリアンカーを設定します。モデルは長期記憶に依存し、過去の情報を継続的に保存、検索、統合しなければなりません。シーケンスが長くなるほど、モデルの処理速度は低下し、精度も落ち、GPUメモリの使用量も増加します。
ABot-Reconは、長いシーケンスが精度、速度、GPUメモリに及ぼす課題に対応するため、まったく新しい技術アプローチである**「局所姿勢予測+残差最適化」**を採用しました。従来の手法とは異なり、ABot-Reconは長期記憶アンカーに依存した記憶アライメントを廃し、直近12フレームの連続映像のみを局所コンテキストウィンドウとして利用します。各ステップでは、現在のカメラ座標系における局所点群と、隣接する2フレーム間の相対姿勢を予測します。これにより、計算量を一定に保ちながら軌跡の滑らかさを確保し、その後、オンラインで組み合わせることで、完全なグローバル軌跡と3次元シーンを段階的に構築します。予測対象は常に局所的で、シーケンスの長さに依存しないため、動画が長くなってもモデルのメモリ使用量や1フレームあたりの計算量は増加しません。

局所予測における誤差の累積に対して、ABot-Reconは予測側と学習側のそれぞれに誤差補正および誤差制約のメカニズムを設計し、軌跡誤差をリアルタイムに補正します。革新的なモデル設計により、ABot-Reconは複数の公開長時間シーケンスベンチマークで既存手法を上回りました。
精度については、Oxford Spiresの長時間シーケンスベンチマークにおいて、ABot-Reconの平均軌跡誤差は、業界を代表する手法LingBot-Mapと比べて40.6%低減されました。相対回転誤差RPE-Rはわずか0.12°で、同種のストリーミング手法として最高水準に達し、従来のSOTAと比べて約40%低減しています。
速度については、KITTI-02テストにおいて、ABot-Reconは24.45 FPSのリアルタイム再構成を実現し、推論速度は業界を代表する手法の1.24倍に達しました。平均軌跡誤差が20メートル未満のすべての手法の中で、ABot-Reconはスループットが最も高く、GPUメモリ使用量も最小でした。
GPUメモリについては、ABot-Reconのピーク時のGPUメモリ使用量はわずか約6.71 GBで、同種のモデルの約3分の1にとどまります。つまり、コンシューマー向けGPUであるGTX 1080 Tiが1枚あればこのモデルを実行でき、ストリーミング3D再構成の導入ハードルを大幅に引き下げます。
注目すべきは、ABot-Reconが単眼RGB動画を入力するだけで、追加の深度センサーや既知のカメラパラメータを必要とせず、1万フレーム級のリアルタイム3次元再構成を実現できる点です。これにより、測量業界におけるプライベート環境のマッピングやベースマップの更新に活用できるだけでなく、具身知能、自動運転、3Dコンテンツ制作など、幅広い分野への応用も可能になります。

これらの向上は、直感に反する一つの結論を裏付けています。モデルをより遠くまで進ませるために、より多くを記憶する必要はありません。わずか12フレームの映像を観察するモデルが、より正確で、より速く、より省リソースな経路を切り開いたのです。現在、ABot-ReconはGitHubで推論・評価コードとモデルの重みをオープンソースとして公開しており、魔搭コミュニティにも体験用ページを開設しています。開発者は手軽に実際の動作を試すことができます。
付録:
プロジェクトページ:https://amap-cvlab.github.io/ABot-Recon-html
技術レポート:https://github.com/amap-cvlab/ABot-Recon/blob/main/ABot-Recon-Tech-Report.pdf
魔搭:https://modelscope.cn/studios/amap_cvlab/ABot-Recon/
本記事はAmapの提供によるもので、量子位が許可を得て転載しています。記載内容に関する見解は原著者に帰属します。