ロボットの頭脳、新たな SOTA
一晩眠って目を覚ますと、ロボットの頭脳における SOTA が入れ替わっていた。
今回、原力灵机の DM0.5 が、具現知能の「エベレスト」——RoboDojo の頂点に立った。

何しろ、あの RoboDojo である……
これは悪魔級に難しい具現知能ベンチマークで、香港大学マルチメディア研究室が、カリフォルニア大学バークレー校、清華大学をはじめとする世界約20のトップ研究機関と共同で立ち上げたものだ。
これらの名門大学による「品質管理」がどれほど厳しいかというと、
2026年7月時点で、シミュレーション部門の上位モデルの平均成功率はわずか8.80%、実機部門でも12.8%にとどまっている。
そう、いまだに一桁台で苦戦しているのだ。
とにかく難易度もリアリティも非常に高く、研究室に閉じこもって作られた、特定分野だけに強いモデルを容赦なくふるいにかける。
そんな中、DM0.5 が首位を獲得した——
- 総合スコア:24.90
- 平均成功率:19.34%
さらに表をよく見てみると、このモデルには際立った強みがあることに気づく——
記憶だ。
具体的には、次の Cover Blocks タスクを見てほしい。
ロボットはまず、左から右へ、ランダムに並べられた赤・緑・青の3つのブロックを覆う。色が完全に隠れた後、先ほどの観測をもとに、赤・緑・青の順番で1つずつブロックを再び露出させる。
DM0.5 は3回のランダム試験すべてで、成功率100%を達成した。
データにもその強さははっきり表れている。RoboDojo のランキングにおける Memory のスコアで、DM0.5 は47.74点を獲得し、他を大きく引き離している……
これは間違いなく、首位獲得を後押しした決定的な一撃だ。

しかも、これで終わりではない。
その他の権威あるベンチマークでも、DM0.5 は優れた結果を出している。
- **LIBERO:**総合成功率 99.0%
- **RoboTwin 2.0:**簡単なシーンと複雑なシーンで、成功率はそれぞれ 93.6% と 93.3%
- **VLA-Arena:**難易度の異なる設定で、成功率はそれぞれ 89.0%、53.6%、44.1%
- **RoboChallenge Table30 v2:**総合スコア 54.42、成功率 43%
そして、この SOTA 級の頭脳は——
すでにオープンソース化されている。
1つの基盤モデルで、6種類のシーンをすべて攻略
ランキングの数字は、結局のところ抽象的なものだ。DM0.5 が実際にどれほどの能力を持つのかは、Demo を見なければわからない。
そして原力灵机は、おそらく現在、シーン別の Demo を最も豊富に公開している基盤モデルベンダーだ。
外乱への対応、ブロックの組み立て、キュウリの皮むき、宅配便の仕分け……展示内容は目を見張るほど多彩だ。
しかし、あらためてよく見てみると、一見ばらばらに見えるこれらの Demo は、実はすべて同じ一点を示している。
基盤モデルの汎化能力だ。
順に見ていこう。
1. 人間による教示
これは、個人的に最も面白い Demo だ。
DM0.5 がカカシ先生と化し、人間が一度教示するだけで、瞬時にコピー&ペーストするように再現してみせる。
正直に言えば、この能力自体は決して目新しいものではない。多くの企業や研究チームが取り組んでいる方向性だ。
なにしろ、物理世界のシーンは非常に細分化されている。モデルの性能がどれほど高くても、その汎化能力ではカバーしきれないロングテールのタスクが必ず残る。こうしたシーンでは、ロバスト性が大きく低下してしまう。
これでは、具現知能における ChatGPT の瞬間には永遠にたどり着けない。
現在、業界で広く共有されている解決策は、事前学習だけですべてを解決しようとせず、実用化の段階で Human-in-the-Loop を導入することだ。人間の作業者が手本となる動画を撮影すれば、ロボットは「写輪眼」を開いたかのように即座に動きを合わせ、複雑なタスクを追従して実行できる。
ロボットを教えることを、弟子を教えるようにする。
原力灵机が取り組んでいるのは、まさにこの部分だ。
そして、冒頭で触れた「記憶」が、このアプローチの鍵となる。
DM0.5 は標準で最長60秒の記憶能力を備えており、ロボットはそれまでに実行した一連の動作を深く記憶し、連続的に振り返ることができる。
この長期記憶をもとに、モデルは言語の制約を直接乗り越え、人間による実演動画の内容を理解できる。
2. 精密な操作
原力灵机が選んだシーンは、ブロックの組み立てだ。
実は今年7月、上海で開催された WAIC でこの Demo を見た。正直なところ、現場で見たほうが動画よりはるかに迫力があった。
原力灵机は阶跃と共同で、展示エリアに長城を組み上げた……
そう、6台のロボットが15時間をかけ、81,920個のミニチュアブロックを使って、全長3.5メートルの万里の長城模型を作り上げたのだ。

会場も人であふれ、ほとんど中に入れないほどだった。
しかし、これは決して単なる「感情的な満足感」を与えるための Demo ではない。
ブロックの組み立てでは、最小の部品の幅が1センチ未満であり、ロボットは0.1~1ミリメートルのスケールで、把持と嵌合を完了しなければならない。この精度は、人間の手に生じる自然な揺れ、約0.3~1ミリメートルの範囲すら上回る。
そのうえ、ミニチュアブロックには製造公差があるため、力任せに押し込めば、簡単に位置がずれて動かなくなってしまう。
そこで、動画を注意深く見ると、かなり興味深い細部に気づく。
このロボット、寸勁を使っている!
まず位置を合わせ、それから軽く振動させ、押し下げることで、ブロックをしっかり嵌め込んでいる。

もちろん、自動的に誤りを修正する能力も非常に重要だ。
所詮はモデルなので、高精度なタスクで毎回 Zero-shot を目指すのは現実的ではない。安定性を確保するには、やはり閉ループ制御に頼る必要がある。

柔軟物体では、なおさら自動誤差修正が欠かせない。
たとえば、このキュウリの皮むき Demo では、ナイフを一度入れるとキュウリの形状が変化するため、モデルはリアルタイムに閉ループ調整を行う必要がある。
刃をどれだけ深く入れるか、どの程度の力をかけるか、果肉を傷つけず、きれいに皮をむくにはどうするか……すべてがミリ単位のさじ加減だ。

キュウリの役目はここで終わりだと思った?
いや、原力灵机はその後もキュウリを“鞭打ち”し続ける(違う)。
ただし、今度は重点が異なる。器用なハンドを使って切削するのだ。
モデルが追加学習によって高自由度の操作をこなしている点も、DM0.5 の汎化能力を示すものだろう。

3. 長時間の安定性と高い処理テンポ
ここからは、Demo が実際のシーンと密接に結びついてくる。
今年、北京・亦荘で開催された WRC で、原力灵机は宅配便の仕分けラインを会場に再現し、物流中継拠点が抱える最大の課題を正面から取り上げた——
荷物の単品分離だ。
コンベヤーは止まることなく動き続け、荷物ごとにサイズ、素材、置かれ方が異なる。従来の機械式ソリューションでは、このようなタスクに対応するのは難しい。
DM0.5 はあらかじめ用意されたスクリプトに依存せず、リアルタイムの視覚認識と意思決定だけで、平均3秒に1個を処理し、正確性は99%を超える。

先週、私も現場でこの Demo を間近に見た。
正直なところ、見ていて気持ちいいのは、やはり産業シーンだと思う。掃除のライブ配信を眺めるような、あのスッキリ感がある。
少なくとも、見ていられないほど遅くはない。枕を1つ拾うだけでも動作がカクつく、といったこともない……
ADHD の人にはぜひチェックしてほしい(違う)。
4. 外乱への耐性
現実世界は実験室ではない。カメラの視点はいつ急に変わるかわからないし、人間が突然現れて邪魔をすることもある。
DM0.5 の解決策は、階層型のデュアルシステム、つまり業界で主流となっている System 1 と System 2 のアーキテクチャだ。
System 2 は熟考を担う高次の頭脳で、理解、拒否、全体的な予測を担当し、Zero-shot を目指す。
System 1 は動作の専門家ネットワークであり、人間の直感的な反射のように、長時間にわたる複雑なタスクの中で生じる細かな処理を担当する。
このアーキテクチャに支えられることで、外部視点が大きく変化しても、DM0.5 は汎用 Picking において非常に高いロバスト性を維持する。
人間が強制的にタスクを中断させた場合でも、ロボットは現在の実際の状態を正確に理解し、その後の動作を自律的に修正できる。
6種類のシーン。ミリ単位の操作からコンベヤー上の仕分けまで、剛体から柔軟物体まで、実行から模倣まで。
これほど性質の異なるシーンで、同じモデルが一貫して優れた性能を示すのは、非常に珍しい。
現在、各社は100万時間規模のデータ収集にしのぎを削っている。しかし、データ量だけを見ることは、必ずしも第一原理に沿っていないのかもしれない。
もし基盤モデルに強い汎化能力がなければ、シーンごとに別々のモデルを学習することになる。Demo がどれほど増えても、それは散らばった真珠の山にすぎない。
特定分野に偏ったモデルでは、Scaling Up を実現できない。
これが、DM0.5 について私が最も興味深いと感じた Takeaway でもある。具現知能モデルそのものの能力が、いままさに評価され始めており、その上限は非常に高いところまで伸びうるのだ。
データ、アーキテクチャ、効率を全面的にアップグレード
ここまで述べてきたが、原力灵机はいったいどうやってこれを実現したのだろうか。
この点について、チームはすでに自分たちの経験を余すところなく公開している。
答えは3つの層に分けられる。具現知能において避けては通れない、3つの核心変数——データ、アーキテクチャ、レイテンシだ。
まずはデータから見ていこう。
**データが知能の上限を決める。**これは、具現知能のエンジニアリング全体において、間違いなく最も重要な要素だ。
DM0.5 のデータ資産は、主に次の3種類に分けられる。
- 実機:5万時間におよぶ高精度な操作データ。100種類以上の多彩な動作をカバーし、秒単位で精密な指示と動作をアライメントする。
- Ego:10万時間におよぶシーン動画。ミリ単位の高精度な 3D Landmark 生成に対応し、正確なアノテーションを実現する。

- シミュレーション:100万平方メートルの空間をモデル化し、複雑な屋内環境を構築。高精度な再構築によって Sim2Real Gap を解消する。

彼らはやはり、品質をかなり重視しているようだ。思いつきで闇雲にデータを集めているわけではない。
データ量については、Omni 融合の考え方によって解決している。これは現在、業界で比較的主流となっている手法であり、リスクを最小限に抑えられる。
次に、アーキテクチャを見てみよう。
一言でまとめると、DM0.5 には3つの大きなイノベーションがあり、それぞれ3つの課題に対応している。
1. どうすれば覚えていられるのか?
これは先ほど触れたとおりだ。DM0.5 の導入ハードルを下げるため、原力灵机はネイティブ長期記憶を導入した。
具体的には、チームはコンテキスト抽象化層で大規模な改良を行い、効率的な情報圧縮技術によって、4Bパラメータの VLMが事前学習の段階から履歴情報をネイティブに学習・記憶できるようにした。

2. どうすれば理解できるのか?
これについて、原力灵机は次のような見解を示している。
言語能力を持たない VLA は、データセットのオウム返しにすぎない。
結局のところ、言語は人間の思考能力を蒸留するうえで、最も扱いやすいモダリティなのだ。Language の層による強化があれば、非常に有利になる。
そこで、具現知能の思考連鎖タスクが生まれた。
DM0.5 はそのために具現知能の思考連鎖タスクを設計し、11種類の推論タスクによってモデルを駆動する。指示、ロボット自身、環境の3者を統合的にモデル化し、動作生成に意味理解と世界の予測能力を与えるのだ。
この過程で、チームは「反実仮想タスク」も構築した。あえて誤った指示を与えることで、モデルに機械的な照合ではなく、本当に「理解する」ことを強いる。
3. どうすれば正しくアライメントできるのか?
従来の動作監督は点ベースで行われるため、予測軌道と正解軌道の間の誤差が次第に蓄積し、最終的に失敗につながる。
原力灵机はアライメント型の動作監督を採用し、制約付き動的計画法によって最適なマッチングを効率的に計算することで、動作軌道の不一致という問題を一度に解決した。

データとアーキテクチャを組み合わせることで、DM0.5 の知能の上限は大きく引き上げられた。
しかし、本当に実用可能なものにするには、効率も見なければならない。
具現知能は最終的に、エッジデバイス上でリアルタイムに動作しなければならない。推論が十分に速くなければ、パラメータはただの紙くずだ。
そのため、原力灵机は一連の最適化を行った。詳細はここでは割愛するので、公式の技術レポートを直接参照してほしい。
最終的な成果は次のとおりだ。
- モデルコアのレイテンシ:534.04 ms → 57.49 ms
- 累積高速化:9.29×
- レイテンシ削減:89.2%
- API レイテンシ:p50 は 67.75 ms、p90 は 70.01 ms
- LIBERO 成功率:98.45% → 98.40%
文字どおり、1桁分の高速化を実現している……
しかも、精度はほぼ無損失だ。
まさに、VLA 推論システム全体を超進化させたと言える。

頂点に立つのは、山を下りるため
「頂点に立った」ことは確かに驚異的だ。しかし正直に言えば、それは本当に最も注目すべきことではないのかもしれない。
具現知能の世界では、天上の1日が地上の1年に相当する。**チャンピオンは頻繁に入れ替わる。**成績表1枚だけでは、すぐに過去のものになってしまう。
具現知能の発展サイクルに本当の足跡を残すのは、頂点に立った後に何を残そうとするかだ。
これが、DM0.5 が全面的なオープンソース化を選んだ理由なのかもしれない。
モデルの重みだけではない。DM0.5 のトレーニングフレームワークや下流タスクのワークフローなども、GitHub と Hugging Face で順次公開されている。開発者は再現、改変、拡張を行える。
たとえば、次の Demo は、原力灵机が DM0.5 をベースに、オープンソースのロボットアームキットと組み合わせ、教師ありファインチューニングによって学習したものだ。

LLM の世界では、オープンソースはもはや珍しいものではない。初期の DeepSeek から、現在の GLM、Kimi、MiniMax に至るまで、私たちはすでにオープンソースの流れに慣れている。
しかし、具現知能の業界においては、この出来事の意味は確かに少し違うと思う。
物理 AI はまだあまりにも初期段階にあり、未成熟だ。これは事実だ。
だからこそ、私たちにはより透明な議論、より現実に即した評価、より多くの公開された取り組みが必要になる……
もし当時、Google が Transformer を公開していなければ、OpenAI は ChatGPT へと続く道を永遠に見つけられなかったかもしれない。
RoboDojo の盛り上がりは、評価を「単発の Demo の披露」から「標準化された総合試験」へと押し進めた。これによって、具現知能は本当の意味で統一的に測定され、再現され、挑戦できるようになった。
DM0.5 の頂点獲得とオープンソース化は、さらにこの Benchmark の価値を実証した。すべての人に頂点へ到達するための方法論を示し、その方法論を持ち帰り、再利用できるようにしたのだ。
これが、原力灵机による現在の具現知能競争への答えだ。
エベレストに登るのは、決して山頂にとどまるためではない。
次の一歩は、山を下りること——
オープンソースでエコシステムに力を与え、第一線の具現知能の頭脳を、さまざまな業界の生産ラインへ送り込むことだ。
GitHub:https://github.com/dexmal/opendm
Hugging Face:https://huggingface.co/Dexmal/DM05
Tech Blog:https://www.dexmal.com/blog/dm0.5