← Papers

「Quo Vadis, World Modeling?」を読む

2026-08-15
目次

要旨

静的な教師データだけでは、エージェントが新しい行動を試した結果を得られない。しかし、実環境で試行錯誤を繰り返す方法は、高コストで危険を伴い、実行前の見通しを与えにくく、大規模な並列化も難しい。著者らは、エージェントと実環境の間で低コストなフィードバックを返す仕組みとして、世界モデルを位置づける。

そのうえで、現在状態と行動から次の物理状態を予測する古典的な世界モデルを、Agent-Centric World Proxy(エージェント中心の世界プロキシ)へ拡張する。プロキシが返すものは将来状態だけではなく、別視点からの観測、コードやツールの実行結果、過去の経験、再利用できるスキル、報酬や検証結果を含む。論文はこれらを六つの機能に分類する。

さらに、プロキシの返答をエージェントがどう利用するかを、L1「推論時の支援」、L2「訓練時の最適化」、L3「エージェントとプロキシの共進化」の三段階に分ける。六つの機能と三段階を交差させることで、既存研究と未開拓領域を一つの設計空間に置く。

論文の結論は、世界モデルを生成映像の忠実さだけで評価するのではなく、返答がエージェントの計画・判断・学習をどれだけ改善するか、すなわち actionable information gain(行動に使える情報利得)で評価する方向へ進むべきだ、というものである。

用語・記号

用語・記号意味
World Model状態と行動から将来状態を予測する古典的な世界モデル
World Proxy / WPエージェントの問い合わせに対し、実環境に根拠を持つ情報を返す中間プロキシ
ℓ物理時間とは限らない、エージェントとプロキシの相互作用ステップ
S状態、観測、記憶、知識、実行結果、検証、助言などを含む情報状態空間
F六つのプロキシ機能の種類
u_ℓ^F機能Fに対してエージェントが発する問い合わせ、行動、介入
actionable information gainエージェントの計画、判断、学習、検証、改善に利用できる情報の増分

課題・結果・結論の対応

flowchart LR
    P1["P1<br/>実環境への直接依存"] --> M["世界プロキシの<br/>統一的な枠組み"]
    P2["P2<br/>次状態予測への限定"] --> M
    P3["P3<br/>改善効果の整理不足"] --> M
    M --> R1["R1<br/>定義と成立条件"]
    M --> R2["R2<br/>6機能 × 3段階"]
    R1 --> C["エージェントを改善する<br/>情報で評価する"]
    R2 --> C

図:三つの課題を世界プロキシの枠組みに統合し、定義と設計空間から評価の方向を導く。

この論文には新規システムの比較実験がないため、ここでいう「結果」は精度や成功率ではなく、論文の分析から提示された定義、分類、設計空間を指す。

ID課題対応する分析結果結論根拠
P1 → R1 → C1実環境だけでは継続的な試行錯誤を拡張しにくい世界モデリングを中間プロキシとして定義エージェントを含む閉ループと、有用なプロキシの五条件を提示実環境に根拠を持ちつつ、低コストなフィードバックを返す層が必要1.2〜1.3節、2.3〜2.4節、表1・3
P2 → R2 → C2古典的な次状態予測では、エージェントが必要とする情報を覆えない状態遷移を情報遷移へ一般化し、返答を六機能に分類Dynamics、Spatial、Execution、Memory、Skill、Reward / Verificationを同じ形式で整理世界モデルは世界の再現だけでなく、エージェントに使える情報を返すべき2.1〜2.3節、4.1〜4.7節、表2・5
P3 → R3 → C3モデル自体の能力だけでは、エージェントをどう改善するかを説明できない改善への関与をL1〜L3に分け、六機能と交差6×3の設計空間と、SpatialのL3、Reward / VerificationのL3などの手薄な領域を提示推論支援、訓練、共進化を区別し、最終的には現実から修正され続ける閉ループを目指す3節、4.8節、表4・6

背景

著者らが対象にするのは、一度学習して終わるモデルではなく、環境との相互作用から成功と失敗を取り込み、継続的に改善するエージェントである。現在のエージェントは、専門家の軌跡、人手の注釈、教師あり微調整用のコーパスなど、静的なオフラインデータから学ぶことが多い。こうしたデータは既存のパターンを学ばせられる一方、エージェントが未知の行動を試したときに、その結果を返すことはできない。

最も直接的な代案は、エージェントに実環境で行動させ、観測、実行結果、報酬、エラーを次の計画や方策学習へ戻すことである。しかし論文は、実環境だけを訓練の場にする場合のボトルネックを四つ挙げる。

  1. 訓練効率と費用:ロボットでは装置の消耗や安全対策が必要になり、Web、GUI、ゲームでも大規模なサンプリングには計算資源と操作資源がかかる。
  2. 取り消し不能性と危険:ロボットの衝突、車両による事故、Web上の誤送信・誤削除など、誤操作を元に戻せない場合がある。
  3. 将来に関するフィードバックの不足:実環境は基本的に実行した行動の結果を事後的に返す。実行前に衝突の有無や複数手先の結果を比較するには向かない。
  4. 並列化の難しさ:実機の数には限りがあり、オンラインサービスや個々の利用者環境も、シミュレーションのように大量複製しにくい。

このため著者らは、世界モデリングをエージェントと実環境の間に置く。プロキシを使えば、候補行動の結果を予測する、別の視点を生成する、コマンドやツール呼び出しの結果を模擬する、関連する経験やスキルを検索する、計画を検証するといった問い合わせを、実行前に行える。実環境は不要になるのではなく、プロキシを現実に結びつけ、誤差を修正する証拠の供給元として残る。

課題

P1:実環境への直接依存では継続的改善を拡張しにくい

継続的改善には多くの試行、複数候補の比較、長期的な見通しが必要になる。前節の四つのボトルネックにより、それらをすべて実環境で行うことは難しい。論文がまず求めるのは、実環境に基づきながらも、安価で制御しやすく、実行前に問い合わせられる中間層である。

P2:物理的な次状態の予測だけでは返答の範囲が狭い

古典的な世界モデルは、時刻 t の状態 s_t と行動 a_t から、次状態 s_(t+1) を予測する。この定式化はロボティクス、モデルベース強化学習、動画予測などに適している。一方、継続的に改善するエージェントは、APIの返り値、過去の失敗、利用可能なスキル、計画の安全性、報酬や批評も必要とする。それらは物理的な次状態ではないが、次の判断を変える情報である。

P3:モデルの能力とエージェントへの効果は別に整理する必要がある

先行研究のL1 Predictor、L2 Simulator、L3 Evolverという分類は、世界モデル自身が一段先を予測できるか、長期のロールアウトを構成できるか、新しい証拠から自らを改訂できるかを表す。これに対し本論文が問うのは、プロキシの返答がエージェントをどの深さで改善するかである。モデルの内部能力だけを評価しても、その出力が推論時の助言なのか、方策を更新する訓練信号なのか、双方を更新する循環の一部なのかは分からない。

問題設定

古典的な世界モデル

論文は古典的な世界モデルを、概念的に次の形で置く。

予測した次状態 = WorldModel(現在状態, 行動)

物理時間 t → t+1 に沿って、現在状態 + 行動 → 将来状態を予測する形である。

エージェント中心の世界プロキシ

提案する一般形は次のとおりである。

ŝ_(ℓ+1) = WP(s_ℓ, u_ℓ^F),  s_ℓ ∈ S
  • ℓ:物理時間ではなく、エージェントとプロキシの相互作用の回数
  • S:物理状態だけでなく、観測、記憶、知識、実行結果、検証、助言などを含む情報状態の空間
  • F:Dynamics、Spatial、Execution、Memory、Skill、Reward / Verificationのいずれかのプロキシ機能
  • u_ℓ^F:エージェントが目的と文脈に応じて発する問い合わせ、行動、介入
  • ŝ_(ℓ+1):将来状態、観測、実行結果、記憶、スキル、報酬、検証結果など、プロキシが返す情報

この定義では、次の三点が古典的な世界モデルから変わる。

古典的な捉え方世界プロキシでの捉え方変更の意味
物理時間 t → t+1相互作用 ℓ → ℓ+1視点の照会、記憶検索、計画検証では物理時間が進むとは限らない
状態遷移情報遷移出力を将来状態以外の、エージェントが利用できる情報へ広げる
外部から与えられた条件エージェントが始める問い合わせ目標と文脈に応じて、エージェント自身が知りたいことを指定する

一回の相互作用は、(1)エージェントが問い合わせを提案する、(2)プロキシが情報の変化を予測・生成する、(3)返答をエージェントへ返す、(4)エージェントが計画、判断、方策学習、継続的改善に使う、という四段階で閉じる。

有用な世界プロキシの条件

論文の表3は、有用なプロキシを次の五条件で説明する。

条件論文での意味
Groundedness実環境のデータ、規則、軌跡、相互作用の証拠に基づく
Controllabilityエージェントからの問い合わせ、行動、介入に応じた返答を返す
Feedback Usefulness計画、判断、方策学習、継続的改善に役立つ
Cost and Scalability実環境との相互作用費用を減らし、安全に拡張できる
Forward-Looking Ability実行前に結果、反実仮想、危険を見通す

手法

全体像

この論文の方法は、新しい学習アルゴリズムではなく、定義と分類による設計空間の構築である。

  1. 世界モデルの出力を、物理的な次状態からエージェントが使える情報へ一般化する。
  2. 何を返すかという機能の軸で、世界プロキシを六つに分類する。
  3. 返答をどう改善に使うかという関与の軸で、L1〜L3に分類する。
  4. 六機能と三段階を交差させ、既存研究の位置と研究が少ない領域を示す。

課題との対応

課題枠組みの構成要素対処の仕方
P1エージェント―プロキシ―実環境の閉ループ実行前の低コストな問い合わせと、実環境による根拠づけを両立させる
P2相互作用ステップ、情報遷移、六つのプロキシ機能次状態以外の返答を同じ形式に含める
P3L1推論支援、L2訓練最適化、L3共進化プロキシの性能ではなく、エージェントのどこまで変えるかを区別する

詳細

六つの機能:何を返すか

論文の表5では、機能ごとにエージェントからの入力、代理する対象、出力を整理している。

機能エージェントからの入力代理する対象出力論文が挙げる例
Dynamics状態・履歴と行動、将来についての問い現実の動態と時間変化将来状態、ロールアウト、予測報酬動画予測、行動条件付き動画生成、ロボット動態、モデルベース強化学習
Spatial場面の文脈と視点・姿勢・位置別の視点からの空間観測新しい観測、描画した視界、空間表現NeRF、3D Gaussian Splatting、3D/4D再構成、ナビゲーションの空間的想像
Executionコード、コマンド、クリック、API・ツール呼び出しデジタル環境で実行した操作の結果実行後状態、標準出力、エラー、画面変化ブラウザ・GUIシミュレータ、コード実行予測、ファイルシステム遷移、API応答予測
Memory / Experience現在の課題と検索要求再利用できる過去の相互作用経験、失敗例、制約、危険の手掛かり成功・失敗軌跡の検索、制約・失敗記憶、リフレクション記憶
Skill目標・文脈とスキル要求再利用できる行動知識スキル候補、行動の事前知識スキルライブラリ、ツール利用手順、再利用可能な行動モジュール
Reward / Verification計画、軌跡、回答、行動環境、規則、評価系による判定報酬、批評、選好、検証、失敗理由報酬・選好モデル、検証器、批評モデル、軌跡評価、LLM-as-Judge

Dynamicsは古典的な世界モデルに最も近い。Spatialは、実際に移動せずに別の位置から何が見えるかを返す。Executionは連続的な物理運動ではなく、文字やクリック一つで結果が変わるデジタル環境の離散的な操作を扱う。

Memory / Experienceは単なる保存領域ではない。現在の課題に応じて関連する経験を返し、その情報が計画や改善に戻される場合に世界プロキシとなる。Skillは過去に何が起きたかより、現在の目標に対して何ができるかを返す。Reward / Verificationは環境全体を再現する必要はなく、行動や軌跡が環境・規則・評価系からどう判定されるかを予測する。

三つの段階:返答をどう使うか

段階プロキシの返答エージェントへの作用論文が示す性質
L1:Inference-Time Guidance記憶、スキル、模擬実行、検証結果推論時の文脈へ追加し、次の判断を改善するパラメータを変更しないため低コストで元に戻せるが、既存能力が上限になる
L2:Training-Time Optimization報酬、批評、選好、検証、模擬ロールアウトSFT、DPO、PPO、GRPOなどの目的に変換し、方策を更新する能力そのものを変えられるが、偏った信号は偏った方策を学習させる
L3:Agent-Proxy Co-Evolutionプロキシの知識と、実環境から得た新しい証拠エージェントとプロキシの双方を継続的に更新する最も深い改善である一方、変化する両者の整合を保つ必要がある

L1では、たとえばWebエージェントが購入ボタンを押す前に、その後のページをプロキシで模擬し、意図しない課金やエラーが予測されれば計画を変更する。L2では、エージェントが生成した軌跡をプロキシが採点・批評し、模擬軌跡や選好対を作り、方策学習へ使う。現在の失敗に合わせて、より難しい課題を生成する使い方も含まれる。

L3では、実環境で得た軌跡、成功例、失敗例を、プロキシの記憶、スキルライブラリ、検証器、シミュレータ、報酬モデルへ取り込む。逆方向には、プロキシの記憶、スキル、制約、検証規則、報酬信号をエージェントの方策へ反映する。この双方向更新により、エージェントが想定する結果と実環境が返す結果の差を縮める。

本論文のL1〜L3は、世界モデル自身の能力を表す分類ではない。論文が比較する先行分類では、L1 Predictorは局所的な一段予測、L2 Simulatorは行動条件付きの長期ロールアウト、L3 Evolverは新しい証拠による世界モデル自身の改訂を指す。本論文はそれと直交する軸として、返答がエージェントの文脈、パラメータ、プロキシとの共同更新のどこまで作用するかを表す。

六機能と三段階の組み合わせ

機能L1:推論時L2:訓練時L3:共進化
Dynamics想像したロールアウトで計画想像内で方策を学習実機上でモデルをオンライン更新
Spatial別視点を想像して移動合成した観測で訓練研究が少ない領域
Execution実行前に操作結果を模擬強化学習用の経験を合成共進化する実行モデルで自己改善
Memory判断時に経験を検索過去の成功・失敗から学習記憶を更新し、エージェントへ反映
Skillライブラリからスキルを再利用新しいスキルを作成・訓練エージェントとともにライブラリを成長
Reward / Verification推論時に計画を批評報酬・検証信号で強化学習発展途上の領域

この表は排他的な分類ではなく、一つのシステムが複数のセルにまたがる場合がある。論文は、同じ機能でもL1では助言者、L2では教師、L3では共同で変化する相手になると説明する。SpatialのL3とReward / VerificationのL3は、代表例が少ない領域として示されている。

実験・評価条件

本論文は提案モデルを実装して比較する実験論文ではない。データセット、ベースライン、学習条件、定量的な性能比較は設定されていない。本文は、既存研究の例を用いた概念定義、分類、設計空間の提示で構成されている。

結果

R1(P1に対応):中間プロキシと閉ループの定義

世界モデリングを、実環境を完全に置き換えるシミュレータではなく、実環境に根拠を持ちながら、より安価で制御しやすいフィードバックを返す中間プロキシとして位置づけた。エージェントが問い合わせ、プロキシが情報を返し、その情報でエージェントが改善する閉ループと、Groundednessを含む五つの成立条件が示された。

R2(P2に対応):六つの機能による一般化

物理時間を相互作用ステップへ、状態遷移を情報遷移へ、外部条件をエージェント起点の問い合わせへ広げる定義が示された。この定義により、DynamicsとSpatialだけでなく、Execution、Memory / Experience、Skill、Reward / Verificationも、エージェントに新しい情報を返す機能として同じ枠内に整理された。

R3(P3に対応):6×3の設計空間

六機能と三段階を交差させることで、プロキシが何を返すかと、その返答がエージェントをどう変えるかを別々に記述できる設計空間が示された。表6では各セルに代表的な利用法が置かれ、SpatialのL3は「underexplored」、Reward / VerificationのL3は「emerging」とされている。

これらは枠組みを構築した結果であり、世界プロキシが既存手法より高い性能を示したという実験結果ではない。

結論

C1(P1・R1に対応)

実環境はプロキシを現実に根づかせるために不可欠だが、大量の試行錯誤を担う唯一の場所には向かない。著者らは、実環境から証拠を受け取りつつ、実行前に低コストなフィードバックを返す世界プロキシを中間に置く方向を提案する。

C2(P2・R2に対応)

継続的に改善するエージェントにとって、世界モデリングは次の物理状態の予測に限られない。将来状態、別視点、実行結果、経験、スキル、評価を含む情報遷移を返し、その情報がエージェントに利用されることが中心になる。

C3(P3・R3に対応)

世界モデルは、それ単体がどれほど精密に世界を生成するかだけでなく、問い合わせたエージェントをどれほど改善するかで評価されるべきだと著者らは結論づける。L3の閉ループでは、実環境の証拠がプロキシを修正し、修正されたプロキシがエージェントを改善する。この循環は学習だけでなく、プロキシを現実から乖離させない安全上の仕組みとしても位置づけられている。

考察

著者が述べる限界と今後の課題

論文が最後に強調するのは信頼性である。プロキシが有用であるためには、実環境に根拠を持ち、不確かさを適切に扱い、現実との接触によって継続的に修正される必要がある。プロキシが現実からずれれば役に立たず、自信を持って誤った返答をする場合は、プロキシを使わない場合より悪い結果になりうる。

また、6×3の表で手薄だったSpatialのL3とReward / VerificationのL3は、著者らが研究の余地として示す領域である。前者では実環境から得た新しい空間情報と空間プロキシをどう共同更新するか、後者では変化するエージェントと評価器をどう整合させるかが、枠組み上の空白として残る。

この論文から読み取れること

以下は論文の分類に基づく、このノートでの整理である。

第一に、この論文の価値は「世界モデル」という語の境界を引き直した点にある。従来別々に扱われやすかったシミュレータ、メモリ、スキルライブラリ、検証器を、エージェントの問い合わせに対して環境由来の情報を返すという共通の役割でまとめている。

第二に、機能と改善段階を直交させたことで、似た仕組みの違いを説明しやすい。たとえばメモリ検索を推論時だけに使えばL1だが、その経験から方策を更新すればL2になり、実環境の新しい経験でメモリ自体を更新し、その知識をエージェントへ戻せばL3になる。

第三に、この広い定義を実際の評価へ落とす方法は、今後の課題として残る。論文は「エージェントをどれだけ改善するか」という評価方向と五つの条件を示すが、異なるプロキシ機能を共通に比較する単一の定量指標は提示していない。したがって、この枠組みは現時点では評価手順そのものより、研究を位置づけ、比較項目を選ぶための見取り図として使うのが適切だと考える。

読後に残った問い

  • プロキシの予測精度と、最終的なエージェント性能の改善をどう分離して測るか。
  • 安価だが誤るプロキシと、高価だが実環境に近いプロキシを、どの時点で切り替えるか。
  • エージェントとプロキシが同時に変化するL3で、誤りが互いに強化されることをどう検知するか。
  • MemoryやReward / Verificationまで世界モデルに含める広い定義が、個々の技術を比較するときにどこまで有効か。

付録

参照箇所

内容論文中の位置
実環境との直接相互作用の四つの制約1.2節、表1
古典的世界モデルから世界プロキシへの三つの変更2.1〜2.3節、表2
有用な世界プロキシの五条件2.4節、表3
L1〜L3と先行分類との違い3節、表4
六つの機能の入出力4.1〜4.7節、表5
六機能と三段階の組み合わせ4.8節、表6
最終的な主張と信頼性の課題5節