ロボットはどうやって次の一秒を予測するのか

言語モデルは次の単語を当てる。世界モデルは次のフレームを当てる——質量も速度も重力も込みで。スライダー一本で、カメラから捕球までの一周をたどれます。

段階 見えているもの
  1. 0
  2. 1
  3. 2
  4. 3
  5. 4

図の一部をタップすると、その段階が開きます。

一周をまとめると

フレームを見て、状態へ圧縮し、その状態を実時間より速く回し、先読みに耐えた行動を取り、起きたことと想像したことを比べる。その差が次の教材になります。

収録内容

  1. 1 縁へ転がっていくボール — 言語モデルなら説明文を付けるでしょう。世界モデルが答えるのは別の問いです。次に何が起きるのか。
  2. 2 絵がひと握りの数値になる — 場面の説明ではなく、前へ回せる「状態」です。
  3. 3 動かないまま五十歩先へ — 点は本物のボールではありません。ボールの前方に描かれた、モデルの想像です。
  4. 4 間に合う軌道をアームが選ぶ — ここでの計画とは、世界だけでなく自分の選択肢も同時に回してみることです。
  5. 5 ほぼ重なる二本の曲線 — 予測誤差が世界モデルを鍛える。次単語の誤差が言語モデルを鍛えるのと同じことです。

インタラクティブな解説

段階 見えているもの
  1. 0
  2. 1
  3. 2
  4. 3
  5. 4
1 / 5