Как робот предсказывает следующую секунду

Текстовая модель угадывает следующее слово. Модель мира угадывает следующий кадр — вместе с массой, скоростью и гравитацией. Один ползунок проходит весь цикл: от камеры до перехвата.

Этап Что он видит
  1. 0
  2. 1
  3. 2
  4. 3
  5. 4

Нажмите на участок схемы, чтобы открыть этап.

Весь цикл целиком

Увидеть кадр, сжать его в состояние, прокрутить это состояние быстрее реального времени, взять действие, которое переживает прогон, и сравнить случившееся с воображённым. Разница и есть урок.

Что внутри

  1. 1 Мяч катится к краю стола — Языковая модель написала бы к этому подпись. Модель мира отвечает на другой вопрос: что будет дальше?
  2. 2 Картинка превращается в горсть чисел — Это не описание сцены, а состояние, которое можно прокрутить вперёд.
  3. 3 Пятьдесят шагов вперёд, не двигаясь — Точки — это не настоящий мяч. Это воображение модели, нарисованное впереди него.
  4. 4 Манипулятор берёт траекторию, которая успевает — Планирование здесь — это симуляция собственных вариантов, а не только мира.
  5. 5 Две кривые, которые почти совпали — Ошибка предсказания учит модель мира так же, как ошибка в следующем слове учит текстовую.

Интерактивные статьи

Этап Что он видит
  1. 0
  2. 1
  3. 2
  4. 3
  5. 4
1 / 5