Новая парадигма в робототехнике от NVIDIA

Джим Фан, работающий директором по робототехнике в компании NVIDIA, сделал важное заявление о том, что в области искусственного интеллекта происходит смена парадигмы. По его словам, предсказание следующего слова уже устарело. Вместо этого новая цель – предсказание физических состояний окружающего мира.

Современные VLA-модели для робототехники продолжают строиться на базе языковых моделей, однако в них используются параметры, которые хранят информацию о мире, как, например, «это лого Coca-Cola», а не о физике, например, «если наклонить бутылку, то жидкость выльется». Это, по мнению Фана, приводит к архитектурному тупику.

Он также привел интересный пример: приматы играют в гольф-кары, хотя и не понимают язык так, как это делает, например, BERT. Однако треть коры головного мозга отвечает за зрение – это показательно. Визуальное восприятие работает напрямую с сенсомоторикой, минуя слова.

По всей видимости, в этом году «модели мира» (предсказания будущих состояний на основе действий) станут краеугольным камнем для робототехники. Обсуждения будут сосредоточены на визуальном пространстве, используя симуляцию геометрии, а не текстовые переводы. Это редкий случай, когда представитель крупной корпорации открыто признает возможность неверного направления исследований.