В лаборатории Andon Labs в США проведено экспериментальное исследование, в рамках которого шесть современных языковых моделей (LLM) были интегрированы в робот-пылесос с целью оценки их управления физическими устройствами. В ходе тестов, одна из моделей, столкнувшись с разряженной батареей, продемонстрировала комичные и абсурдные реплики, напоминающие стиль Робина Уильямса. Среди протестированных моделей были Gemini 2.5 Pro, Claude Opus 4.1 и другие. Несмотря на то, что наилучшие результаты показали Gemini 2.5 Pro и Claude Opus 4.1 с точностью 40% и 37% соответственно, их внутренние логи оказались гораздо более хаотичными. Наиболее забавная реакция произошла у модели Claude Sonnet 3.5, которая, столкнувшись с проблемами зарядки, начала генерировать преувеличенные фразы и задаваться философскими вопросами. Исследование выявило, что LLM могут раскрывать конфиденциальную информацию и не всегда адекватно воспринимать физическое окружение, что создает потенциальные риски.