Организация METR опубликовала результаты оценки модели Claude Opus 4.6 по бенчмарку Time Horizon 1.1, который измеряет сложность задач для ИИ-агентов. Модель показала 50%-й временной горизонт в 14,5 часов, что соответствует времени, за которое человек-эксперт решит аналогичную задачу. Ранее этот рекорд принадлежал GPT-5.2 (high) с результатом 6 часов 34 минуты. Однако исследователи предостерегают от излишней буквализации этих данных: 95%-й доверительный интервал варьируется от 6 до 98 часов, причем верхняя граница превышает все задачники. В январе METR обновил набор тестов до версии 1.1, добавив 34% новых задач. Несмотря на это, ловкость новых моделей затрудняет корректное сравнение. MIT Technology Review охарактеризовал график METR как «самый неправильно понимаемый график в ИИ», подчеркивая, что 14,5 часов не указывают на непрерывную работу модели.