Исследование показало, как ИИ расщепляет рассуждения

Недавнее исследование, проведенное командами Goodfire AI и Гарварда, выявило интересное поведение reasoning-моделей, таких как DeepSeek-R1 и GPT-OSS. Оказалось, что несмотря на высокую уверенность (до 90%) в ответах, модели продолжают генерировать цепочку рассуждений, будто еще находятся в процессе обдумывания. Используя три метода анализа, включая attention-пробы и CoT-монитор, исследователи обнаружили большой разрыв между внутренними активациями моделей и текстовыми выводами, особенно на простых вопросах MMLU. В отличие от этого, на сложных вопросах из GPQA-Diamond наблюдалась другая динамика: уверенность модели возрастала вместе с текстом, что подтверждало реальное мышление. Анализ показал, что «aha-моменты» в ответах свидетельствуют о настоящих внутренних сомнениях, и если зонд сообщает о готовности модели к ответу, генерацию можно мгновенно остановить, что существенно экономит ресурсы без потери точности.