Исследование: ИИ-модели теряются в многоходовых диалогах

В недавнем исследовании, проведенном Microsoft Research и Salesforce, было проанализировано свыше 200 000 диалогов с такими ИИ-моделями, как GPT-4.1, Gemini 2.5 Pro и другими. Ученые обнаружили, что модели часто «теряются» в разговорах, особенно в длинных многоходовых диалогах, что приводит к снижению значимости их ответов и частым галлюцинациям. Хотя такие системы, как GPT-4.1, достигают 90% точности при обработке отдельных запросов, этот уровень падает до 65% в условиях длительных бесед.

Кроме того, исследователи отметили, что ответы моделей могут увеличиваться в длину от 20 до 300%, что приводит к накоплению неверной информации. Даже с дополнительными «токенами мышления», такие как o3 от OpenAI, модели не смогли избежать этой проблемы, продемонстрировав снижение надежности на 112%.

Это ставит под сомнение использование ИИ на благо пользователей, учитывая риск недостоверной информации в ответах. Microsoft также высказывал мнение, что неумелое использование подсказок пользователями влияет на الأداء ИИ. Возможно, именно «глупые» вопросы снижают его эффективность.