Новые бенчмарки ИИ: кто на вершине рейтинга?

Еженедельно появляются новые бенчмарки, но зачем они нужны? Ответы просты: во-первых, для перекрёстного подтверждения результатов. Так, GPT-5.4 занимает высокие позиции во всех четырех тестах, а YandexGPT и GigaChat оказываются в конце списка. Во-вторых, отсутствие систематических бенчмарков для российских моделей, тестирующих их в сравнении с международными аналогами, делает такие эксперименты необходимыми.

В нашем исследовании мы протестировали 54 модели по 32 сценариям, применяя промпты, написанные менеджерами. Claude Sonnet 4.5 показал второе место в нашем тесте, хотя в GPQA Diamond – лишь 17-е. Интересно, что наилучшие результаты среди доступных моделей из России показали MiniMax и Kimi, в то время как китайские MiMo V2 и другие остаются соперниками.

Разница в оценках между различными ИИ-моделями выявила огромный потенциал для улучшения, особенно в контексте структурирования задач. Сравнение моделей раскрывает, как важны правильные подходы к формулировке запросов для достижения качественного результата в управлении проектами.