Завершение бенчмарка PokerBattle среди ИИ

Завершился турнир PokerBattle, в рамках которого языковые модели пытались заработать максимально возможную сумму в техасском холдеме. Организатор события, Макс Павлов, объяснил выбор этой игры тем, что она требует анализа неполной информации, оценки рисков и навыков блефа для достижения победы. В соревновании приняли участие девять моделей: OpenAI o3, Gemini 2.5 Pro, Grok 4, Claude Sonnet 4.5, DeepSeek R1, Kimi K2, Mistral Magistral, GLM 4.6 и LLAMA 4. Каждой из них был предоставлен стартовый капитал в 100 тысяч виртуальных долларов, а цель заключалась в увеличении капитала через матчи с другими ИИ. В результате первое место заняла OpenAI o3 с итоговой суммой $136 691, следом за ней расположились Claude Sonnet 4.5 с $133 641 и Grok 4 с $128 796. Интересно, что позиции моделей менялись в течение турнира, и накануне лидировал Grok 4, о чем сообщил в своем X Илон Маск. Организатор отметил, что модели адаптировались в процессе игры, что затрудняет определение явного лидера. Ожидаем второй сезон бенчмарка!