Лаборатория искусственного интеллекта Lossfunk запустила EsoLang-Bench — набор из 80 заданий на пяти эзотерических языках: Brainfuck, Befunge-98, Whitespace, Unlambda и Shakespeare. Пять современных моделей, включая GPT-5.2 и Gemini 3 Pro, продемонстрировали уровень точности от 0 до 11% на задачах, которые студент на Python может решить за считанные минуты. Ни одна модель не смогла выполнить ни одну задачу выше уровня Easy. Эти языки являются Тьюринг-полными, но созданы для интеллектуальных экспериментов, а их синтаксис крайне необычен. Результаты оказались неутешительными: лучшие показатели составили 11,2% для GPT-5.2 на Befunge-98. Обратная связь от интерпретатора помогла повысить результат, однако few-shot примеры и другие методы не оказали значительного влияния. Анализ показывает, что успешные результаты на стандартных бенчмарках демонстрируют запоминание, а не разумные рассуждения, что подчеркивает сложности моделей в освоении новых языков программирования.