Новая модель ИИ успехов Андрея Карпати превосходит GPT-2

Андрей Карпати, ранее занимавший пост директора по ИИ в Tesla, успешно обучил свою модель, которая превзошла по производительности GPT-2, используя лишь $73 и три часа времени на одном из восьми узлов с GPU H100. Для сравнения, OpenAI потратила более недели на тренировку оригинальной GPT-2 (1,5 млрд параметров) в 2019 году, используя 32 TPU v3 и около $43 000. Снижение затрат в 600 раз за семь лет стало возможным благодаря многим факторам: современное железо (H100), оптимизированный софт (Flash Attention 3, torch.compile), новые алгоритмы (оптимизатор Muon и скользящее окно внимания), а также качественные данные (FineWeb-edu). По словам Карпати, ежегодно стоимость обучения GPT-2 снижается на 40%. Его проект nanochat состоит всего из ~1000 строк кода и содержит 768 млн параметров, 24 слоя и современные архитектурные решения. Для дополнительной мотивации Карпати запустил лидерборд, где участники соревнуются в обучении своих моделей до уровня GPT-2 на восьми H100 — текущий рекорд составляет 3,04 часа.