Команда исследователей DeepReinforce представила инновационную систему CUDA L2, которая создает код GPU для матричного умножения с высокой эффективностью. Созданные HGEMM ядра показывают производительность на 10-30% выше, чем у вручную разработанных библиотек cuBLAS и cuBLASLt от NVIDIA, что вызывает большой интерес в отрасли.
CUDA L2 кардинально меняет традиционный подход к оптимизации, используя комбинацию большой языковой модели и обучения с подкреплением. LLM генерирует CUDA ядро для конкретного размера матрицы, а цикл RL тестирует и улучшает его производительность. Этот процесс повторяется до тех пор, пока не будет найдено оптимальное решение.
Используя DeepSeek 671B, система обрабатывает около тысячи реальных конфигураций матриц, что обеспечивает ускорение в различных сценариях. В тестах CUDA L2 показала, что она на 17-22% быстрее torch.matmul и других решений, а в серверном режиме — на 24-29%. Это означает значительное снижение затрат на обучение моделей. Разработчики планируют адаптировать метод для новых архитектур и более плотных конфигураций, что может сделать CUDA L2 новым стандартом в оптимизации GPU кода.