Команда PyTorch анонсировала новую систему распределённых вычислений под названием Monarch, которая позволяет пользователям управлять тысячами графических процессоров всего с помощью одного Python-скрипта. Ранее разработчики применяли подход SPMD, при котором каждый узел выполнял идентичный код, но Monarch меняет эту парадигму. Теперь можно написать единую управляющую программу, а фреймворк самостоятельно распределяет вычисления и синхронизацию между узлами.
Система вводит концепцию многомерных вычислительных сеток (meshes), где процессы и акторы могут взаимодействовать напрямую, передавая данные GPU без участия CPU через RDMA. Это снижает накладные расходы и ускоряет выполнение задач, таких как обучение RL и многомодальный анализ.
Дополнительным преимуществом является полная совместимость с Python, что позволяет использовать Jupyter Notebook и отлаживать код в реальном времени. Monarch поддерживает динамическое масштабирование и отказоустойчивость.
Фреймворк уже интегрирован в TorchForge, VERL и Lightning AI, что делает его перспективным стандартом для распределённого обучения. Monarch фактически превращает кластер в единый мозг, управляемый из одного интерфейса. Следите за новостями!