Компания Alibaba Cloud представила свою новейшую разработку — систему Aegaeon, которая обещает существенно снизить потребность в видеокартах Nvidia для работы с искусственным интеллектом. Новый подход позволяет уменьшить количество необходимых GPU почти в пять раз, что решает одну из ключевых проблем облачных сервисов — неэффективное распределение вычислительных ресурсов.
Традиционно в облачных системах лишь несколько моделей, такие как Qwen или DeepSeek, находятся под постоянной нагрузкой, в то время как многие другие остаются неиспользованными, занимая ценные GPU. Aegaeon, в свою очередь, динамически перераспределяет ресурсы, позволяя ускорителям переключаться между моделями в реальном времени во время генерации ответов.
Теперь один GPU может обслуживать до семи моделей одновременно, что значительно превышает прежние показатели в два или три. Кроме того, задержки при переключении задач сократились на 97%. Система уже применяется на маркетплейсе Bailian от Alibaba Cloud, где размещены сотни AI-моделей от различных разработчиков. Эксперты отмечают, что Aegaeon может стать важным шагом к более устойчивому и экономичному AI, особенно в условиях нехватки мощных GPU.