Новые возможности Ollama: установка версии 0.15.5

Вчера Ollama была обновлена до версии 0.15.5, добавив поддержку новых моделей, включая qwen3-coder-next, которая имеет отличные способности в написании кода. Однако стоит отметить, что для использования Ollama есть ограничения по квантизации: доступны только модели q4_K_M размером 52Гб и q8_0 размером 85Гб, либо нужно прибегнуть к платному облачному запуску. Модель обучена на 80 миллиардах параметров, большинство из которых составляют код.

Для локального запуска с максимальной продуктивностью потребуется как минимум 80 Гб видеопамяти. Запуск на CPU возможен, но для этого необходимы 128 Гб оперативной памяти DDR5, что приводит к медленной работе.

Многие пользователи, не имеющие возможности собрать мощный сервер для запуска таких моделей, оставляют отрицательные отзывы. При этом, когда они получают возможность пользоваться сервером с уже загруженными моделями, они все равно продолжают критиковать качество Ollama.

Тех, кто заинтересован, я готов пригласить на свой ИИ сервер, где доступны 10 различных моделей. Доступ бесплатный, но временный. После завершения настройки RAG, сервер будет выключен. Адрес сервера: http://demonryb.ru:8100/. Регистрация обязательна, и я подтверждаю ее вручную. Не стоит пытаться перегружать сервер неуместными запросами, иначе придется отключить доступ.
Краткие характеристики сервера: процессор Core I9 14900KF, RAM 192 Гб DDR5, два GPU RTX 4090 с 96 Гб VRAM, обеспечивающие производительность 166 TFLOPS по меркам huggingface. Если вы не имеете аналогичного оборудования, пожалуйста, подумайте перед тем, как ставить отрицательные оценки.