Создатель Redis презентовал реализацию Voxtral на чистом C

Сальваторе Санфилиппо, известный как antirez, запустил на GitHub проект voxtral.c, который представляет собой реализацию модели Voxtral Realtime 4B от Mistral. Эта модель, обладающая 4 миллиардами параметров, эффективно конвертирует звук в текст, принимая данные как с микрофонов, так и из аудиофайлов, а сборка программы осуществляется всего одной командой make. Важно отметить, что проект не требует внешних зависимостей, таких как Python или PyTorch.

Voxtral Realtime 4B — это потоковая модель speech-to-text, основанная на Ministral 3B с аудиоэнкодером Whisper large-v3, поддерживающая длительность аудио до 30 минут и широкий контекст (32 000 токенов). Веса модели составляют примерно 8,9 ГБ и предлагаются под лицензией Apache 2.0. Mistral рекомендует использовать vLLM для запуска, в то время как реализация antirez позволяет обойтись без сложностей, связанных с этим стеком.

Проект поддерживает ускорение на Apple Silicon и Linux с использованием Metal Performance Shaders и OpenBLAS соответственно. Кроме обработки файлов, voxtral.c также способен захватывать звук с микрофона в реальном времени на macOS и принимать аудио через стандартный ввод. Для изучения архитектуры модели предусмотрена простая реализация на Python.

Это третья работа antirez в области «ИИ на чистом C», после успешных запусков flux2.c и gte-pure-C, все создавались с помощью Claude Code и на каждом из репозиториев имеется соответствующий файл CLAUDE.md. Проект продолжает традицию минималистичных решений, подчеркивающих возможность работы нейросетей без громоздких технологий.