Команда Qwen из Alibaba Cloud анонсировала запуск Qwen3.5-Omni — современного поколения мультимодальной модели. Она может обрабатывать текст, изображения, аудио и видео, генерируя текст и речь в реальном времени. Модель доступна в трех вариантах: Plus, Flash и Light, через Offline API и Realtime API. Главное улучшение по сравнению с предшественником Qwen3-Omni — увеличение контекстного окна с 32 до 256 тысяч токенов, что позволяет обрабатывать более 10 часов аудио или 400 секунд видео 720p за один запрос. Распознавание речи охватывает уже 113 языков и диалектов вместо 19, а синтез — 36 языков вместо 10. Модель показала выдающиеся результаты на большинстве аудио- и аудио-видео бенчмарков, обойдя Gemini 3.1 Pro в общих задачах. Среди новых функций — семантическое прерывание и клонирование голоса. Также добавлена уникальная возможность написания кода на основе видео с аудиоинструкциями, которая возникла как эмерджентное свойство.