ТЕХНОЛОГИИ

Alibaba представила универсальную модель Qwen3.8-Omni-Flash с контекстом на 1 млн токенов

Компания Alibaba анонсировала новую мультимодальную модель Qwen3.8-Omni-Flash, способную обрабатывать текст, изображения, аудио и видео с контекстом до 1 млн токенов.

Alibaba анонсировала выпуск новой мультимодальной ИИ-модели Qwen3.8-Omni-Flash, которая обладает способностью обрабатывать текст, изображения, аудио и видео в рамках единой архитектуры. Эта модель поддерживает контекстное окно размером 1 миллион токенов и демонстрирует высокие результаты в ряде задач, включая редактирование видео, создание музыкальных клипов, кинопроизводство и ведение диалогов в реальном времени.

Среди значительных достижений Qwen3.8-Omni-Flash является снижение стоимости услуг. По сравнению с предыдущей версией Qwen3.5-Omni-Plus, цена за час обработки аудиоданных уменьшилась более чем на 98%, а для аудио и видео — более чем на 93%. Результаты в 29 бенчмарках улучшились более чем на 25% по сравнению с предшественником. В тестах, связанных с аудио- и видеоагентами, модель набрала 71,0 балла в WildClawBench-MM, что на 36,5 балла выше, чем у предыдущей версии, а в UniClawBench — 69,6 балла.

Модель Qwen3.8-Omni-Flash достигла сопоставимых уровней качества в совместной обработке звука и видео с Google Gemini 3.8 Flash, а в области обработки звука даже превосходит её. Система распознавания речи поддерживает 74 языка и диалекта, включая кантонский и уйгурский, а генерация поддерживает 29 языков, включая основные европейские и азиатские языки.

Одной из уникальных функций является механизм «агентного понимания», который позволяет модели выбирать, какие части аудио и видео анализировать, исходя из конкретного запроса. Это улучшило результаты в OmniVideoBench и сократило потребление токенов на 45,7%. В Alibaba подчеркивают, что современные ИИ-решения часто не справляются с длительными аудио- и видеозаписями, и работа над усовершенствованием этих механизмов продолжается.

В дополнение к самой модели, компания обновила сопутствующие инструменты, выпустив набор плагинов Qwen-MM-Plugins для работы с медиа и добавив новые функции, такие как контекстный поиск и последовательная обработка длительных файлов. Также был представлен Qwen-Live Harness с открытым исходным кодом для создания интерактивных приложений на базе API Qwen3.8-Omni-Flash-Realtime, что позволяет использовать протоколы WebSocket и WebRTC.

Модель Qwen3.8-Omni-Flash может создавать клипы на основе музыкальных композиций, готовить переводы сериалов и составлять PDF-конспекты обучающих видео, сохраняя индивидуальные особенности оригинальных голосов. Доступ к Qwen3.8-Omni-Flash осуществляется через корпоративную платформу Alibaba Qianwen AI.

По материалам: 3dnews.ru