Сегодня 28 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Alibaba выпустила всеядную модель Qwen3.8-Omni-Flash с контекстом на 1 млн токенов

Alibaba пополнила арсенал моделей искусственного интеллекта мультимодальной системой Qwen3.8-Omni-Flash. В рамках единой архитектуры она обрабатывает текст, изображения, аудио и видео, а также поддерживает контекстное окно размером 1 млн токенов. Новинка, отмечает разработчик, показывает высокие результаты в различных сценариях, включая редактирование видео, подготовку музыкальных клипов, кинопроизводство, обобщение аудиовизуальной информации и ведение диалогов в реальном времени.

 Источник изображений: qwen.ai

Источник изображений: qwen.ai

Одним из главных достижений стало снижение стоимости сервиса. По сравнению с предыдущей версией Qwen3.5-Omni-Plus при доступе по API цена за час обработки аудиоданных снизилась более чем на 98 %, аудио и видео — более чем на 93 %. Средний результат в 29 бенчмарках вырос более чем на 25 % по сравнению с предыдущим поколением. В тестах, охватывающих работу аудио- и видеоагентов, написание кода и выполнение задач с долгосрочным планированием, модель набрала 71,0 балла в WildClawBench-MM — на 36,5 балла больше предшественницы. В UniClawBench результат составил 69,6 балла. В тесте LongAudioSpan на понимание длинных аудиозаписей модель получила 82,7 балла, в OmniVideoBench на анализ аудио и видео — 63,4 балла, в OmniCap-IF на следование инструкциям при описании видео — 28,2 балла, а в AliMeeting на расшифровку совещаний на китайском языке с участием нескольких человек — 89,7 балла.

По качеству совместной обработки звука и видео Qwen3.8-Omni-Flash приблизилась к Google Gemini 3.8 Flash, а при работе только со звуком даже превзошла американского конкурента. Система распознавания речи поддерживает 74 языка и диалекта, включая кантонский, уйгурский и маори, а система генерации — 29 языков. Обе системы поддерживают китайский, английский, корейский, французский, немецкий, испанский и японский языки.

Одной из основных особенностей модели стал механизм «агентного понимания» аудио и видео. Модель не анализирует многочасовую запись последовательно от начала до конца, а, исходя из сути запроса, сама решает, «куда смотреть и что слушать», постепенно сужая область поиска в несколько этапов. В OmniVideoBench этот механизм помог повысить результат с 63,4 до 67,8 балла, а число расходуемых на один запрос токенов сократилось со 145 736 до 79 117, или на 45,7 %. Современные решения, подчеркнули в Alibaba, плохо справляются с продолжительными аудио- и видеозаписями: программные средства для ИИ-агентов пока не имеют полноценной встроенной поддержки этих форматов, а соответствующие механизмы находятся лишь на начальном этапе развития.

Alibaba также провела эксперимент, в ходе которого Qwen3.8-Omni-Flash использовалась для разработки другой модели ИИ. Ей поставили задачу за 12 часов улучшить распознавание сычуаньского диалекта китайского языка более компактной моделью Qwen2.5-Omni-3B. «Старшая» модель самостоятельно отобрала тестовую выборку, замерила исходные показатели и сформировала набор обучающих данных. За четыре серии экспериментов она создала 3413 обучающих примеров, благодаря которым доля ошибок при распознавании отдельных символов снизилась с 25,79 до 15,30 %, то есть на 40,7 %. Таким образом, ИИ-агенты могут не только пользоваться другими моделями, но и самостоятельно улучшать их.

Помимо самой модели, разработчик обновил сопутствующие программные средства. Набор плагинов Qwen-MM-Plugins для работы со звуком и видео получил средства контекстного поиска по медиаданным, подключения внешних инструментов и последовательной обработки продолжительных аудио- и видеофайлов. Поддерживаются различные среды для работы ИИ-агентов, включая OpenAI Codex, Anthropic Claude Code, Alibaba Qwen Code и Google Gemini CLI.

Компания также выпустила Qwen-Live Harness с открытым исходным кодом — среду для создания интерактивных приложений на базе API Qwen3.8-Omni-Flash-Realtime. Она поддерживает протоколы WebSocket и WebRTC и обеспечивает низкую задержку. По утверждению Alibaba, это первая мультимодальная модель с функцией «звуковой локализации»: объединяя данные пространственного аудио с визуальной информацией, она умеет определять направление и расстояние до источников звука.

Qwen3.8-Omni-Flash создаёт клипы на основе музыкальных композиций, готовит переводы коротких сериалов и комментарии к полнометражным фильмам, составляет PDF-конспекты обучающих видео и осваивает новые навыки по видеодемонстрациям. При переводе модель может сохранять индивидуальные особенности оригинального голоса. Доступ к Qwen3.8-Omni-Flash открыт через корпоративную ИИ-платформу Alibaba Qianwen AI.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Google заменит ИИ-ботов Gem в приложении Gemini на «навыки», но вряд ли это поможет конкуренции с Muse 7 мин.
Культурный мегапроект соавтора Disco Elysium скоро выйдет из тени — объявлена дата анонса амбициозной ролевой игры Red Rooster 3 ч.
Minecraft получит первое за 15 лет новое измерение — продажи игры превысили 425 миллионов копий 5 ч.
ИИ-агентов научат соблюдать «границы»: Nvidia представила платформу Open Agent Safety 6 ч.
«Давненько я так сильно не ждал игру»: релизный трейлер Ace Combat 8: Wings of Theve разгорячил фанатов перед скорым взлётом 6 ч.
Китайский ИИ завоёвывает корпоративную Америку: компании США всё чаще используют открытые ИИ-модели ради экономии 9 ч.
Гендиров OpenAI и Anthropic вызвали на допрос в Сенат Австралии по делу о взломе правительственного сайта ИИ-агентом 10 ч.
Журналисты выяснили, почему Китай в отличие от Запада не боится «конца света» из-за ИИ 10 ч.
Первые обзоры Gears of War: E-Day выйдут за пять дней до официального релиза, но есть нюанс 11 ч.
«Это не пустышка»: амбициозный шутер с открытым миром StarCraft уже достиг играбельного состояния и будет «на 100 %» от Blizzard 12 ч.
Представлены смарт-часы Honor Watch 6 Pro, которые умеют звать на помощь при исчезновении пульса 2 ч.
«Культурный ренессанс»: Bose представила проводные наушники с шумоподавлением за $99 3 ч.
Хуанг уверен в дальнейшем росте Nvidia: компания расширила выкуп акций на рекордные $150 млрд 4 ч.
Мини-ПК за $7399: представлена рабочая станция Minisforum на Ryzen AI Max+ Pro 495 с 192 Гбайт памяти и SSD на 2 Тбайт 4 ч.
Honor представила Magic 9 — компактный флагман со Snapdragon 8 Elite Gen 5, парой 200-Мп камер ARRI и поддержкой телеконвертеров 6 ч.
Батарея на 11 000 мА·ч, прошлогодний Snapdragon и камера на 200 Мп: Honor представила геймерский смартфон Magic 9 Super Edition 6 ч.
В России подскочили продажи восстановленных Android-смартфонов 7 ч.
Исторический пуск: Starship впервые вышел на орбиту Земли — несмотря на барахлящие двигатели 7 ч.
Honor представила флагман Magic 9 Pro Max с двумя 200-Мп камерами и квадратной фронталкой 7 ч.
Неооблако Nscale привлекло $3,36 млрд в преддверии IPO — одним из крупнейших инвесторов стала NVIDIA 10 ч.