Сегодня 03 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Alibaba значительно улучшила ИИ-модель Qwen3.8-Max за счёт дообучения

Модель искусственного интеллекта Alibaba Qwen3.8-Max сумела подняться на первое место в рейтинге Code Arena: WebDev на платформе Arena.ai, при этом разработчику не пришлось выпускать новую версию — он провёл её дополнительное обучение с подкреплением, сделав упор на программирование, долгосрочную работу агентов и представил версию Qwen3.8-Max-0902.

 Источник изображения: alibabagroup.com

Источник изображения: alibabagroup.com

Идентификатор модели Qwen3.8-Max-0902 указывает, что перехода на новую версию не произошло. Разработчик несколько обновил модель, в значительной мере сохранив исходные показатели: 2,4 трлн параметров, 95 млрд активных параметров на токен и цены в $2 за 1 млн входных и $6 за 1 млн выходных токенов.

Первый вариант Alibaba Qwen3.8-Max вышел 3 августа — модель заняла четвёртое место в рейтинге Code Arena: WebDev, набрав 1668 баллов. Она уступила Anthropic Claude Opus 5 (Max) с 1705 баллами, Moonshot Kimi K3 (Max) с 1676 баллами и Claude Opus 5 (High) с 1669 баллами. Повторное тестирование от 2 сентября изменило расстановку сил: Qwen3.8-Max-0902 набрала 1691 балл, опередив по новым результатам Claude Opus 5 (Max) на 2 балла и Kimi K3 (Max) — на 17 баллов. Модель сохранила сильные позиции во всех зачётах, заняв первые места в категориях «Данные и аналитика» и «Потребительские товары»; вторые — в категориях «Бренд и маркетинг», «Игры» и «Симуляции»; и третьи — в категориях «Инструменты для создания контента» и «Проектирование на основе эталонных данных».

Этих результатов Alibaba добилась, проведя целенаправленное постобучение в двух областях: в программировании и «совместной работе» — совместных задачах агентов с долгосрочным горизонтом. В таких задачах модель координирует многоэтапную работу субагентов ИИ при операциях с документами, интерфейсом и файлами кода. В тесте TerminalBench 3.0, измеряющем способность модели выполнять многоэтапную работу по написанию кода в реальной среде с терминалом, результат вырос с 11,3 до 29,0 баллов, то есть увеличился в 2,6 раза. В ProgramBench рост составил с 10,5 до 28,0 баллов. В тесте JobBench на автоматизацию офисной работы рост составил с 53,4 до 64,0 баллов. В зачёте WorkArena Elo на многоэтапную веб-навигацию и выполнение зада результат подскочил с 1348 до 1468 баллов.

Из тестов, проведённых самой Alibaba, следует, что Qwen3.8-Max-0902 уступает Claude Opus 5 в бенчмарках TerminalBench, DeepSWE, NL2Repo, ProgramBench, SWE-Marathon, CoWorkBench и Toolathlon. Первый вариант модели от 3 августа показывал 56,6 баллов в тесте DeepSWE на навыки долгосрочного агентного написания кода — выше были также Gemini (70 баллов) и OpenAI GPT-5.6 Sol (73 балла); для Qwen3.8-Max-0902 обновлённые данные по этому тесту не публиковались. Первая итерация Qwen3.8-Max набирала 67,7 баллов в тесте SWE-bench Pro на выполнение реальных инженерных задач с платформы GitHub при 80 пунктах у Claude Fable 5. Сейчас на платформе Hugging Face доступны открытые веса Alibaba Qwen3.8-2.4T-A95B, опубликованные 12 августа; о планах выпустить их для варианта с индексом 0902 пока не сообщалось.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Время — деньги: как ускорить загрузку сайта 35 мин.
VMware: RISC-V никому не нужен, а Arm до зрелости ещё несколько лет 3 ч.
OpenAI сообщила о разработке системы «автоматического экстренного отключения» ИИ 3 ч.
Windows 11 набрала почти 71 % среди пользователей Steam и продолжила теснить Windows 10 4 ч.
Meta выпустила модель Muse Spark 1.3 — улучшены навыки программирования и агентских задач 4 ч.
В WhatsApp выявлена уязвимость, позволяющая получить доступ к фотографиям до ввода PIN-кода 4 ч.
Журналисты показали скриншоты ранней версии ремейка Splinter Cell, включая записку от разработчиков на русском языке 13 ч.
В Steam впервые за неделю вышло более 700 игр, но востребованными оказались единицы 14 ч.
CD Projekt Red отчиталась об успехах за первую половину 2026 года — продажи Cyberpunk 2077: Phantom Liberty взяли новую высоту 16 ч.
В грозу между струйками: Google увернулась от очередной попытки принудить её к разделению 16 ч.
Вместо 500 вышек — дирижабль: SoftBank испытала базовую станцию в стратосфере 48 мин.
Acer представила ремонтопригодный ноутбук Vero 16 — в нём можно апгредить процессор 3 ч.
За пару лет Broadcom намеревается увеличить выручку от реализации ИИ-чипов в четыре раза 3 ч.
Услуги Intel по передовой упаковке чипов привлекли внимание Broadcom, MediaTek и Meta 4 ч.
Чтобы высадить людей на Луне не позднее 2028 года, NASA решило упростить скафандр для этой миссии 7 ч.
Новая статья: Один GPU хорошо, а два лучше: обзор внешней видеокарты AORUS RTX 5060 Ti AI BOX 12 ч.
Sugon готовит первую мобильную рабочую станцию с 64-поточным CPU и толщиной меньше 17 мм 17 ч.
Смартфоны получат аналог Nvidia DLSS: её принесёт следующий флагманский чип Qualcomm Snapdragon 17 ч.
Huawei представила смартфоны Nova 16s и 16s Pro, планшет MatePad Pro и наушники FreeBuds Neo 17 ч.
Packard Bell возродился к столетию — Acer вернула легендарный бренд с компактным ноутбуком DotBook и не только 17 ч.