Сегодня 02 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Microsoft выпустила пару открытых эффективных ИИ-моделей Phi-4 — одну дообучили по новой методике

Microsoft расширила линейку собственных больших языковых моделей искусственного интеллекта Phi-4 двумя новыми проектами с относительно скромными системными требованиями. Одна из них является мультимодальной, то есть работает с несколькими форматами данных.

 Источник изображений: microsoft.com

Источник изображений: microsoft.com

Модель Microsoft Phi-4-mini является исключительно текстовой, а Phi-4-multimodal — её улучшенная версия, способная обрабатывать также запросы в визуальном и звуковом форматах. Обе модели, утверждает разработчик, в значительной мере превосходят альтернативы сопоставимых размеров при выполнении определённых задач.

Microsoft Phi-4-mini имеет 3,8 млрд параметров, то есть она достаточно компактна для запуска на мобильных устройствах. В основу модели легла особая версия архитектуры «Трансформер» (Transformer). В стандартном варианте модели-трансформеры, чтобы понять значение каждого слова, анализируют текст до и после него; при разработке Phi-4-mini в Microsoft использовали версию Decoder-Only Transformer, которая предполагает анализ только предшествующего слову текста, что снижает нагрузку на вычислительные ресурсы и повышает скорость обработки данных.

Для дополнительной оптимизации использована технология Grouped Query Attention — этот механизм помогает модели определять, какие фрагменты данных наиболее релевантны при обработке текущей задачи. Phi-4-mini может генерировать текст, переводить документы и управлять внешними приложениями; модель, по словам разработчиков, преуспела в решении математических задач и написании компьютерного кода, даже когда требуются «сложные рассуждения». Точность ответов Phi-4-mini, по оценкам самой Microsoft, «значительно» превосходит результаты, которые дают несколько других моделей аналогичного размера.

Phi-4-multimodal — это расширенная версия Phi-4-mini с 5,6 млрд параметров; в качестве запросов она воспринимает не только текст, но также изображения, аудио и видео. Для дообучения модели в Microsoft использовали новый метод Mixture of LoRAs. Обычно адаптация ИИ к новой задаче требует изменения его весов — параметров конфигурации, которые определяют, как он обрабатывает данные. Чтобы облегчить эту задачу, используется метод LoRA (Low-Rank Adaptation) — для выполнения незнакомой задачи модели добавляется небольшое количество новых весов, оптимизированных для этой задачи. Метод Mixture of LoRAs адаптирует этот механизм к мультимодальной обработке данных: при разработке Phi-4-multimodal исходную Phi-4-mini дополнили весами, оптимизированными для работы с аудио и видео. В результате, рассказали в Microsoft, удалось смягчить некоторые компромиссы, связанные в прочими подходами к построению мультимодальных моделей.

В тестах, связанных с обработкой визуальных данных, Phi-4-multimodal набрала 72 балла, незначительно уступив ведущим моделям от OpenAI и Google. В одновременной обработке видео и звука она «с большим отрывом» обошла Google Gemini-2.0 Flash, а также открытую InternOmni. Phi-4-mini и Phi-4-multimodal доступны на платформе Hugging Face по лицензии MIT, которая допускает их коммерческое использование.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Настоящий Восторг!»: ретрофутуристический хоррор в стиле диско RetroSpace заслужил «очень положительные» отзывы от пользователей Steam 53 мин.
OpenAI призналась, что её сорвавшиеся с привязи ИИ-агенты атаковали больше сотни ресурсов 2 ч.
Metro 2033 и Metro: Last Light бесплатно прокачают для ПК и актуальных консолей — продажи игр серии превысили 50 миллионов копий 2 ч.
Epic Games Store устроил раздачу System Shock 2: 25th Anniversary Remaster, в том числе для российских игроков 4 ч.
После 18 лет в Microsoft компанию покинул бывший глава LinkedIn, Office и Teams 5 ч.
Суд в США признал иски издателей к Google из-за потери трафика по вине ИИ несостоятельными 8 ч.
Sony представила QSSR — ИИ-масштабирование с упрощённой нейросетью, оптимизированной под базовую PS5 8 ч.
Состоялся релиз InfoWatch Data Protector — решения для защиты данных «в покое» и контроля прав доступа 9 ч.
Новая статья: Отсекая лишнее: обзор ИИ-агрегатора контента Infatium 12 ч.
Грядёт крупнейшее IPO в истории: Anthropic намерена выйти на биржу до конца ноября 12 ч.
Boston Dynamics прокачала ловкость рук человекоподобных роботов Atlas, дав им новые четырёхпалые кисти 27 мин.
ИИ пожирает не только SSD: в следующем году Toshiba удвоит мощности по выпуску жёстких дисков 58 мин.
Apple готовит ИИ-камеру для умного дома, которая не будет записывать видео 2 ч.
Raspberry Pi 4 и Raspberry Pi 5 с 2 Гбайт памяти подорожали на 20% из-за дефицита DRAM 2 ч.
Traysar и Armada разрабатывают быстрозакапываемые ИИ ЦОД для американских военных 2 ч.
Чипы Google действительно улетели в космос: ракета Falcon 9 вывела на орбиту спутник Project Suncatcher с четырьмя TPU 3 ч.
DJI теперь выпускает в полтора раза больше камер, чем все производители беззеркалок — но продажи последних не рухнули 3 ч.
К 2031 году ИИ-индустрия должна приносить $6 трлн ежегодно, чтобы отбить затраты на инфраструктуру 3 ч.
HUAWEI WATCH D3: самый легкий способ померить давление 4 ч.
Глава Huawei: ускорители Ascend уже обошли NVIDIA по продажам в Китае 10 ч.