Сегодня 07 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

В DeepSeek придумали новый способ экономить ресурсы при обучении ИИ

Китайская DeepSeek проводила 2025 год публикацией материала, в котором предлагается переосмыслить фундаментальную архитектуру, используемую при обучении базовых моделей искусственного интеллекта. Одним из авторов работы выступил глава компании Лян Вэньфэн (Liang Wenfeng).

 Источник изображения: Solen Feyissa / unsplash.com

Источник изображения: Solen Feyissa / unsplash.com

DeepSeek предложила метод под названием «гиперсвязи с ограничением на многообразие» (Manifold-Constrained Hyper-Connections — mHC). Этот метод помогает повысить экономическую эффективность моделей и даёт им возможность не отставать от конкурирующих американских решений, разработчики которых располагают доступом к значительным вычислительным ресурсам. Опубликованная DeepSeek научная работа отражает сложившуюся в Китае открытую и основанную на взаимопомощи культуру разработчиков ИИ, которые публикуют значительную долю своих исследований в открытом доступе. Статьи DeepSeek также могут указывать на инженерные решения, которые компания использует в готовящихся к выпуску моделях.

Группа из 19 исследователей компании отметила, что метод mHC тестировался на моделях с 3 млрд, 9 млрд и 27 млрд параметров, и его использование не дало существенного увеличения вычислительной нагрузки по сравнению с традиционным методом гиперсвязей (Hyper-Connections — HC). Базовый метод гиперсвязей в сентябре 2024 года предложили исследователи ByteDance в качестве модификации ResNet (Residual Networks) — доминирующей архитектуры глубокого обучения, которую ещё в 2015 году представили учёные Microsoft Research Asia.

ResNet позволяет производить обучения глубоких нейросетей таким образом, чтобы ключевая информация (остаточные данные) сохранялась при увеличении числа слоёв. Эта архитектура используется при обучении моделей OpenAI GPT и Google DeepMind AlphaFold, и у неё есть важное ограничение: проходя через слои нейросети, обучающий сигнал может вырождаться в универсальное представление, одинаковое для всех слоёв, то есть рискует оказаться малоинформативным. Гиперсвязи успешно решают эту проблему, расширяя поток остаточных данных и повышая сложность нейросети «без изменения вычислительной нагрузки у отдельных блоков», но при этом, указывают в DeepSeek, растёт нагрузка на память, и это мешает масштабировать данную архитектуру при обучении больших моделей.

Чтобы решить и эту проблему, DeepSeek предлагает метод mHC, который «поможет устранить существующие ограничения и в перспективе откроет новые пути эволюции фундаментальных архитектур нового поколения». Публикуемые компанией научные работы часто указывают на техническое направление, лежащее в основе последующих моделей, говорят эксперты. Новую крупную модель DeepSeek, как ожидается, может представить в середине февраля.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Базис» приобрёл 70 % разработчика ИИ-платформы наблюдаемости Proto Observability 23 мин.
Рост облачного рынка России резко замедлился — не хватает «железа» и «дешёвых» денег 2 ч.
Первая за 20 лет новая Onimusha не разочаровала Capcom продажами — миллион копий Onimusha: Way of the Sword за один день 4 ч.
Valheim 2 не будет — разработчики продолжат расширять оригинальную Valheim 4 ч.
В нашумевшем кошачьем роглайке Mewgenics появился официальный перевод на русский язык — новый бесплатный контент и первое дополнение на подходе 7 ч.
Ведьмак стал вампиром: один из первых модов для The Blood of Dawnwalker подарил главному герою лицо Геральта 8 ч.
Apple решила увеличить прибыльность App Store, но пока неизвестно, каким образом 11 ч.
Microsoft изменила структуру отчётности и теперь будет сообщать данные об облаке Azure, на которое приходится уже треть выручки 23 ч.
Авторы Cloudpunk раскрыли точную дату выхода атмосферного киберпанк-симулятора жизни Nivalis Night 06-09 15:47
OpenAI подтвердила причастность своих ИИ-агентов к захвату немецкого сайта 06-09 13:04
Репортаж со стенда Acer на IFA 2026: гибрид консоли и ноутбука DualPlay Mini, сверхлёгкий Swift, мини-ПК на Nvidia и другие новинки 29 мин.
Перед анонсом складного iPhone Huawei представила трёхстворчатый Mate XT 2 с чипом Kirin 9050 Pro и 10,2" экраном 30 мин.
NVIDIA инвестировала в разработчика оптических коммутаторов iPronics 59 мин.
Huawei представила широкоформатный, но не складной смартфон Pura X View 2 ч.
США обвинили Huawei в 20 годах кражи технологий конкурентов — лучших «промышленных шпионов» премировали 2 ч.
Huawei представила процессор Kirin 9050 Pro — его GPU до 142 % быстрее предшественника и поддерживает трассировку лучей 3 ч.
В MikroTik RouterOS нашли шесть серьёзных уязвимостей — пора срочно обновить роутеры 3 ч.
Figure AI потратит $3,5 млрд на аренду у Nscale ИИ-мощностей для тренировки своих человекоподобных роботов, хотя сама привлекла в полтора раза меньше денег 3 ч.
24 576 волокон в 1U-шасси: Mixx представила сверхплотный оптический коннектор SxC для ИИ-инфраструктур 3 ч.
Вышел Radxa Linkr — IP KVM в виде флеш-брелока с поддержкой Wi-Fi 3 ч.