Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

SRAM какой-то: Nvidia представила чип Groq 3 LPU для ускорения инференса ИИ-моделей на уровне токенов

На прошедшей в этом году конференции GTC генеральный директор Nvidia Дженсен Хуанг (Jensen Huang) сообщил, что в этом году платформа Vera Rubin получит расширение. Nvidia использует для этого интеллектуальную собственность, приобретённую у Groq. В состав Rubin вошёл новый чип Nvidia Groq 3 LPU. Компания определяет его как ускоритель инференса. Его задача — выдавать токены в большом объёме и с низкой задержкой.

 Источник изображений: Nvidia

Источник изображений: Nvidia

Платформа Rubin уже включает шесть компонентов, из которых Nvidia собирает стоечные системы и затем масштабирует их до ИИ-фабрик. Это GPU Rubin, CPU Vera, коммутаторы внутрисистемного масштабирования NVLink 6, интеллектуальный сетевой адаптер ConnectX-9, процессор обработки данных BlueField-4 и коммутатор межсистемного масштабирования Spectrum-X с совместно интегрированной оптикой. Groq 3 LPU стал новым элементом этой платформы и ещё одним строительным блоком Rubin при масштабном развёртывании.

Groq 3 LPU отличается от большинства ИИ-ускорителей схемой памяти. Обычно такие системы используют HBM в качестве рабочего уровня памяти. Каждый Groq 3 LPU содержит 500 Мбайт SRAM. Для сравнения, каждый GPU Rubin оснащён 288 Гбайт HBM4. По ёмкости разница велика. По пропускной способности соотношение иное: SRAM обеспечивает до 150 Тбайт/с, а HBM4 — около 22 Тбайт/с. Для ИИ-задач, чувствительных к пропускной способности, рост этого показателя даёт преимущество при инференсе. Именно поэтому Nvidia вводит Groq 3 в состав Rubin.

Стойка Groq 3 LPX включает 256 чипов Groq 3 LPU. Такая система располагает 128 Гбайт SRAM. Её суммарная пропускная способность достигает 40 Пбайт/с. Для объединения чипов внутри стойки предусмотрен выделенный интерфейс внутрисистемного масштабирования. Его пропускная способность составляет 640 Тбайт/с на стойку.

Вице-президент Nvidia по гипермасштабируемым решениям Иэн Бак (Ian Buck) назвал Groq LPX сопроцессором для Rubin. По его словам, он повысит производительность декодирования «на каждом слое ИИ-модели на каждом токене». Nvidia связывает это решение со следующим рубежом ИИ — мультиагентными системами. Речь идёт о сценариях, где нужно обеспечивать интерактивную работу при инференсе моделей с триллионами параметров и окнами контекста в миллионы токенов.

Когда ИИ-агенты всё чаще обмениваются данными друг с другом, а не с человеком в окне чат-бота, меняется и порог приемлемого отклика. Скорость, достаточная для человека, оказывается слишком низкой для ИИ-агента. Бак описывает переход от мира, где разумным считался уровень 100 токенов в секунду, к уровню 1 500 токенов в секунду и выше для межагентного обмена.

Добавление Groq 3 LPU должно усилить позиции Rubin в сегменте низколатентного инференса. В тексте в качестве конкурента названа Cerebras. Компания использует процессоры Wafer-Scale Engine (WSE), выполненные на целой кремниевой пластине, где большие объёмы SRAM объединены с вычислениями для низколатентного инференса на продвинутых моделях. OpenAI также привлекала мощности Cerebras для обслуживания части передовых моделей из-за выгодных характеристик задержки этой платформы.

Иэн Бак также допустил, что появление Groq 3 LPU может сократить роль ускорителя инференса Rubin CPX. Он сказал, что сейчас Nvidia сосредоточена на интеграции стойки Groq 3 LPX с Rubin. Дополнительных подробностей он не привёл. При этом оба чипа рассчитаны на сходное усиление инференса, но Groq LPU не требует большого объёма памяти GDDR7, который нужен каждому модулю Rubin CPX.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Google начала навязывать ИИ-режим в поиске — некоторые развёрнутые ответы от ИИ теперь показываются автоматически 3 ч.
Календарь релизов — 31 августа – 6 сентября: The Blood of Dawnwalker, Onimusha и Serious Sam 4 ч.
Балканизация виртуализации: VMware теряет клиентов из-за стратегии Broadcom, но та не собирается ничего менять 4 ч.
Недавнее обновление для Windows 11 сломало курсор и обои рабочего стола 4 ч.
В ранний доступ Steam ворвалась Breathedge 2 — приключенческая комедийная игра о выживании в космосе 5 ч.
DLSS 5 заработала на видеокартах GeForce RTX 2000 и RTX 3000, но очень медленно 9 ч.
Take-Two отчиталась о «бурном развитии» расследования по поиску виновника утечек GTA VI 9 ч.
ЕС поставил ChatGPT в один ряд с крупнейшими онлайн-платформами — ответственность OpenAI возрастёт 9 ч.
ИИ-направление принесло Cloud.ru более половины выручки в I полугодии 2026 года 10 ч.
Instagram объявила войну ИИ-аккаунтам, выдающим себя за реальных людей 10 ч.
Новая статья: 10 флагманских процессоров Intel за 10 лет 3 ч.
AOC выпустила 27-дюймовый игровой монитор Agon AGP277KXM с подсветкой Mini-LED и двумя режимами: 5K@180 Гц и 1440p@360 Гц 3 ч.
Apple потеряла ключевого руководителя накануне смены гендира: Фил Шиллер оставил пост главы App Store 4 ч.
Тим Кук эмоционально обратился к сотрудникам Apple в свой последний день на посту генерального директора 7 ч.
Meta внедряет роботов в ЦОД для замены людей, но пока процесс идёт очень медленно 8 ч.
CXMT запустила пробное производство памяти HBM3E 8 ч.
Никому ни слова: операторы ЦОД в США всё чаще заключают тайные соглашения в властями, прикрываясь NDA 10 ч.
Российским операторам разрешили строить 5G на частотах LTE — сети скоро появятся в городах-миллионниках 11 ч.
TSMC намерена в 50 раз повысить производительность ИИ-систем — помогут 3D-чипы и кремниевая фотоника 11 ч.
G.Skill представила комплект Flare X5X DDR5-6000 с технологией разгона AMD EXPO ULL для систем на Ryzen 13 ч.