27 августа 2026, 16:30
Зачем пересылать гигабайты? Как Samsung встроила вычисления прямо в банки памяти LPDDR5X-PIM


На Hot Chips 2026 Samsung представила LPDDR5X-PIM — внешне обычную LPDDR5X, внутри которой в каждом банке стоят MAC-деревья. На инференсе Llama 3.1 8B это дало х3,01 по токенам в секунду (81,3 против 27,0) и х2,28 по времени выполнения (5,4 секунды против 12,3), а эффективная полоса выросла с 76,8 ГБ/с до 614 ГБ/с.
Как это устроено
Логика встроена в каждый банк памяти: регистровые файлы VRF и SRF плюс деревья умножителей-накопителей. Процессор умеет работать в двух режимах, как обычная DRAM и как многобанковый PIM.
Главная инженерная задача в адресации. Строки DRAM физически не разложены так, как их хочет видеть матричное умножение, и переупорядочивание данных съедает весь выигрыш. Samsung решает это через Address Align Mode. Это такой режим, который отображает адреса DRAM прямо на MAC-инструкции.
А вот форм-фактор не поменялся. Стандартный 561-шариковый корпус, модули на 16 ГБ. То есть в теории это бесшовная замена, а не новый класс устройств со своей обвязкой.
8× полосы — но это не та полоса

Цифру 614 ГБ/с легко ознакомиться (или понять) неправильно. Это не пропускная способность шины до процессора, тут шина осталась прежней. Это эффективная полоса внутри памяти, доступная тем операциям, которые выполняются на месте и не требуют вывода данных наружу. Выигрыш возникает ровно там, где нагрузка упирается в перекачку весов, — то есть на memory-bound инференсе с батчем, близким к единице.
Почему выигрыш вообще возможен, видно из арифметики декодирования. При генерации каждого следующего токена с батчем, равным единице, модель обязана прочитать все свои веса полностью, а полезных вычислений на прочитанный байт приходится ничтожно мало. Скорость упирается в то, как быстро веса доедут до него по шине, — ускоритель большую часть времени просто ждет. Отсюда и разрыв в измерениях Samsung, 27,0 токена в секунду на обычной LPDDR5X против 81,3 на PIM при одном и том же вычислителе.
Пиковая мощность при работе PIM подскакивает, но суммарное потребление, в соответствии с заявлению компании, «без существенного роста» и в результате ниже, чем у обычной DRAM за счет сокращения трафика. Логика та же — перемещение байта по шине стоит дороже, чем умножение.
Зачем это Samsung именно сейчас
Контекст читается легко, HBM дорожает и остается дефицитным. Если часть нагрузки удается снять на дешевую LPDDR с логикой внутри, у вендора появляется вторая линейка продаж вместо конкуренции по одному фронту. Стандартизацию Samsung двигает уже через следующее поколение: спецификацию LPDDR6X-PIM организация рассчитывает провести через JEDEC в этом году, по срокам самой LPDDR5X-PIM ясности нет.
Стоит помнить, что это не начальный заход. HBM-PIM и Aquabolt-XL Samsung показывала еще в 2021, и до массового продукта та история не дошла. Разница в том, что тогда PIM искал задачу, а сейчас рынок сам требует — инференс на устройстве.
Оговорки
Одна из серьезных оговорок — точность вывода на PIM отличается от базовой версии. Samsung над этим еще работает. Для рекомендательных систем и голосовых ассистентов расхождение может быть терпимым, для чего-то, где считают деньги или диагноз, — нет.
Вторая: измерения сделаны на edge-ускорителе с моделью на восемь млрд параметров. Это честный скрипт для смартфона, но переносить множители на серверный инференс не стоит — там батч крупный, веса читаются один раз на много запросов, и узкое место переезжает с весов на KV-кэш. PIM в текущем виде эту часть задачи не решает.
Третья — MAC-деревья внутри памяти умеют не все. Attention, нормализации, нелинейности по-прежнему считает сервер, а значит компилятор должен уметь резать граф и раскладывать его между двумя исполнителями с разными правилами адресации. Это ровно та работа, на которой спотыкались все предыдущие поколения PIM.
Почему на это стоит просматривать и в серверном контексте
Прямого переноса в стойку нет, но направление считывается. Индустрия последние два года двигает вычисления ближе к данным на всех уровнях сразу: HBM с логикой в базовом кристалле, near-memory processing в ускорителях, вынос части операций в сеть. LPDDR5X-PIM — самая дешевая точка этого спектра, и именно поэтому у нее есть шанс на объем. LPDDR производится десятками миллионов модулей, а HBM остается дефицитным и дорогим.
Если стандартизация состоится и PIM доедет хотя бы до сегмента инференс-серверов на ARM, у части нагрузок появится альтернатива схеме «докупить еще карту, чтобы модель влезла в память». Пока это гипотеза, но гипотеза с опубликованными измерениями.

ИИ‑роутер — доступ к 300+ моделям из одной панели
Подключите OpenAI‑совместимый шлюз по единому api‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.
Запустить ИИ‑роутер →
Читают сейчас

2 часа назад
В США предъявили обвинения россиянину в заражении компьютеров более 80 тысяч фрилансеров вредоносным ПО
Коллегия присяжных в штате Калифорния предъявила обвинения 40-летнему гражданину России Серажудину Актулаеву за участие в фишинговой кампании, в результате которой компьютеры 80 тыс. фрилансеров были
3 часа назад
Лиды по осени считают: 6 мероприятий для продуктивного сентября
Осенью прогноз простой: где-то обязательно польет. С рекламным рынком сложнее. Где подорожает лид? Какой канал упрется в потолок? Сработает ли UGC? Что уже можно поручить ИИ? И какие изменения в закон

3 часа назад
Организация Postgres Professional первой среди коммерческих форков закрыла критические уязвимости PostgreSQL
Postgres Professional выпустила «нулевые» релизы корпоративных редакций СУБД Postgres Pro с исправлениями актуальных уязвимостей PostgreSQL. Компания первой и пока единственной среди коммерческих форк

4 часа назад
Дайджест GetAClass: август 2026
Поздравляем всех с началом нового учебного года! Каникулы закончились – значит, пора подвести итоги последнего летнего месяца. Читать далее

4 часа назад
НАСА выбрало компанию Blue Origin в качестве поставщика телекоммуникационной сети для Марса
Американское космическое агентство заключило с Blue Origin контракт на разработку Mars Telecommunications Network — системы обеспечения высокоскоростной связи и навигации для текущих и будущих миссий