Samsung LPDDR5X-PIM: вычисления внутри памяти ускоряют инференс в 3 раза
12

Samsung LPDDR5X-PIM: вычисления внутри памяти ускоряют инференс в 3 раза

Автор: admin

На Hot Chips 2026 Samsung показала LPDDR5X-PIM — память с встроенными MAC-деревьями в каждом банке. На Llama 3.1 8B рост скорости генерации токенов составил 3,01×, эффективная полоса внутри памяти выросла до 614 ГБ/с.

На конференции Hot Chips 2026 Samsung представила технологию LPDDR5X-PIM (Processing-in-Memory), интегрирующую логику умножения-накопления прямо в банки DRAM. Внешне чип остаётся стандартным LPDDR5X в 561-шариковом корпусе ёмкостью 16 ГБ, что делает его бесшовной заменой существующим модулям без изменения платформы.

Ключевая инновация — деревья MAC (Multiply-Accumulate) в каждом банке памяти с регистровыми файлами VRF и SRF. Чип работает в двух режимах: как обычная DRAM и как многобанковый PIM-ускоритель. Главную проблему адресации — несовпадение физической раскладки строк DRAM с потребностями матричного умножения — решает режим Address Align Mode, отображающий адреса памяти напрямую на MAC-инструкции.

В тестах на инференсе Llama 3.1 8B с батчем 1 LPDDR5X-PIM выдала 81,3 токена/с против 27,0 на обычной LPDDR5X (ускорение 3,01×), время выполнения сократилось с 12,3 до 5,4 секунды (2,28×). Эффективная внутренняя полоса памяти выросла с 76,8 до 614 ГБ/с — это не пропускная способность шины к процессору, а полоса для операций, выполняемых на месте без вывода данных наружу.

Выигрыш достигается там, где нагрузка упирается в перекачку весов: при генерации токена с батчем 1 модель обязана прочитать все веса целиком, а полезных вычислений на байт мало. Ускоритель большую часть времени ждёт данные от памяти. Перемещение байта по шине энергозатратнее, чем умножение, поэтому суммарное потребление при работе PIM, по данным Samsung, не растёт существенно.

Есть важные оговорки: точность вычислений на PIM пока отличается от базовой версии — для рекомендательных систем и голосовых ассистентов это терпимо, для финансов и медицины нет. Attention, нормализации и нелинейности по-прежнему считает хост, требуя сложной компиляции графа. PIM не решает проблему KV-кэша при больших батчах серверного инференса. Стандартизация LPDDR6X-PIM через JEDEC планируется в этом году, сроки массового производства LPDDR5X-PIM пока не раскрыты.