Samsung LPDDR5X-PIM: вычисления внутри памяти ускоряют инференс в 3 раза
38

Samsung LPDDR5X-PIM: вычисления внутри памяти ускоряют инференс в 3 раза

Автор: admin

На Hot Chips 2026 Samsung показала LPDDR5X-PIM — память с встроенными MAC-деревьями в каждом банке. На Llama 3.1 8B рост скорости генерации токенов составил 3,01×, эффективная полоса внутри памяти выросла до 614 ГБ/с.

На конференции Hot Chips 2026 Samsung представила технологию LPDDR5X-PIM (Processing-in-Memory), интегрирующую логику умножения-накопления прямо в банки DRAM. Внешне чип остаётся стандартным LPDDR5X в 561-шариковом корпусе ёмкостью 16 ГБ, что делает его бесшовной заменой существующим модулям без изменения платформы.

Ключевая инновация — деревья MAC (Multiply-Accumulate) в каждом банке памяти с регистровыми файлами VRF и SRF. Чип работает в двух режимах: как обычная DRAM и как многобанковый PIM-ускоритель. Главную проблему адресации — несовпадение физической раскладки строк DRAM с потребностями матричного умножения — решает режим Address Align Mode, отображающий адреса памяти напрямую на MAC-инструкции.

В тестах на инференсе Llama 3.1 8B с батчем 1 LPDDR5X-PIM выдала 81,3 токена/с против 27,0 на обычной LPDDR5X (ускорение 3,01×), время выполнения сократилось с 12,3 до 5,4 секунды (2,28×). Эффективная внутренняя полоса памяти выросла с 76,8 до 614 ГБ/с — это не пропускная способность шины к процессору, а полоса для операций, выполняемых на месте без вывода данных наружу.

Выигрыш достигается там, где нагрузка упирается в перекачку весов: при генерации токена с батчем 1 модель обязана прочитать все веса целиком, а полезных вычислений на байт мало. Ускоритель большую часть времени ждёт данные от памяти. Перемещение байта по шине энергозатратнее, чем умножение, поэтому суммарное потребление при работе PIM, по данным Samsung, не растёт существенно.

Есть важные оговорки: точность вычислений на PIM пока отличается от базовой версии — для рекомендательных систем и голосовых ассистентов это терпимо, для финансов и медицины нет. Attention, нормализации и нелинейности по-прежнему считает хост, требуя сложной компиляции графа. PIM не решает проблему KV-кэша при больших батчах серверного инференса. Стандартизация LPDDR6X-PIM через JEDEC планируется в этом году, сроки массового производства LPDDR5X-PIM пока не раскрыты.

Похожие материалы

Как ИИ ускорил документирование дизайн-системы в 8 раз: от 2 дней к 15 минутам на компонент
дизайн-система дизайн-токены ИИ в дизайне автоматизация

Как ИИ ускорил документирование дизайн-системы в 8 раз: от 2 дней к 15 минутам на компонент

Команда автоматизировала создание компонентных токенов дизайн-системы с помощью ИИ-агента и JSON-экспорта из …

Nvidia PAIR: объединяем ПК в локальный кластер для запуска ИИ-моделей
Nvidia ИИ локальный кластер LLM

Nvidia PAIR: объединяем ПК в локальный кластер для запуска ИИ-моделей

Nvidia выпустила открытый инструмент PAIR (Personal AI Router), объединяющий несколько компьютеров в …

«Одноклассники»: создайте уникальные фото и подарки.
«Одноклассники» нейросети фото

«Одноклассники»: создайте уникальные фото и подарки.

«Одноклассники» предложили новый нейросетевой инструмент для создания уникальных фото и виртуальных подарков. …

Anthropic разрабатывает стандарт MHS для управления физическими устройствами ИИ-агентами
Anthropic MHS MCP ИИ-агенты

Anthropic разрабатывает стандарт MHS для управления физическими устройствами ИИ-агентами

Anthropic работает над открытым стандартом MHS, который позволит ИИ-агентам управлять физическими устройствами …