GPU / TPU
Универсальная программируемая платформа. Модель и веса заменяются свободно; память отделена от вычислителя.
Одна и та же цель — сократить движение данных — породила принципиально разные ответы: программируемый dataflow, FPGA‑графы, аналоговые crossbar, mask ROM и фиксированную архитектуру с обновляемыми весами.
Главный диагностический вопрос: что именно нельзя изменить после изготовления — набор операций, маршрут данных, граф сети, веса или всё сразу?
Универсальная программируемая платформа. Модель и веса заменяются свободно; память отделена от вычислителя.
Компилятор заранее строит движение данных или помещает огромный объём SRAM рядом с ядрами. Веса всё ещё загружаются.
Слои и квантованные операции становятся LUT, DSP и проводниками. Конфигурацию можно перепрошить.
Проводимость, заряд или сопротивление ячейки представляет вес; закон Кирхгофа выполняет часть MAC.
Параметры становятся геометрией поздних металлических слоёв. Новый checkpoint требует нового варианта кремния.
Физические пути специализируются под стабильную архитектуру модели, но сами веса остаются обновляемыми.
| Класс | Что фиксируется | Что меняется | Главная сила | Главная цена |
|---|---|---|---|---|
| GPU / TPU | ISA, матричные блоки, иерархия памяти | Любая совместимая модель и веса | Максимальная универсальность | Memory wall и управляющая работа |
| Dataflow / SRAM | Архитектура потоков, локальная память | Модель через компилятор | Предсказуемость и короткий путь | Сложный compile / scale-out |
| FPGA | Текущая конфигурация логики | Весь bitstream | Аппаратная специализация без нового tape-out | Ниже плотность и частота ASIC |
| Analog CIM | Аналоговое состояние ячеек | Веса в пределах endurance/precision | MAC внутри массива памяти | ADC/DAC, шум, калибровка |
| Mask ROM | Базовые веса и специализированный dataflow | Контекст, KV-cache, LoRA | Экстремальная плотность и tokens/W | Новый silicon variant для базы |
| Frozen graph | Архитектура семейства моделей | Совместимые новые веса | Компромисс efficiency / longevity | Зависимость от стабильности графа |
Groq планирует маршруты статически; Cerebras приближает 44 GB SRAM к вычислениям на wafer‑scale; SambaNova строит реконфигурируемый dataflow; IBM NorthPole распределяет память рядом с ядрами. Это важные предшественники, но конкретный checkpoint не становится неизменной геометрией.[34][36][38][40]
В квантованных и бинарных сетях умножения упрощаются до XNOR, popcount, LUT или маленьких DSP‑структур. FPGA даёт настоящую пространственную специализацию, но сохраняет путь назад: новый bitstream заменяет старую сеть без изготовления нового кристалла.[28][30][32]
Самая буквальная «заморозка» в современном LLM‑инференсе: одна конкретная Llama 3.1 8B становится частью варианта кристалла.[02]
FPGA выигрывает, когда алгоритм ещё меняется. Analog CIM — когда точность и периферия контролируемы. Mask ROM — когда checkpoint стабилен и его инференс огромен. Frozen graph — ставка на стабильность семейства архитектур.