Атлас реализаций / 6 классов

Сколько свободы
оставить кремнию?

Одна и та же цель — сократить движение данных — породила принципиально разные ответы: программируемый dataflow, FPGA‑графы, аналоговые crossbar, mask ROM и фиксированную архитектуру с обновляемыми весами.

01 / ТаксономияОт гибкости к плотности

Не все AI‑чипы «заморожены» одинаково

Главный диагностический вопрос: что именно нельзя изменить после изготовления — набор операций, маршрут данных, граф сети, веса или всё сразу?

FIXED: матричные примитивы

GPU / TPU

Универсальная программируемая платформа. Модель и веса заменяются свободно; память отделена от вычислителя.

FIXED: планирование / dataflow

Deterministic & wafer-scale

Компилятор заранее строит движение данных или помещает огромный объём SRAM рядом с ядрами. Веса всё ещё загружаются.

FIXED UNTIL RECONFIGURE: схема

FPGA‑генерация

Слои и квантованные операции становятся LUT, DSP и проводниками. Конфигурацию можно перепрошить.

FIXED/PROGRAMMED: физическое состояние

Analog compute‑in‑memory

Проводимость, заряд или сопротивление ячейки представляет вес; закон Кирхгофа выполняет часть MAC.

FIXED: конкретные веса + dataflow

Mask‑ROM model silicon

Параметры становятся геометрией поздних металлических слоёв. Новый checkpoint требует нового варианта кремния.

FIXED: семейство графов

Frozen architecture

Физические пути специализируются под стабильную архитектуру модели, но сами веса остаются обновляемыми.

КлассЧто фиксируетсяЧто меняетсяГлавная силаГлавная цена
GPU / TPUISA, матричные блоки, иерархия памятиЛюбая совместимая модель и весаМаксимальная универсальностьMemory wall и управляющая работа
Dataflow / SRAMАрхитектура потоков, локальная памятьМодель через компиляторПредсказуемость и короткий путьСложный compile / scale-out
FPGAТекущая конфигурация логикиВесь bitstreamАппаратная специализация без нового tape-outНиже плотность и частота ASIC
Analog CIMАналоговое состояние ячеекВеса в пределах endurance/precisionMAC внутри массива памятиADC/DAC, шум, калибровка
Mask ROMБазовые веса и специализированный dataflowКонтекст, KV-cache, LoRAЭкстремальная плотность и tokens/WНовый silicon variant для базы
Frozen graphАрхитектура семейства моделейСовместимые новые весаКомпромисс efficiency / longevityЗависимость от стабильности графа
02 / ПрограммируемоСоседняя ветвь

Убрать хаос, но оставить модель заменяемой

Groq / Cerebras / SambaNova / NorthPole

Dataflow вместо hardcode весов

Groq планирует маршруты статически; Cerebras приближает 44 GB SRAM к вычислениям на wafer‑scale; SambaNova строит реконфигурируемый dataflow; IBM NorthPole распределяет память рядом с ядрами. Это важные предшественники, но конкретный checkpoint не становится неизменной геометрией.[34][36][38][40]

03 / РеконфигурируемоFPGA

Сеть как схема — до следующей прошивки

FINN / hls4ml / fpgaConvNet

Компилятор печатает вычислительный граф

В квантованных и бинарных сетях умножения упрощаются до XNOR, popcount, LUT или маленьких DSP‑структур. FPGA даёт настоящую пространственную специализацию, но сохраняет путь назад: новый bitstream заменяет старую сеть без изготовления нового кристалла.[28][30][32]

04 / Analog CIM

Когда вес — это проводимость

PCM, ReRAM, flash и charge‑domain массивы реально сокращают движение параметров. Их проблема не в идее, а на границе аналогового и цифрового миров: точность записи, drift, ADC/DAC и перенос алгоритмов.[42][45][50][52]

05 / МаксимумTaalas HC1

Веса в mask ROM

Самая буквальная «заморозка» в современном LLM‑инференсе: одна конкретная Llama 3.1 8B становится частью варианта кристалла.[02]

ПроцессN6TSMC 6 нм
Площадь815мм²
Модель8BLlama 3.1, mixed 3/6-bit
Decode17ktokens/s/user, vendor benchmark
Ключевой вывод

«Лучшей» архитектуры нет. Есть оптимальная глубина фиксации для конкретной продолжительности жизни модели.

FPGA выигрывает, когда алгоритм ещё меняется. Analog CIM — когда точность и периферия контролируемы. Mask ROM — когда checkpoint стабилен и его инференс огромен. Frozen graph — ставка на стабильность семейства архитектур.