Команды / доказанный результат

Кто превратил
идею в кремний?

Карта не ранжирует пресс‑релизы. Она показывает уровень доказательства: paper, работающий чип, публичное демо, доступный сервис или массовое производство.

01 / Шкала зрелостиЧто значит «успех»

Пять разных побед

PaperИдея и измерения опубликованы.
Test siliconАрхитектура работает физически.
Public demoРезультат можно наблюдать извне.
Product / APIЕсть доступность и поддержка.
VolumeПроверены yield, TCO и эксплуатация.
02 / Model-specificСамая жёсткая фиксация

От checkpoint к маске

TaalasHC1 / HC2 roadmap · Canada → AMD

Mask ROM хранит конкретные веса Llama 3.1 8B; SRAM обслуживает KV-cache и адаптеры.

Рабочий technology demonstrator, beta/API, заявленные 17k tokens/s/user. AMD объявила definitive agreement о приобретении.[02][08]

silicon + demo
Google DeepMindFrozen / Frozen v2

Reported проект: фиксировать архитектурные пути Gemini, оставляя веса обновляемыми.

Нет официальной спецификации или публичного чипа. 6–10× tokens/W и 2028 — внутренние цели по источникам СМИ.[09][10]

reported
Etchedfrontier inference ASIC / rack

A0 silicon на TSMC N4P, HBM/SRAM hybrid и cluster-scale memory; специализация глубже универсального GPU, но не один immutable checkpoint.

18 августа 2026 компания сообщила о первой rack‑поставке Jane Street после тестирования железа и о $700M раунде при оценке $21B. Производительность пока раскрыта как vendor/customer statement, без публичного стандартизованного benchmark.[57][58]

first rack
03 / DataflowМодель остаётся программой

Сократить путь без вечной фиксации

CerebrasWSE-3 / CS-3

Wafer-scale кристалл: 4 трлн транзисторов, 900k ядер, 44 GB SRAM и 21 PB/s заявленной bandwidth.

Реальные коммерческие системы и cloud/software stack; это спецификация архитектуры, а не скорость одной выровненной модели против GPU.[36][37]

product
GroqTSP / LPU

Детерминированная архитектура с compile-time планированием операций, маршрутов и SRAM.

Рабочая коммерческая inference‑платформа. Ключевой доказанный вклад — compiler-scheduled predictable batch‑1 latency; веса остаются программными.[34][35]

product + cloud
SambaNovaRDU / reconfigurable dataflow

Программируемый dataflow отображает графы на 520 MiB SRAM, HBM и DDR hierarchy.

Коммерческая RDU‑линия; опубликованные 2–13× относятся к конкретным CoE workload самой SambaNova, а не ко всем LLM.[38][39]

product
IBM ResearchNorthPole

256 near-memory cores хранят квантованные параметры рядом с арифметикой.

В Science: около 25× frames/J против сравниваемых 12-нм GPU на ResNet‑50. Это peer-reviewed research silicon, не массовый SKU.[40][41]

research silicon
Microsoft ResearchProject Brainwave

FPGA‑fabric в дата‑центре исполняет DNN с low‑latency streaming dataflow.

В опубликованном тесте GRU soft-NPU достиг 39.5 effective TFLOP/s и менее 1 мс; результат узкий и исторический, но deployment реальный.[33]

deployed FPGA
04 / FPGA & compilersСеть как bitstream

Заморозить — и разморозить прошивкой

AMD / Xilinx ResearchFINN + FINN-R

Компилятор строит streaming dataflow accelerator для quantized neural networks.

В paper бинарная SFC-max достигла 12.3M classifications/s и 0.31 µs при <22 W — результат именно этой маленькой сети.[28][29]

open source
hls4ml collaborationCERN / universities / community

Переводит обученные сети в HLS‑описание с упором на микросекундную latency.

В SVHN‑CNN опубликовано 5 µs при <10% ресурсов крупного FPGA; это компактный trigger‑класс, не LLM.[30][31]

open source
fpgaConvNetImperial College London

Design-space exploration и генерация специализированных CNN accelerators.

Доказанный вклад — автоматическое network-specific streaming mapping, а не один универсальный TOPS benchmark.[32]

research
05 / Analog & in-memory

Веса, записанные состоянием вещества

Самая физическая ветвь: IBM HERMES, Mythic, d‑Matrix и EnCharge используют разные memory/charge‑domain подходы. Успех измеряется не только TOPS/W, но и тем, сколько цифровой периферии нужно, чтобы удержать точность.

IBM ResearchHERMES / Analog AI

Phase-change memory crossbars хранят веса проводимостью и выполняют analog matrix-vector multiply.

64-core chip: 16.1 TOPS / 2.48 TOPS/W в high-precision или 63.1 / 9.76 в low-precision — наглядный размен качества и эффективности.[42][43]

research silicon
MythicM1 Analog Processing Unit

Flash-based analog compute-in-memory для edge inference: до 80M on-chip weights.

Компания предлагает M1/evaluation path и заявляет 25 TOPS при 3–4 W; это текущий vendor status, а не независимый 100× benchmark.[45][46][47]

product / eval
d-MatrixCorsair digital in-memory compute

Цифровой SRAM-based DIMC избегает analog drift/ADC, оставаясь programmable.

9 июня 2026 компания объявила N6 Corsair в full production и volume shipments select customers; уровень подтверждения — official announcement.[48][49]

full production*
EnCharge AIcharge-domain CIM

Precision metal capacitors выполняют матричные операции в charge domain.

Пять поколений measured silicon и EN100 roadmap заявлены компанией; масштаб публичных deployments пока не сопоставим с зрелыми datacenter products.[50]

early silicon
TetraMemRRAM analog CIM / MLX200

Multi-level resistive memory хранит conductance‑weights и вычисляет внутри массива.

Peer-reviewed full-chip lineage плюс объявленная в 2026 silicon validation MLX200; product claims ещё требуют независимых deployments.[51][52]

validated silicon
Рыночный сигнал

Крупные сделки подтверждают интерес к efficiency — но не подтверждают каждое рекламное число.

Приобретение, лицензирование или инвестиция означают, что технология стратегически ценна. Только эксплуатационные данные доказывают yield, TCO, качество и масштаб.