Если энергопотребление ЦОДов будет и дальше расти, то для них придётся выкупать мощности АЭС, как это сделали Microsoft и Amazon. Но должен быть другой выход. Поэтому есть большая потребность в энергоэффективных CPU.

Год назад стартап Efficient Computer представил «самый энергоэффективный в мире» процессор Electron E1. Разработчики попытались заново изобрести универсальный CPU, ориентируясь именно на энергоэффективность. Правда, конкретно этот CPU предназначен для embedded-систем, но схожую архитектуру применяют и для ЦОДов.

Новый CPU в 10–100 раз эффективнее ARM на типичных embedded-задачах, таких как быстрое преобразование Фурье (по данным с сенсоров) или выполнение свёрток (вычисление карты признаков) в свёрточных нейросетях.

Сейчас E1 и компилятор проходят тестирование среди разработчиков. Участники закрытой программы тестирования могут проверить свой код C и C++ в веб-песочнице, оценить его энергоэффективность на новом CPU.

Бутылочное горлышко фон Неймана

Большинство современных компьютеров построено на архитектуре фон Неймана, которая разделяет вычисления и память. Эта схема идеальна для традиционных вычислений, но становится бутылочным горлышком в типичных операциях нейронок, таких как перемножение матриц. Термин «бутылочное горлышко фон Неймана» впервые использовали в 1977 году, но сейчас проблема стала действительно актуальной на аппаратном уровне.

Поэтому ощущается спрос на новое, специализированное железо, которое будет эффективнее, чем существующие CPU и GPU. Процессоры нового поколения не просто заточены на новый тип вычислений, но и реализуют принципиально новую архитектуру, отличную от классической фоннеймановской.

И эта архитектура позволяет кардинально уменьшить энергопотребление вычислительных систем, потому что сводит к минимуму перемещение данных между CPU и памятью.

Современные CPU хорошо подходят для дискретных вычислений. Они выполняют инструкцию, отправляют данные в память — и быстро переключаются на другую несвязанную задачу. Но в приложениях ML почти все задачи взаимосвязаны, поэтому зачастую нет другой работы, которую можно было бы выполнить, пока CPU находится в ожидании. Вот почему единственным выходом некоторые исследователи видят оптимизацию архитектуры.

Передача инструкций последовательно из памяти связана с большим количеством накладных расходов. Если несколько миллиардов раз в секунду извлекать инструкцию из памяти, выполнять декодирование, переупорядочивание, переименование регистров и т. д., это требует немало энергии. А чтобы предотвратить заторы, современным CPU необходимо предсказание ветвлений — а это ещё больше энергии.

Вместо этого E1 отображает последовательность инструкций в виде пространственного пути, по которому «движутся» данные на процессоре, от одной плитки к другой.

Плитки E1

Архитектура E1
Архитектура E1

Каждая плитка E1 похожа на упрощённое процессорное ядро — она способна выполнять набор инструкций, но без выборки, предсказания ветвлений и других накладных расходов. Плитки соединены друг с другом в специально разработанную, программируемую сеть Fabric. Таким образом, скомпилированная программа пространственно распределена по поверхности чипа.

E1 относится к классу CGRA (Coarse-Grained Reconfigurable Architecture) или пространственным потоковым процессорам (Spatial Dataflow Processors). В них память находится близко к вычислителям (Near-Memory/Distributed SRAM), а вычисления происходят в логических блоках (ALU/плитках).

Это похоже на FPGA (программируемые пользователем вентильные матрицы), только с ячейками большего размера. Похожий подход использовала компания GreenArray в разработке экзотического процессора GA144, но он не получил известности. Вообще, методы «потоковой архитектуры» (Dataflow/CGRA) теоретически описаны ещё в начале 1980-х.

Разработчики E1 — группа инженеров под руководством Брэндона Люсии, это исполнительный директор и сооснователь Efficient Computer.

Брэндон Люсия, профессор на кафедре электротехники и компьютерной инженерии университета Карнеги — Меллона
Брэндон Люсия, профессор на кафедре электротехники и компьютерной инженерии университета Карнеги — Меллона

Компилятор для E1

Некоторые хабрапользователи поиграли в веб-песочнице Compiler Playground и попробовали программировать под E1. Compiler Playground показывает, как работает фирменный компилятор effcc и как будет исполняться реальный код на E1. Программирование для этой архитектуры не требует особых навыков, обычный код оптимизируется автоматически. Как сказано в документации, здесь проприетарный слой оптимизации Modular Optimization Framework выбирает самую оптимальную стратегию параллелизации, чтобы минимизировать количество тактов. От программиста ничего не требуется, только выделить отдельные функции, которые он хочет перенести на Fabric (пометить их отдельным атрибутом).

Главное отличие effcc — то, что он раскладывает выполнение программы не только во времени, но и в пространстве, по площади микросхемы. Компилятор назначает каждой инструкции в программе плитку. Затем настраивает сеть так, чтобы данные поступали в одну плитку, обрабатывались — а результат становился входом для следующей плитки, всё в правильной последовательности для выполнения программы. Когда последовательность разветвляется (if/then/else) — соответственно меняется и пространственный узор плиток:

Массив «плиток» в архитектуре Fabric
Массив «плиток» в архитектуре Fabric

Итоговый результат при необходимости можно подправить вручную.

Компилятор принимает С и С++, а также импортирует модели LiteRT и ONNX, распараллеливает инструкции под E1 и показывает, сколько тактов займёт выполнение каждой команды; скриншоты ниже взяты из упомянутой статьи:

Инструмент оценивает энергоэффективность выполнения программы на процессорах разных архитектур. Для наглядности показывают время работы CPU от батарейки АА при выполнении конкретной программы на разных архитектурах:

Разница как минимум на порядок
Разница как минимум на порядок

Понятно, что CPU составляет только часть от энергопотребления устройства, поэтому пример условный. Но довольно любопытно взглянуть, сколько джоулей «съедает» каждая функция.

Песочница Compiler Playground доступна для одобренных разработчиков, которые подали заявку по программе Early Access Program:

Потоковая архитектура

Efficient Computer не изобрёл потоковую архитектуру. Другие компании использовали её и раньше в своих инновационных чипах. Например, TPU от Google и чипы Inferentia от Amazon разработаны на потоковой передаче данных, а именно — на систолическом массиве (systolic array).

Систолический массив представляет однородную сеть тесно связанных блоков обработки данных (DPU), называемых ячейками или узлами. Каждый узел независимо и параллельно вычисляет частичный результат как функцию данных, полученных от вышестоящих соседей, сохраняет результат внутри себя и передаёт нижестоящим узлам
Систолический массив представляет однородную сеть тесно связанных блоков обработки данных (DPU), называемых ячейками или узлами. Каждый узел независимо и параллельно вычисляет частичный результат как функцию данных, полученных от вышестоящих соседей, сохраняет результат внутри себя и передаёт нижестоящим узлам

В IBM Research тоже работают над аналогичными процессорами NorthPole, где пробуют разные стратегии, чтобы преодолеть узкое место архитектуры фон Неймана и ускорить вычисления ИИ.

NorthPole на плате PCIe
NorthPole на плате PCIe

Но у всех них есть архитектурные ограничения по количеству ветвлений. В Е1 такие ограничения отсутствуют, говорят разработчики.

Сетевая структура E1 позволяет использовать любой произвольный путь, который может запросить программа. Речь идёт о поддержке произвольных рекурсий, как цикл while. Такие циклы требуют обратной связи. Система Fabric может передавать значения по путям обратной связи таким образом, что это позволяет выполнять вычисления общего назначения. Другие потоковые архитектуры не подходят для универсальных CPU, потому что не смогли решить эту задачу, которую решили Люсия с коллегами в результате нескольких лет научно-исследовательской работы.

Основные энергетические затраты в работе ИИ приходятся на передачу данных — перемещение весов модели туда и обратно между памятью и процессором. В сравнении с ними энергия на вычисления невелика, и они довольно простые, вроде умножения матриц на векторы.

До бума LLM архитектура фон Неймана не считалась проблемой, а бутылочное горлышко компенсировали многоуровневыми кэшами. За последние десятилетия мощность CPU и объём памяти сильно выросли, а энергия на передачу данных осталась без изменений, так что сейчас это бутылочное горлышко системы. И обучение, и инференс LLM можно сильно оптимизировать, если избавиться от этого недостатка.

Сейчас вся индустрия работает над тем, чтобы улучшить локализацию данных, то есть переместить память как можно ближе к CPU, максимально совместив хранение и обработку данных.

Сравнение перемещений данных в традиционной компьютерной системе (а) и при вычислениях в памяти, что близко к потоковой архитектуре (b)
Сравнение перемещений данных в традиционной компьютерной системе (а) и при вычислениях в памяти, что близко к потоковой архитектуре (b)

Кстати, несколько дней назад стало известно о ещё одном стартапе Positron, который тоже привлекает инвестиции и обещает выпустить процессор нового поколения для ИИ-вычислений. WSJ пишет, что Positron уже привлёк $875 млн инвестиций при оценке $5 млрд. Их флагманский процессор называется Asimov, он тоже спроектирован по архитектуре «memory-first» и поддерживает до 2,3 ТБ памяти.

Electron E1 Evaluation Kit (EVK)

Возвращаясь к Efficient Computer, участникам программы тестирования высылается отладочный комплект Electron E1 Evaluation Kit, чтобы оценить реальное железо, которое уже физически выпускается на заводах, в отличие от чипов Asimov и прочих экспериментальных образцов.

Electron E1 Evaluation Kit
Electron E1 Evaluation Kit

На плате установлены разъёмы стандартного форм-фактора Arduino и все остальные необходимые слоты, чтобы собрать нормальную периферию.

По идее, сверхнизкое энергопотребление CPU намекает на его предпочтительное использование «в поле», то есть в edge-системах, когда нужны вычисления ML на внешних офлайновых системах, которые могут годами работать от батарейки: в промышленных роботах, автомобилях, носимых гаджетах, космических компьютерах.

Теоретически, спрос на энергоэффективные вычисления есть и в серверах, ЦОДах, персональных компьютерах. Так что ещё неизвестно, какие применения найдёт новая архитектура и новые процессоры.

Новая архитектура и новые процессоры

По мнению независимых экспертов, такие сверхэнергоэффективные CPU общего назначения испытывают конкуренцию на рынке со стороны микроконтроллеров. Несмотря на инновационную архитектуру, им трудно конкурировать в нише embedded-систем. Может, Efficient Computer ориентируется на дата-центры, где спрос огромный.

Конечно, и архитектура фон Неймана тоже никуда не исчезнет. Хотя для LLM она не оптимальная, но отлично подходит для других приложений, для обработки компьютерной графики или прочих ресурсоёмких процессов, а также для вычислений 32- или 64-битной точности.

Однако мы видим, что переход человечества на ИИ-вычисления породил целое поколение новых процессоров на принципиально иной архитектуре «memory-first» с пространственной потоковой обработкой данных (Spatial Dataflow). Спрос рождает предложение, то ли ещё будет.

© 2026 ООО «МТ ФИНАНС»

Комментарии (1)


  1. ThJudge
    23.09.2026 09:18

    Ну наконец-то движуха пошла на альтернативные процессорные архитектуры. А то решать многие задачи на "фон Неймане" также эффективно как переплыть океан на чугунной ванне или продолбить стену черствым батоном. Можно, конечно, но очень неэффективно (а с точки зрения затрат энергии суммарно - вообще "швах"). Как начинаешь алгоритмы разбирать где-б еще производительность выжать, особенно в высокопараллельных задач, часто упираешься в работу с памятью и в неэффективное хранение и выборку самих инструкций из памяти.