Я хотел разработать собственный AI‑процессор, нашёл openTPU, взял FPGA за ~$50 с 4 ГБ оперативной памяти, подключил её к обычному мини‑ПК и запустил на ней большую языковую модель — и улетел в космос (в позитивном и дофаминовом смыслах).

Без NVIDIA. Без видеокарты. На открытой архитектуре, которая разработана при активном участии ИИ‑агентов.

openTPU — открытый AI‑ускоритель Felipe Sens Bonetto.

Мне стало интересно: а можно ли действительно взять такой проект с GitHub, загрузить его в физическую FPGA и запустить настоящий LLM‑инференс?

По замерам автора проекта на такой же плате:
→ Qwen3-0.6B — 31 токен в секунду
→ Qwen3.5–2B — 12 токенов в секунду
→ LFM2.5–230M — 86 токенов в секунду
→ Qwen3.5–35B — модель на 35 млрд параметров на карте с 4 ГБ памяти, 4 токена в секунду

И всё это на FPGA, которой уже далеко не первый год.

? Что я сделал:

→ Купил Xilinx Kintex-7 XC7K480T с 4 ГБ оперативной памяти на AliExpress (информация по плате: 1 и 2)
→ Подключил FPGA к MINISFORUM через PCIe
→ Собрал прошивку (bitstream) в Vivado
→ Настроил драйверы и PCIe DMA
→ Подготовил программное окружение
→ Загрузил реальные веса нейросетей
→ Запустил инференс, включая Qwen

И всё заработало!

✅ FPGA успешно определяется системой
✅ PCIe DMA передаёт данные
✅ Подсистема памяти работает
✅ Тесты инструкций процессора проходят
✅ Языковая модель выполняет инференс на FPGA

? Почему это интереснее, чем просто запуск ещё одной нейросети?

Обычно мы воспринимаем GPU как готовую платформу: покупаем видеокарту, устанавливаем CUDA и запускаем модели.

Но что, если пойти в обратную сторону?

Не подбирать железо под нейросеть, а создавать собственное железо под конкретные вычисления нейросети.

Именно для этого разрабатывают специализированные AI‑ускорители, в том числе TPU — процессоры, оптимизированные под операции машинного обучения.

Конечно, текущая плата пока не конкурент NVIDIA H100. И работающий прототип — это ещё далеко не серийный ASIC.

Но теперь можно не просто рассуждать о собственной архитектуре AI‑процессора, а экспериментировать с ней на физическом оборудовании.

? Над чем думаю дальше:

→ Более быстрая память и более мощная FPGA
→ Оценка архитектуры для собственного inference‑чипа

Мы уже используем ИИ, чтобы писать программы. Теперь ИИ проектирует процессоры, на которых сам будет работать. Раньше свой AI‑ускоритель был задачей Google и NVIDIA — сегодня прототип может собрать и испытать один инженер.

Во второй части покажу все результаты со своего стенда.

Отдельное спасибо Felipe Sens Bonetto за openTPU.

? Оригинальный проект

Комментарии (32)


  1. JerryI
    09.10.2026 15:37

    Очень интересно. Хотелось бы деталей.
    Это прям было б как на старом добром хабре


    1. T-PheniX Автор
      09.10.2026 15:37

      Спасибо! Во второй части планирую детально разобрать всё.


      1. Retteoaaaa
        09.10.2026 15:37


        1. T-PheniX Автор
          09.10.2026 15:37

          Сейчас пожалуюсь своей Qwen3-0.6B, посмотрим, что она скажет про Боромира. Теперь она ещё и моим психологом по совместительству будет :)

           Она старалась. 0,6 миллиарда параметров на плате за $50, что вы хотели :)
          Она старалась. 0,6 миллиарда параметров на плате за $50, что вы хотели :)



  1. KDN_9000
    09.10.2026 15:37

    Ничего себе, а какой размерности qwen и в какой квантизации используете?


    1. T-PheniX Автор
      09.10.2026 15:37

      Запускал Qwen3.5-2B (2 млрд параметров). Квантование FP4 для основных слоёв, INT8 для LM head.

      На Kintex-7 XC7K480T с 4 ГБ DDR3 при частоте 133 МГц получил 12,35 токена/с на генерации. Prefill на FPGA - 38,5 токена/с, end-to-end — 7,71 токена/с. TTFT — 2,72 с.

      Сейчас тестирую и другие модели, включая Qwen3.5-4B.


      1. TomskDiver
        09.10.2026 15:37

        А для каких задач вы собираетесь использовать данные модели с данной скоростью? Саму идею поддерживаю обеими руками ЗА, но пока что для серьезных задач не годится никак (IMHO).