
Делюсь опытом эксплуатации Hermes в домашней лаборатории и выводами, к которым пришёл в процессе.
Оглавление
Позиционирование
Я сжег полмиллиарда токенов на Hermes и по сей день не понял, зачем он мне нужен.
Правда, у меня сожглись не только токены, но и материнская плата на домашней лаборатории, где крутился Hermes. Именно благодаря этому у меня появилось окно для рефлексии, которой я хотел бы поделиться с вами.
Итак. Hermes позиционирует себя как агент, который растет вместе с тобой. Это закрепляется в скиллах. За счёт них каждый раз, когда появляется повторяющаяся задача, Hermes её выполняет немножко точнее.
Это неправда. Он создает скиллы и правит их ненадежным образом. У него нет жестко запрограммированных триггеров. Пока ты ему явно не скажешь создать или поправить скилл, он в 99 из 100 сессий будет работать как обычный ИИ-агент.
Но это только полбеды. Потому что сами скиллы не гарантируют, что агент будет им следовать.
Я наивно предположил, что если я создам скилл, в котором опишу архитектуру своей домашней лаборатории, пропишу IP-адреса и скажу, что он может проверять, а что нет, то это сделает работу более безопасной. Он не будет выполнять опасных команд и ничего не сломает.
На деле это оказалось частично рабочим. Он несколько раз самоубивался тем, что ломал gateway, который ему предоставлял доступ в интернет через VPN. Он несколько раз прихлопывал мне Caddy, из-за чего ни я, ни он не могли достучаться до определенных сервисов.
Некоторые модели, такие как DeepSeek Pro или GLM, не поддерживают изображения. У Hermes есть специальная настройка, которая позволяет поставить модель для распознавания картинок. У меня она работала плохо, и я попросил её слегка переписать.
Он залез в свой исходный код и снова самоубился. После этого я решил на всей домашней директории, где работает агент, инициализировать Git. Потому что вчитываться в 150 вызовов инструментов, чтобы понять, где именно он сделал ошибку – это не самое увлекательное занятие.
Вы, наверное, уже думаете, что я буду только хаить Hermes. Я, конечно, буду. Но сначала расскажу о том, в чём он оказался небесполезен.
Хорошее применение (почти)
Я нашел чертовски крутое применение. Возможно, вы знаете, что Ozon блокирует прямой парсинг их сайтов. Что, честно говоря, выглядит как абсолютная глупость, потому что в современных реалиях люди довольно сильно полагаются на поиск товаров через ИИ-чат. То есть Ozon буквально теряет деньги из-за ограничения такого жирного канала продаж.
Но я нашел решение на Apify, которое позволяет парсить товары и их как-то анализировать, сравнивать, находить лучшие варианты. В общем, пушка-гонка.
Это всё можно подключить к Hermes и заставить его анализировать сотни товаров, находить из них те, которые удовлетворяют по техническим требованиям, по описаниям, и получать прямые ссылки на них.
Работает это более-менее хорошо, но... Но недолго. Потому что агент может один раз взять и втупую считать сразу сотню элементов из таблицы, и его контекст забьется.
То есть пока ты ему не объяснишь, как обрабатывать данные, как это делать безопасно, он может сделать глупую ошибку, и вся его эффективность пойдет насмарку. При этом парсинг Озона не является бесплатным. Там есть очень небольшой бесплатный лимит, который быстро исчерпывается, а потом нужно платить десятки долларов.
Получается, что вроде бы Hermes может выполнить работу, которая недоступна в ChatGPT, но при этом для того, чтобы он делал это хорошо, нужно долго сидеть, сжигать токены, сжигать доллары и обучать его не делать глупости. Как-то не пахнет это выгодой.
Что я сам бы не смог сделать
Ладно, на самом деле есть вещи, которые мне понравились и которые я сам бы, скорее всего, никогда бы не реализовал.
Я попросил написать агенту скрипт, который читает базу данных в Navidrom и удаляет альбомы или авторов, у которых я поставил одну звезду (⭐). Чистая экономия места. Я этих авторов слушать все равно больше не собираюсь, так зачем мне их хранить?
То же самое я сделал с подкастами в Audiobookshelf. Если я послушал подкаст, то скрипт автоматически считывает это из базы данных и удаляет на диске соответствующие файлы и папки.
Для меня большим камнем преткновения также было GPU passthrough. Сам бы я запыхался изучать гайды, перезагружать, вчитываться в логи, проверять, что я правильно прокинул GPU в виртуальную машину. Агент в этом смысле куда более внимательный, и он быстрее гуглит. Но я всё равно не торопился с этим. Агент мне всё дотошно объяснил, потом реализовал, и на удивление это работало крайне надежно.
Также я написал с помощью агента себе крошечные, но полезные сервисы, например, по транскрибации аудио с GPU-ускорением или cron-задачи, которые поддерживают всю мою кастомную настройку на всех виртуальных машинах.
В итоге. Написал скрипты – работают. Сделал GPU passthrough – работает. Запилил транскрибацию – летает. Удобно? Круто? Ну, не знаю, у меня ведь материнская плата сгорела, я теперь не могу этим воспользоваться.
Hermes плохо кодирует
Воодушевившись тем, что Hermes может кодировать, я попытался сделать пайплайн. Идея довольно простая. У меня есть RSS, и у него есть API. Мне нужно сделать так, чтобы агент просматривал мою RSS-ленту и находил материалы, которые соответствуют моим текущим интересам, а далее отправлял их в Zotero.
С этой задачей я прекрасно справляюсь вручную, но я подумал, что если это можно автоматизировать и смотреть только лишь в один Zotero, в его Inbox, то это уменьшит рутину.
5 или 6 часов я пытался это сделать с Hermes. Мы вроде бы и API-вызовы обернули в MCP-инструмент, и вроде выглядит всё рабочим. Но на деле он оказался дырявым, и в админке RSS у меня сыпалось множество ошибок.
Hermes не умеет кодировать, пользоваться инструментами и качественно отлаживать, как это делает, например, Claude Code. Hermes генерирует множество мертвых функций, не переиспользует их. Создает модули, потом забывает о них.
У Hermes есть возможность делегировать задачи Codex, Claude Code или OpenCode. Но проблема в том, что даже если эти агенты напишут что-то вменяемое в нормальной кодовой инфраструктуре, то проверять-то все равно будет Hermes. А у него нет связи с реальностью. Он не видит интерфейс, не всегда может получить логи ошибок. И опять же, это полбеды.
Zotero я также подключил через готовый MCP. Несмотря на то, что я написал скилл с конкретными действиями, агент из раза в раз их игнорировал. Он мог добавить свои теги в Zotero, поместить источники не в ту коллекцию, которая ему была явно прописана. Он мог считать источник из RSS-ленты, но не пометить его прочитанным.
Такие несостыковки меня начали раздражать. В итоге вроде бы и MCP-сервер сделал, и последовательность прописал, но из-за того, что работа с этим описана словами, а не кодом, это приводит к недетерминированному поведению.
Решил вместо MCP сделать маленькие атомарные скрипты, которые выполняют строго ограниченное количество операций с захардкоженными переменными. Это не помогло.
Возникает вопрос. Я потратил кучу времени на то, чтобы победить агента, чтобы он сделал работу качественно. Но что мне мешало пойти в n8n и сделать за 40 минут полностью детерминированный workflow без LLM-шаманства? Ответ неожиданный. Ничего, кроме хайпа, на который я повёлся.
Хайп
Маркетинговый нарратив "личный Джарвис" пошёл ещё с OpenClaw. С тех пор он только набирал обороты и, хуже того, всё больше отрывался от реальности. Вы просто посмотрите на количество звёзд у проекта. Это неадекватно много для решения, которое как бы работает, но что-то серьёзное с помощью него сделать крайне тяжело.
Сейчас я стану слегка токсичным. Так что уберите детей от экрана.
Невероятное количество людей занимается bullshit job. У огромного количества людей низкая техническая грамотность, преобладает магическое мышление, люди любят преувеличивать. Социальные сети раздувают из мухи слона.
Блогеры стараются из любого мелкого апдейта продукта сделать инфоповод и похайпить. Кликбейты, игра на страхе, на FOMO. А ведь нужно же ещё поддерживать собственные воронки на курсы по быстрому изучению ИИ, по агентам.
Интересно, что чем более предметным является материал, чем более реальную проблему человек пытается решить, тем меньше людей посмотрят и оценят этот материал. То есть платформы сами душат материалы, которые обладают прикладной пользой и глубиной, но зато раздувают и дают жизнь пустым, но громким обещаниям ("ИИ уволит всех", "OpenClaw заменит целые команды", буэ).
Да и разумейте сами, Cisco сказала, что агенты – это огромная дыра в безопасности, но разве это хоть кого-то остановило?
Кажется, что нет. Проекты плодятся, токены жгутся, люди пишут восторженные посты.
Автоматизация ради автоматизации
Давайте просто посмотрим правде в глаза и что люди в массе своей пытаются автоматизировать с помощью сложных ИИ-агентов.
Разбор почты.
Я уже много лет использую Thunderbird. У меня за всё время в нем органично накопилась сотня правил и фильтров. Когда я открываю его, то все письма раскидываются по соответствующим папкам. Часть из них помечается как important. Их мне следует прочитать в первую очередь. Таких писем меньшинство. Все остальные не требуют моего внимания ни на этой неделе, ни на следующей.
Это простейшая автоматизация, которая не требует вообще работы LLM. При этом работает эта система на сто процентов детерминированно – она не ошибается.
Так и в чем резон платить двадцать или больше долларов ради того, чтобы сделать ту работу, которая делается бесплатно, в бесплатной открытой программе?
ИИ-брифинги.
Будем честны. Мало людей хотят тонуть в информационном мусоре. Тогда почему вдруг люди посчитали, что рассеянный информационный мусор в постах, твитах, новостях хуже, чем концентрированный в одном брифинге?
Будем честны вдвойне. Когда вы получаете такие ИИ-брифинги, вы понимаете, какой у вас следующий шаг? Если нет, то зачем вы забиваете этим мусором себе голову? Так или иначе, если у вас есть проект и вы движетесь в какую-то сторону, то у вас уже есть задачи, которые вам нужно делать. Именно это и приведет вас к результату. Чтение сжатых новостей – это всё ещё чтение новостей. Это примерно так же бесполезно, как думскролинг.
Презентации.
Я попросил Hermes сгенерировать мне презентацию по конкретным моим заметкам. Получилось это откровенно плохо. Я не смог довести это до конца, потому что мне надоело вносить правки через чат.
Если вы помните, то я говорил, что Hermes плохо кодирует. На самом деле он плохо выполняет любую специфическую работу. С теми же презентациями намного эффективнее пойти в OpenDesign или в Canva. Там можно сделать себе черновик с помощью ИИ, а потом ручками быстренько докрутить. Это на порядок лучше, чем заставлять агента без нормального визуального интерфейса делать визуальные элементы.
Даже в Excalidraw можно быстрее сделать хорошую презентацию с помощью Claude Code, скилла и собственных докручиваний.
Проекты.
Не раз встречал, как автономных агентов по типу OpenClaw или Hermes отправляют кружиться вокруг определенного репозитория и вносить туда правки.
Опять же, вы готовы довериться стохастической системе, которая может сделать всё что угодно с вашим проектом, в том числе его сломать или отправить в продакшн неработающую версию? Даже в OpenClaw цикл разработки имеет довольно много этапов, его разрабатывает не сам OpenClaw, и в конечном итоге пулл-реквесты принимают люди.
Итог
Потраченные мною 500 миллионов токенов – это примерно 1000 долларов, если пользоваться моделями не через подписки.
При этом я не смог найти место, где отбил бы хотя бы 100 долларов. Складывается представление, что это определенный финансовый пузырь, где токены сжигаются, создается ощущение продуктивности, но по факту ты платишь деньги не за результат, а за то, чтобы чувствовать себя на острие современных технологий.
Поставлю ли я себе еще когда-нибудь Hermes? Не знаю. Но если у вас есть личные кейсы или весомые аргументы, то я готов их обсудить и пересмотреть свое мнение.
Новые материалы раньше всего выходят в моём Telegram-канале. Там же можно обсудить статью, задать вопрос и поделиться собственным опытом.
Комментарии (18)

ValentinAndreev
30.07.2026 17:24А почему с кодингом плохо? Вроде же там просто вызов соответствующей модели с промптом по сути? Репо подключается и индексируется. Сам hermes что-то делает с результатами?

Absamad
30.07.2026 17:24Все зависит от модели
Я пробовал там много разных, начиная от минимакс 2.7 и Кими 2.6, заканчивая всеми моделями Open ai( 5.3, 5.4, 5.5, 5.6 sol )
Минимакс был очень плох, постоянно уходил в циклы
Кими уже можно было пользоваться и решать задачи
Гпт 5.5 был прям очень мощным, хорошо держал задачу и доводил до конца
Плюс сам опыт отличался, слабые модели не используют весь потенциал гермеса
Это я вам говорю как человек, который ежедневно тратит по 2млр токенов на гпт 5.6 сол
Правда я сам ушел обратно в кодекс, т.к. он работает тупо быстрее и тратит меньше токенов на задачу

fedosis
30.07.2026 17:24А у вас агент от начала и до конца выполнял задание? Какой размер контекста требовался для выполнения задачи? У меня, сначала задача делится на подзадачи так, чтобы ожидаемый размер контекста на выполнение был процентов на 20 меньше ожидаемого размера контекстного окна модели. Так сразу стало гораздо меньше глюков.
Хотя тут даже не в том, что контекст не влезает, а что теряется внимание к середине контекста.

Ryav
30.07.2026 17:24Так а какие задачи вы решали через Hermes?
Я для себя понял, что проще запустить агента с нужными MCP и просто через него делать ту рутину, которую предлагается решать через Hermes/OpenClaw. Да, это не в чате телеграма, но будто это даже лучше.

OverFitter
30.07.2026 17:24Хорошая статья, но многие описанные проблемы не из-за гермеса, а из-за использованных с ним моделей. Так, весь блок про хорошо/плохо кодит - почти полностью упирается в использованные модели, гермес просто их использует

flowing_abyss Автор
30.07.2026 17:24Я думаю, дело здесь вообще не в модели. Когда всё происходит в кодовом агенте, процесс планирования и дизайна идёт в более явном и строгом виде. Перед реализацией можно было бы сначала проверить эндпоинт и все доступные операции, а потом дать чёткую задачу агенту (оберни это в MCP и протестируй).
Когда такой агент закончил бы, я бы посмотрел на кодовую базу, проверил, полную ли он сделал обёртку и реальные ли тесты написал. В итоге получился бы качественный MCP-сервер, который потом можно подключать куда угодно.
В моём же случае с Hermes сам процесс работы не подразумевал такой строгости и наблюдаемости. Я ему, по сути, поставил задачу на продуктовом языке, далее как-то обсудил техническую сторону, а потом он начал через миллион агентских вызовов кодировать, тестировать и клепать костыли.
При этом, несмотря на всю продвинутость, Hermes даёт мало инструментов для наблюдаемости получаемых результатов. То есть я ни дифы не могу посмотреть, ни структуру проекта. Мне так или иначе приходится залезать на сервер и смотреть через lazygit, nvim и yazi, что он там наделал. А это, мягко говоря, далеко от идеи универсального агента, в которого можно кинуть любую задачу, и он её качественно решит.
Короче говоря, всё это в совокупности приводит к ощущению, что Hermes является лишней прослойкой в кодировании. То есть опять же дело не в модели. Вдобавок он тянет в разработку весь свой harness, который добавляет накладные расходы и непредсказуемость.

Granulex
30.07.2026 17:24Настоящая причина здесь не в том, что скиллы плохо срабатывают, а в том, что описание архитектуры и запретов внутри скилла – это просьба к модели, а не ограничение. Любую просьбу, живущую в тексте, который агент сам же и читает, он волен проигнорировать в любой сессии. Защита работает только уровнем ниже: отдельная учётка без прав на gateway и Caddy, сеть, где агент физически не дотягивается до того, что даёт ему доступ. Тогда "это не трогай" превращается из вежливой надписи на двери в стену.

flowing_abyss Автор
30.07.2026 17:24Согласен.
Но мне кажется, тут тоже есть важный краевой случай. Например, если бы я ему не дал доступ к основной Proxmox-машине, то ему было бы значительно сложнее диагностировать и определять, какие действия нужно сделать, чтобы прокинуть GPU.
То есть, по факту, чем сильнее ограничения у агента, тем менее деструктивны возможные последствия. Но, с другой стороны, если ему не дать достаточно свободы, то трудные и рутинные действия снова упадут на юзера.

SestrichkinK
30.07.2026 17:24Автоматизация ценна только тогда, когда её можно предсказать. Если процесс нельзя гарантированно повторить дважды с одинаковым результатом, это баловство, а не инструмент. Если после недели настройки ты всё ещё боишься оставить иснтрумент без присмотра, значит ты автоматизировал не работу, а собственный контроль над ней.

NKulikov
30.07.2026 17:24Автоматизация ценна только тогда, когда её можно предсказать. Если процесс нельзя гарантированно повторить дважды с одинаковым результатом, это баловство, а не инструмент. Если после недели настройки ты всё ещё боишься оставить иснтрумент без присмотра, значит ты автоматизировал не работу, а собственный контроль над ней.
Так это не автоматизация, а делегирование.
Человека/сотрудника/джуна/etc можно попросить сделать что-то, но нельзя гарантировать, что он сможет повторить это дважды с одинаковым результатом. И после недель брифинга и онбоардинга такого человека, внезапно, надо контролировать результаты, особенно первое время, а потом контроль остается, но становится все более и более быстрым/поверхностным по мере роста доверия/уверенности в результате.

Druzd
30.07.2026 17:24Я только не понял причём тут кодинг и гермес? Гермес это тупо агент рабочей среды с набором скилов, памяти, правил. Хороший кодинг зависит от модели и хорошего промта, если на входе тупо написать "сделай мне классный mcp сераер" - на выходе и получите что просили. Для кодинга каждый день использую курсор + модели от антропика для плана + модель grok для кодинга - результат всегда приемлемый.

flowing_abyss Автор
30.07.2026 17:24Вы описали то самое магическое мышление, которое упоминалось в статье. Нужно взять модель посильнее, подробнее написать промпт (заклинание) и просто из этих фактов заключить, что результат будет приемлемым.
Агент лишь исполняет. Качество системы упирается в компетенции и инженерную дисциплину человека, который обязан проверить архитектуру, увидеть систематические ошибки и оценить цену решения. Если он этого не умеет, сильная модель не спасёт проект. Она лишь быстрее и убедительнее масштабирует его ошибки.

fray2000
30.07.2026 17:24Это все конечно хорошо, но когда приступаешь к работе без понимания конечной цели и какими средствами она может быть достигнута - то когда на выходе получаешь ничего результат выглядит вполне закономерным.
Я вот к примеру, не смотря на сильный хайп и интерес, даже не трогал подобные инструменты потому что не вижу ни одной задачи из моего пула которую при помощи них можно закрыть. Удаление прослушанного подкаста при помощи LLM (Цель) - вы серьезно? Это 2 клика. Вы что слушаете их тысячами в день? Использовал модели от Claude и Codex и вплоть до Ollama (средства). Это все совершенно разные модели, их нельзя просто брать и использовать универсально для широкого круга задач.
В общем сами говорите про системное мышление и инженерный подход, а по факту просто создали песочницу, в которой пытаетесь совместить между собой кубики из разных наборов в произвольном порядке и смотрите что получится, надеясь увидеть ту самую магию, а когда ее не случилось - бомбите.

flowing_abyss Автор
30.07.2026 17:24не смотря на сильный хайп и интерес, даже не трогал подобные инструменты потому что не вижу ни одной задачи которую при помощи них можно закрыть
Я тоже до последнего держался, но любопытство перевесило.
Удаление прослушанного подкаста при помощи LLM (Цель) - вы серьезно?
Прослушанный подкаст удаляется не с помощью LLM, а с помощью скрипта. LLM этот скрипт написала.
Audiobookshelfнесколько неудобен для того, чтобы удалять подкасты и авторов с сервера, а особенно если подкаст был послушан в мобильном приложении. При этом само приложение по большей части заточено на аудиокниги и на коллекционирование, а не на "послушал и удалил".Проще говоря, два клика – это с тем самым написанным скриптом.
С музыкой примерно та же ситуация. Суть в том, что я обильно загружал альбомы через arr-стэк. Вручную их потом удалять – это просто на рутинном уровне скучно. А вот послушать, пока на дорожке бегаешь, понять, что тебе не нравится, и поставить одну звезду – это быстро и легко.
В общем, ваше предположение о двух кликах скорее выдаёт отсутствие опыта эксплуатации коллекции музыки или подкастов в домашней лаборатории.
Использовал модели от Claude и Codex и вплоть до Ollama (средства). Это все совершенно разные модели, их нельзя просто брать и использовать универсально для широкого круга задач.
Тут всё-таки хотелось бы услышать критерии, по которым одна из использованных моделей была непригодна для конкретной описанной задачи, и какую модель следовало выбрать вместо неё.
Без этого фраза "совершенно разные модели" остаётся голословной.
В общем сами говорите про системное мышление и инженерный подход, а по факту просто создали песочницу, в которой пытаетесь совместить между собой кубики из разных наборов в произвольном порядке и смотрите что получится, надеясь увидеть ту самую магию.
Это тоже голословное утверждение.
В моём случае, RSS отвечает за первичный захват материалов. Zotero отвечает за их дальнейшую систематическую обработку и хранение. Соединение этих систем является прямой автоматизацией существующего информационного пайплайна, а не произвольной игрой в кубики.
___
Короче говоря, вы не показали ни ошибочность целей, ни неправильный выбор моделей, ни бессмысленность интеграций. Вы подменили описанные мной сценарии своими, не разобрали внятно ни один из них и выдали собственное непонимание за более осмысленный вывод.
Barnaby
А где дипсик по подписке доступен?
flowing_abyss Автор
Он доступен в OpenCode Go и в Ollama Cloud
Barnaby
Это все замечательно, а вы сами то что покупали? :)
Вот вы на OpenCode Go сослались - по их же расчетам для типичного использования ваши 500кк на deepseek v4 pro обойдется в $5.29 без всяких подписок. И Go не x10, просто дают $60 лимита (с ограничениями) за $10.
500 миллионов токенов звучит мощно, но почти все они улетят в кэш :)
flowing_abyss Автор
Я использовал роутинг через Manifest (даже попытался законтрибьютить в него, но увы). Благодаря ему я и увидел, сколько токенов было израсходовано суммарно.
Модели и способы оплаты использовались разные.
Сначала я расходовал лимиты подписок, которые в основном использовал для кодинга (Claude Code и Codex). Позже добавил более дешёвые варианты через OpenCode и Ollama. Когда и их не хватало, последним fallback-уровнем был OpenRouter.
Сейчас у меня домашняя лаборатория не работает, поэтому актуальную конфигурацию я показать не смогу, но ниже прикладываю скрин того, как роутинг был настроен, когда я пытался сэкономить.
В частности, я выяснил, что на такой конфигурации из одной подписки OpenCode можно выжать 60 миллионов токенов. Но там в основном довольно слабые модели. С ними можно делать совсем простые повседневные вещи, но что-то серьёзное уже вряд ли.
И ещё по вашему расчёту. Если считать по средней цене модели с нормальным балансом цены и качества (например,
GPT-5.6 Terra), что примерно соответствует моему смешанному использованию разных моделей, то итоговая оценка будет заметно ближе к сумме, указанной в статье.