惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

雷峰网
雷峰网
S
Securelist
Y
Y Combinator Blog
云风的 BLOG
云风的 BLOG
A
About on SuperTechFans
Martin Fowler
Martin Fowler
量子位
D
Docker
G
Google Developers Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
U
Unit 42
S
Secure Thoughts
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
K
Kaspersky official blog
NISL@THU
NISL@THU
T
Tailwind CSS Blog
I
Intezer
T
Threat Research - Cisco Blogs
P
Privacy & Cybersecurity Law Blog
D
DataBreaches.Net
Engineering at Meta
Engineering at Meta
C
Cyber Attacks, Cyber Crime and Cyber Security
F
Full Disclosure
Microsoft Security Blog
Microsoft Security Blog
Cisco Talos Blog
Cisco Talos Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Simon Willison's Weblog
Simon Willison's Weblog
Vercel News
Vercel News
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
F
Fortinet All Blogs
W
WeLiveSecurity
C
Cisco Blogs
Security Latest
Security Latest
PCI Perspectives
PCI Perspectives
L
LangChain Blog
P
Palo Alto Networks Blog
IT之家
IT之家
aimingoo的专栏
aimingoo的专栏
Apple Machine Learning Research
Apple Machine Learning Research
宝玉的分享
宝玉的分享
Blog — PlanetScale
Blog — PlanetScale
Help Net Security
Help Net Security
Microsoft Azure Blog
Microsoft Azure Blog
Project Zero
Project Zero
G
GRAHAM CLULEY
Recent Commits to openclaw:main
Recent Commits to openclaw:main
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
L
Lohrmann on Cybersecurity
Cloudbric
Cloudbric
D
Darknet – Hacking Tools, Hacker News & Cyber Security

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
Prism и Premortem
Гусев Николай · 2026-05-05 · via Все публикации подряд на Хабре

Средний

7 мин

12K

как я перестать вайбкодить и полюбил находить проблемы

На фото изображен редкий экземпляр вайбкодера из первой статьи

На фото изображен редкий экземпляр вайбкодера из первой статьи

Привет, меня зовут Николай, я 23 года в DevOps, последние пару-тройку месяцев копаюсь в архитектуре AI-агента (Hermes Agent)

В предыдущих двух статьях я разбирал, почему AI-агенты сходят с ума на длинных сессиях (сжатие контекста) и почему Chain-of-Thought это пост-хок нарратив, а не трассировка мышления. Статьи неплохо зашли, но в комментариях меня справедливо пропесочили: "нейрослоп с характерными эпитетами, очередной набор запросов к ИИ". Ну и по делу в принципе.

А сегодня я расскажу про два инструмента, которые использую постоянно: Premortem и Prism. Не в теории, а на моём собственном опыте.

Prism это не моё изобретение. Это форк из Cranot/super-hermes, доработанный под мои задачи. В оригинале — пять независимых скилов структурного анализа. Premortem — вообще классика, из книги Klein «The Power of Intuition» и военной аналитики. Но я их доработал так, что это не просто "очередная методология для митапов", а работающий pipeline, который находит баги архитектуры.

1. Premortem: «Проект запущен. Через месяц — катастрофа. Почему?»

Premortem - это когда ты представляешь, что будущее уже наступило и всё пошло по п***е ( панде), а потом работаешь назад от этого будущего, выясняя причины.

Звучит как эзотерика для тренингов личностного роста? Ну да, но нет. Вот как это выглядит на практике: ты садишься, открываешь шаблон (если есть — если нет, просто текстовый файл) и пишешь сверху: "Это уже сломалось. Почему?".

Дальше — выписываешь всё, что приходит в голову. Без цензуры, без ранжирования. Каждая причина — отдельная строка. Не "что может пойти не так", а "это уже сломалось, вот доказательства".

Пример: моя 4-уровневая память агента (как я гордился что столько умного впихал, выб знали)

В Hermes Agent я сделал четыре уровня хранения данных:

  • L1: memory() — быстрые факты, инжектятся в каждый turn

  • L2: HippoRAG — граф знаний, co-occurrence индексация

  • L3: LLM Wiki — Karpathy-style markdown база

  • L4: MemPalace — архив на chromadb, 58K чанков - Лилу не может меня обмануть или сделать больно, не может же?

Четыре уровня! "Какой я молодец!" думал я. У каждого уровня своя роль. Избыточность, fault tolerance. Мне больше не грозит потеря контекста! Ни в сессии ни между ними!

Я открыл консоль и написал:

"Система в продакшене 3 месяца. Внезапно агент начал нести херню — забывает факты, путает проекты, переспрашивает одно и то же. Что пошло не так? Почему 4 уровня не спасли?"

И пошло:

Причина 1: Ни один факт не выживает без явной команды. Четыре уровня — это четыре места, куда можно сохранить. Но ни один не работает автоматически. Если я не скажу "запомни это", факт умрёт в конце сессии. Четыре уровня = четыре места забыть.

Причина 2: Каждый уровень может отказать независимо. У HippoRAG есть крон, который может сдохнуть и я не узнаю, пока не проверю вручную. У MemPalace есть chromadb, которая падает при переполнении. У Wiki ручное наполнение, которое я забываю делать. У memory() лимит на количество фактов. Ни один уровень не гарантирован.

Причина 3: HippoRAG cron сдох три дня назад, а я не заметил. HippoRAG индексирует сессии раз в час. Крон был привязан к пайплайну, который сломался, но таймер продолжал тикать. Индекс три дня не обновлялся "О как, а мы и не знали"

Причина 4: MemPalace дублирует то, что уже есть в основной базе. 96% содержимого сырые сессии, которые и так лежат в state.db с полнотекстовым поиском FTS5. 1.1 ГБ, 60 тысяч записей, куча кода ради функциональности, которая уже была из коробки.

Причина 5: Команда управления памятью не реализована. В профиле агента описана команда /kg сохранять, искать, забывать факты. На деле команды нет. Пользователь пишет /kg запиши получает "я не знаю такой команды".

Я выписал пять причин за 20 минут. Не потому что я умный (не очень борат.jpg) . А потому что Premortem заставляет работать от катастрофы, а не от текущего состояния. Разница как между «что делать, чтобы не провалить проект» и «почему мы уже провалились».

2. Prism: "Не ищи проблему - ищи, как артефакт устроен на самом деле"

Prism - это не один инструмент. В репозитории их пять: prism-full, prism-3way, prism-discover, prism-reflect, prism-scan. Каждый делает одно и то же (структурный анализ) - но через разные протоколы. Я опишу на примере prism-full, он главный.

Как работает Prism (на примере prism-full)

Prism-full состоит из трёх фаз. Ни одну нельзя пропустить.

Фаза 0 - Codebase Inventory (необязательная, но критичная)

Перед любым анализом Prism требует: открой файлы. Не документацию, не README - исходный код. Проверь, что описано в теории реально существует. Проверь, что существует - реально работает.

В моём первом анализе памяти я её пропустил - и получил анализ архитектурной мечты, а не реальной системы. Описал 4 уровня, расписал pipeline - и не открыл ни одного .py файла. Когда открыл - обнаружил, что половина хуков синхронизации (sync_turn, on_session_end) существуют как no-op заглушки. Не сломанные - а просто пустые. Код есть, вызывает ничего.

Фаза 1 - Design pipeline

Ты проектируешь 2-4 аналитических прохода, специфичных под этот артефакт. Не generic checklist, а конкретные вопросы к этой системе.

Для моей памяти я спроектировал три прохода:

Проход 1: Claim Extraction & Inversion Берём каждое утверждение о том, как система должна работать, и проверяем, правда ли оно:

  1. Пользователь говорит "запомни факт X"

  2. Агент решает, какой уровень использовать

  3. Данные сохраняются в выбранный уровень

  4. При следующем запросе данные извлекаются

  5. Контекст подаётся модели

Результат: шаг 1 - нет команды, шаг 2 - агент не знает об уровнях, шаг 3 - нет триггера, шаг 4 - из одного уровня да, шаг 5 - с потерями. Четыре из пяти - фикция.

Проход 2: Empirical Claim Audit Берём каждое число из Premortem-анализа и проверяем: 0.42% - из пальца. "900 строк" - реально 774. "96% дублей" - на глаз, не измерено. Результат: Premortem дал качественные находки, но цифры не выдерживают проверки.

Проход 3: Platform Capability Inventory Смотрим что Hermes Agent даёт из коробки. state.db с FTS5 - есть. memory() с auto-inject - есть. session_search - built-in. Результат: 52% моего "кастомного" кода дублировало встроенные возможности.

Фаза 2 - Execute + Adversarial

Выполняем проходы и добавляем обязательный финальный: атакуем собственные находки.

Что я нашёл, атакуя свой анализ:

  • Overclaim: "4 из 5 шагов - фикция". Шаг 4 и 5 - не совсем, они работают, но с ограничениями

  • Overclaim: "проблема в архитектуре". Нет, проблема в том что provider: basic возвращал None

  • Underclaim: я ни разу не посмотрел в конфиг. А там было memory.provider: basic, который не сохраняет ничего

Фаза 3 - Synthesis: Conservation Law

Conservation Law - это структурное свойство, которое не уходит, сколько ни чини. Для моей памяти оно звучит так:

Память × Автомат = Constant. Чем больше места для хранения, тем меньше автоматов, которые это хранилище наполняют. Четыре уровня - это четыре хранилища, которые надо наполнять руками. Решение не в добавлении уровней, а в том, чтобы хотя бы один наполнялся сам.

Другие скилы Prism

Кроме prism-full есть ещё четыре. Они не про "линзы" - каждый переворачивает задачу по-своему:

  • prism-3way - три ортогональных вопроса: ГДЕ (структурная археология), КОГДА (темпоральная симуляция), ПОЧЕМУ (структурная невозможность). Расхождение ответов - и есть результат

  • prism-discover - не анализирует, а перечисляет все возможные углы для анализа

  • prism-reflect - анализирует анализ: что моя линза максимизировала, чем пожертвовала

  • prism-scan - генерирует одну динамическую линзу под конкретный артефакт

Все пять лежат в гитхабе, ссылки внизу

3. Как это работает в связке

Premortem нашёл, что "ни один факт не выживает без явной команды". Это симптом.

Prism объяснил, почему это предопределено архитектурно: pipeline из пяти шагов, четыре из которых - дыры.

Вместе они дают не просто список проблем, а ответ на вопрос "что с этим делать".

4. Цифры: что дал анализ

Достоверно, без ИИ-слопа :)

  • Уровней памяти: было 4, стало 2 (основная база + быстрые факты)

  • Объём MemPalace: 1.1 GB - почистил, дубликаты удалены

  • HippoRAG: индексация работает, 6409 документов, cron починен

  • AGENTS.md: 774 строки, после чистки ~120 актуальных

  • issue в репо с моделью памяти из коробки как я это вижу

Самое смешное: до запуска Premortem я был убеждён, что у меня продуманная архитектура. После - я понял, что половина кода дублировала то, что уже есть в основной базе с FTS5. Ты не знаешь, что у тебя уже есть, пока не заставишь себя проверить.

5. Premortem для этой статьи

Применяю Premortem к себе:

Статья опубликована. Через неделю - негатив. Почему?

Где код, как этим пользоваться? Ссылка: github.com/Cranot/super-hermes - там пять скилов Prism и premortem-шаблон. Всё в открытом доступе. Запускается через skill_view или прямым импортом.

Это же из менеджмента, при чём тут инженерия? Premortem в менеджменте - "давайте подумаем о рисках". Premortem в инженерии - structured backward reasoning с протоколом. Разница как между "а давайте brainstorm" и "вот чеклист, пройди по пунктам".

Цифры выглядят притянутыми? Справедливо. Я убрал все непроверенные проценты. Оставил только то, что могу подтвердить: строки кода, документы в базе, гигабайты.

6. Что я сделал бы иначе

Главная ошибка: я начал строить четыре уровня памяти, не проверив, что может один. Вместо того чтобы написать "агент запоминает факты -> база -> profit", я сразу пошёл в HippoRAG, chromadb, Wiki. Потому что "так интереснее", потому что "четыре уровня - это надёжно".

Premortem, запущенный на стадии дизайна, сказал бы: "Ты строишь четыре уровня. Каждый - отдельная инфраструктура с отдельным отказом. Ты знаешь, что будет, если один сдохнет? Ты тестировал падение каждого?"

Я бы ответил: "Можно, а зачем?".

И это нормально. Premortem для того и нужен - чтобы задавать неудобные вопросы до того, как они станут дорогими.

Вместо выводов

После двух статей про диагностику проблем AI-агентов я понял одну вещь: симптомов много, а инструментов - единицы. А методологий как говна за баней, поэтому лучше описать то что инженегр сможет проверить сам руками.

Premortem и Prism - не панацея. Они не найдут каждую дыру. Но они дают повторяемый процесс, который регулярно находит проблемы, которые иначе я бы пропустил.


Ссылки

  1. Prism - репозиторий: github.com/Cranot/super-hermes

  2. Premortem - оригинал, Klein «The Power of Intuition»

  3. Hipporag - https://habr.com/ru/articles/860426/ https://habr.com/ru/companies/ruvds/articles/1025812/ https://github.com/osu-nlp-group/hipporag

    Первая статья: «Cursor всё сломал, но виноват не Cursor» (habr.com/ru/articles/1030946)

    Вторая статья: «Больше контекста — хуже результат» (habr.com/ru/articles/1031340)