惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

GbyAI
GbyAI
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
Security Archives - TechRepublic
Security Archives - TechRepublic
H
Heimdal Security Blog
T
Tenable Blog
Webroot Blog
Webroot Blog
Cisco Talos Blog
Cisco Talos Blog
NISL@THU
NISL@THU
Help Net Security
Help Net Security
W
WeLiveSecurity
量子位
Stack Overflow Blog
Stack Overflow Blog
Schneier on Security
Schneier on Security
Simon Willison's Weblog
Simon Willison's Weblog
Recorded Future
Recorded Future
Martin Fowler
Martin Fowler
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
L
Lohrmann on Cybersecurity
SecWiki News
SecWiki News
Blog — PlanetScale
Blog — PlanetScale
F
Full Disclosure
Recent Commits to openclaw:main
Recent Commits to openclaw:main
小众软件
小众软件
Cyberwarzone
Cyberwarzone
S
Security Affairs
L
LangChain Blog
Hacker News - Newest:
Hacker News - Newest: "LLM"
V
V2EX
WordPress大学
WordPress大学
爱范儿
爱范儿
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
L
LINUX DO - 热门话题
Forbes - Security
Forbes - Security
Engineering at Meta
Engineering at Meta
博客园 - 三生石上(FineUI控件)
Scott Helme
Scott Helme
H
Help Net Security
www.infosecurity-magazine.com
www.infosecurity-magazine.com
C
Cyber Attacks, Cyber Crime and Cyber Security
有赞技术团队
有赞技术团队
IT之家
IT之家
G
Google Developers Blog
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
S
Schneier on Security
Google DeepMind News
Google DeepMind News
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
月光博客
月光博客
Hacker News: Ask HN
Hacker News: Ask HN
O
OpenAI News
宝玉的分享
宝玉的分享

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
Приручаем недетерминизм агентных систем
ArtTrek · 2026-05-29 · via Все публикации подряд на Хабре

Приручаем недетерминизм агентных систем

Средний

7 мин

6.3K

Агентные системы ломаются не на сложных задачах и не на плохих моделях. Главная причина — недетерминизм LLM: температура, апдейты моделей, дрейф мира. Как отлаживать то, что не воспроизводится? Как перезапустить упавший пайплайн не с нуля? Как вообще понять поведение системы, если каждый запуск чуть-чуть другой?

Event Sourcing — паттерн, где состояние не снапшот, а иммутабельный лог событий. Недетерминизм он не убирает, но даёт инструменты для работы с ним.

Немного теории

Сразу замечу — идея не моя и совсем не новая. Event Sourcing как паттерн систематизировал Фаулер в 2005-м, связку ES + CQRS закрепил Грег Янг в докладе 2014 года. Паттерн в основном живёт в финансах и распределённых системах — далеко от LLM, но с ровно теми же тремя свойствами лога. Ближайшая родня, шагнувшая к агентам ещё раньше, — durable execution engines (Temporal, Restate): то же «храним историю событий, реплеим детерминированно», только в словаре workflow/activity вместо stream/tool_call.

Прямое применение ES к LLM-агентам — это уже 2026 год: ESAA (arXiv:2602.23193, та самая работа, под впечатлением которой писался zymi), OpenKedge (arXiv:2604.08601, формализует governance поверх event-sourced state).

Эта статья — не литературный обзор, а practitioner-essay поверх перечисленного. Если что-то из тезисов захочется копнуть глубже — ESAA и OpenKedge за формализацией, FAIR 2025 за аксиомами аудируемости, CoALA и Generative Agents за связью с памятью, Temporal и Restate за «как это решают вне агентского контекста».

Как устроена ESA

ESA — это event-driven архитектура с одним добавленным инвариантом: лог неизменяем, разрешена только запись. То есть шина событий тут не просто транспорт между сервисами, а ещё и единственное место истины — всё, что произошло в системе, лежит в нём и никогда не редактируется. Агенты на этой шине играют роль обычных подписчиков: каждый ждёт появления в логе нужных ему типов событий, забирает их в работу, а свои результаты пишет туда же.

Агенты - обычные подписчики: читают из лога, пишут в лог

Агенты - обычные подписчики: читают из лога, пишут в лог

Этот иммутабельный лог событий и есть самая ценная архитектурная идея подхода — он даёт сразу несколько преимуществ — правда, при условии что задача укладывается в события: перезапуск пайплайнов, единый источник правды, иммутабельный и аудируемый журнал. Эти три — на самом деле одно и то же свойство лога, рассмотренное с трёх сторон. И именно поэтому, когда любое из трёх перестаёт быть достижимым (перезапуск не воспроизводит реальность, source-of-truth не успевает за событиями, логи надо «удалять» по запросу) — ломается сразу всё, а не одно из трёх.

Лично для меня паттерн стал не столько готовой спецификацией, сколько удачной формулировкой базового инварианта: состояние агентной системы должно выводиться из журнала событий. Дальше в zymi начались уже более прикладные вопросы: как ветвить выполнение, как не повторять внешние эффекты, как собирать контекст в виде проекции и как сделать human-in-the-loop частью того же журнала.

Перезапуск пайплайна с любого места

ESA позволяет нам не просто перезапустить пайплайн, а запустить его с любого произвольного шага — допустим, у вас есть свой агент-исследователь, который сначала собирает информацию, а потом готовит отчёт на её основе. И если у вас есть вопросы к моменту подготовки отчёта, вы можете просто внести правки в этот шаг и перезапустить пайплайн с этого момента, не собирая данные заново.

ESA позволяет перезапускать пайплайн с любого места

ESA позволяет перезапускать пайплайн с любого места

Здесь как и у классического EDA есть свои проблемы — если в EDA была проблема с внешними событиями, например, списание со счёта нельзя провести ещё раз при перезапуске — то тут мы сталкиваемся ещё и с недетерминизмом LLM. Fork-resume даёт нам возможность хотя бы снизить его влияние на конечный результат — не нужно заново вызывать тех агентов, результаты которых нас устраивают.

Пример из zymi

В zymi это работает примерно так:

zymi resume <stream_id> --from-step writer

создаёт новый стрим и физически копирует туда событийный префикс исследователя — его LLM-вызовы, результаты поиска в сети, всё. Писатель перезапускается с актуальным промптом из agents/writer.yml, остальное замораживается.

Внешние эффекты внутри переисполняемой части закрываются отдельным флагом — если у инструмента стоит no_resume: true (например, send_email), при resume он не вызывается: в журнал пишется ToolCallCompleted { replayed: true } с честным плейсхолдером, и агент в следующем ходе видит «этот email уже был отправлен раньше, повторно не делал».

Лог как единый источник правды

Сам по себе лог это, конечно, хорошо, но важен нюанс — раскрывается он только в случае, когда мы делаем его в нашей системе единым и единственным источником правды. Все потребители, все источники должны взаимодействовать только через лог — это гарантирует нам и перезапуски, и аудируемость.

Все взаимодействия в системе строятся через лог

Все взаимодействия в системе строятся через лог

Но эта строгая дисциплина в ответ наградит нас удобством при подключении новых источников/потребителей — достаточно просто создать новый тип события, которое они будут слушать/создавать, и всё. Никаких дополнительных интерфейсов, всё работает из коробки.

Пример из zymi

В zymi есть команда, которая проверяет целостность хэш-цепочки лога:

zymi verify 

Когда я её добавлял, ожидал работы с рантаймом: где-то прокинуть хуки, не сломать пайплайн-исполнитель, не задеть подписчиков. По факту вышел файл на 76 строк, который не импортирует рантайм вообще: открывает тот же SQLite, перебирает стримы, валидирует SHA-256. Всё. Ровно по тому же пути живут zymi observe (TUI с живой графой пайплайна) и zymi runs (CLI-листинг прогонов) — каждая команда это самостоятельный потребитель поверх одного лога, и в ядро никто из них не лезет.

Выгода единого источника заметна сразу: новый потребитель — это новый файл рядом, а не новый интерфейс в рантайме.

Есть в едином источнике правды ещё один плюс — контекст это больше не мутабельный набор данных в памяти, это проекция из лога, которой мы можем крутить как хотим. Размер контекста, порог его сжатия, маскирование определённых результатов (это вообще отдельная большая тема, сильно экономящая токены — в планах расписать подробней в отдельной статье), любые манипуляции — у нас совершенно развязаны руки, т.к. исходники в целости и сохранности лежат в логе. В zymi это ContextBuilder поверх того же SQLite — поднять окно с 10 ходов до 30, замаскировать старые tool_result'ы плейсхолдерами, пересобрать контекст под другого агента — всё это операции над проекцией, исходники в логе не трогаются.

При этом проекции лога, само собой, очень сложно масштабировать на миллионы событий в секунду, а лог событий как единственная точка правды — не лучшая идея для координации тысяч параллельных агентов; здесь ESA бессильна и только добавит головной боли.

Иммутабельный и аудируемый журнал

Третья грань этого же лога — иммутабельность. Раз мы договорились, что лог — единственный источник правды и все потребители читают из него, то достаточно один раз потребовать «события только дописываются, никогда не редактируются» — и журнал перестаёт быть просто хранилищем, становится инвариантом, который можно проверить.

Связи между событиями лежат в самой записи - отдельной системы аудита не нужно

Связи между событиями лежат в самой записи - отдельной системы аудита не нужно

Следствий тут сразу несколько. Поверх неизменяемого лога естественно ложится хэш-цепочка: каждая запись содержит SHA-256(event_id + data + prev_hash), и отдельная команда пробегает стрим и говорит, не было ли подмены — журнал становится не просто иммутабельным по дисциплине, а математически верифицируемым. И самое приятное — аудит-трейл выпадает как побочный эффект из любого нового события, которое ты кладёшь на шину; ничего отдельного для этого делать не нужно.

Отдельно стоит выделить, что у каждого события понятно, откуда оно взялось и что его вызвало. Прямо в конверте лежат три поля: correlation_id (одна пользовательская заявка от начала до конца), causation_id (какое событие породило это) и source («cli», «telegram», «scheduler», «agent»). На любой факт в логе можно ответить «кто, когда, в ответ на что» — без отдельной системы аудита, просто потому что эти поля и так есть в конверте. Для агентов это убийца извечного вопроса «почему модель так решила?» — он превращается в «покажи цепочку событий, приведших к этому LlmCallStarted», и она там лежит целиком, от исходного user_message до конкретного tool_result, который попал в окно контекста.

Пример из zymi

Согласования действий «человеком в петле» сначала жили в HashMap внутри HTTP-обработчика — обычное in-memory-состояние. Перезапустил процесс — забыл, кто что одобрил полчаса назад. После перевода согласования на шину (ApprovalRequestedApprovalGranted с полем decided_by: "slack:@alice"), починилось сразу несколько вещей: согласования стали видны из TUI, переживают рестарт, и — побочным эффектом — появился постоянный аудит-трейл «кто, что и когда одобрил». Никто отдельно не строил систему аудита; она выпала из факта, что одобрения теперь живут в том же логе, что и всё остальное.

Цена у этого свойства тоже вполне ощутимая. Эволюция модели данных — лог за полгода накопил миллионы записей в старом формате, ты добавляешь новое поле, и встаёт вопрос «что делать со старыми событиями?». Право на забвение из GDPR — неизменяемый лог по определению не умеет «забыть» одну строку, а просто стереть её = сломать хэш-цепочку. На обе проблемы есть рабочие ответы:

  • Со схемой спасает связкой дефолтов для новых полей и явной пометкой пониженной точности.

  • С GDPR хитрее: формально иммутабельный журнал и право на забвение противоречат друг другу. Решений два: crypto-shredding — каждое событие с персональными данными шифруется своим ключом, и при запросе на удаление мы просто выбрасываем ключ, событие физически остается на месте, но расшифровать его уже никто не сможет; tombstone-события — специальная запись поверх, которая для всех проекций означает «забудьте про предыдущие данные по этому субъекту».

Платить за это приходится сложностью. Проекциям нужно уметь жить со старыми версиями схемы. А шифрование payload'ов — это уже целая инфраструктура управления ключами, которую тоже надо где-то хранить и не терять.

Ограничения архитектуры

Кроме разобранных выше ограничений есть и менее очевидная цена: ESA меняет жанр дебага. Привычная картина «упало → стек-трейс → строка кода» не работает — её место занимает «упало → найди correlation_id → пройди по цепочке событий → восстанови состояние на момент сбоя». Это та же по сложности работа, но в другом наборе примитивов — порядок, причинность, проекция состояния. Команде, которая приходит из мира функциональных вызовов и стек-трейсов, нужно время на смену оптики; это не дороже, чем дебажить распределённую систему, но и не дешевле — просто другое.

Эта архитектура проигрывает там, где сама природа задачи не позволяет оперировать событиями: непрерывные потоки сигналов; данные, которые нужно уметь удалять по требованию; тысячи параллельных агентов без единой точки координации; внешние сервисы с непредсказуемым поведением.

Хорошая система, основанная на событийном подходе, знает свои границы и явно делает шаг в сторону там, где они достигнуты, а не пытается «event-source'ить всё» через силу.

Заключение

Если коротко вернуться к тому, с чего начали: иммутабельный лог даёт три свойства — детерминированный перезапуск, единый источник правды, аудируемость. И ключевое здесь — это не три разных бонуса, которые можно набирать по отдельности. Это одно и то же свойство лога, повёрнутое к нам тремя гранями. Поэтому компромисс по любой из них рушит остальные две: если перезапуск не воспроизводит реальность — значит, лог не источник правды; если в логе можно подправить запись — значит, аудиту нельзя верить; если потребители ходят мимо лога — значит, fork-resume не воспроизведёт картинку, которую они видели.


Все практические кейсы в этой статье получены при разработке опенсорс-фреймворка для агентов — zymi-core. Писал о нём в своей предыдущей статье — Что если собирать агентов как dbt-проект? Проект сейчас двигается в сторону MCP сервера — бэкенд для агентов, который можно подключить к вашему любимому Claude Code / Codex / OpenClaw и прочему.

Про агентов, Event Sourcing и смежные темы пишу также в телеграме.