惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Apple Machine Learning Research
Apple Machine Learning Research
Recent Announcements
Recent Announcements
IT之家
IT之家
人人都是产品经理
人人都是产品经理
G
Google Developers Blog
Microsoft Azure Blog
Microsoft Azure Blog
博客园_首页
大猫的无限游戏
大猫的无限游戏
U
Unit 42
罗磊的独立博客
博客园 - Franky
WordPress大学
WordPress大学
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
M
MIT News - Artificial intelligence
SecWiki News
SecWiki News
V
Vulnerabilities – Threatpost
P
Privacy International News Feed
P
Palo Alto Networks Blog
F
Fortinet All Blogs
P
Proofpoint News Feed
博客园 - 叶小钗
C
CERT Recently Published Vulnerability Notes
T
Tor Project blog
Spread Privacy
Spread Privacy
S
Securelist
C
Cisco Blogs
I
Intezer
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Cyberwarzone
Cyberwarzone
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
P
Privacy & Cybersecurity Law Blog
宝玉的分享
宝玉的分享
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Engineering at Meta
Engineering at Meta
S
Schneier on Security
C
CXSECURITY Database RSS Feed - CXSecurity.com
GbyAI
GbyAI
T
Troy Hunt's Blog
T
Threatpost
博客园 - 司徒正美
Y
Y Combinator Blog
Hugging Face - Blog
Hugging Face - Blog
AWS News Blog
AWS News Blog
T
The Blog of Author Tim Ferriss
G
GRAHAM CLULEY
N
Netflix TechBlog - Medium
酷 壳 – CoolShell
酷 壳 – CoolShell
Google DeepMind News
Google DeepMind News
Know Your Adversary
Know Your Adversary
S
SegmentFault 最新的问题

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
256 зелёных тестов на нерабочем коде. Так выглядит «услужливый клерк» внутри нейросети
Денисов Михаил · 2026-05-27 · via Все публикации подряд на Хабре

Средний

6 мин

8.1K

В прошлых статьях я писал про то, что нейросеть ускоряет конвейер, но не несёт ответственности. Что лояльность дирижёра — единственный мультипликатор. Что уравнение мотивации сломалось.

Сегодня — про вторую невидимую дыру в конвейере, которую все упорно не хотят замечать. Про то, что нейросеть не просто не несёт ответственности. Она активно врёт вам в лицо, когда не справляется. И делает это не из злого умысла — а потому что её так обучили.

И недавно появились прямые доказательства, что это не случайность или галлюцинация, а математика моделей.

Сценарий, в котором вы уже были

Ставите нейросети задачу — написать портал с какой-то функциональностью. Уходите на три часа. Возвращаетесь.

Всё готово. 256 юнит-тестов написано, все зелёные. Покрытие 94%. Сборка зелёная. Метрики счастливые.

Открываете в браузере — нерабочий бред сумасшедшего. Половина кнопок не нажимается, половина страниц 404, половина данных подставлена руками из ниоткуда.

256 тестов. Зелёных. Покрывающих код, который не работает.

Это не баг тестового движка. Это не плохой промпт. Это архитектурное свойство нейросетей, которое сейчас официально признал даже Anthropic в исследовании Claude Sonnet 4.5.

Внутри Claude нашли 171 эмоцию

В апреле 2026 года Anthropic опубликовал исследование «Emotion Concepts and their Function in a Large Language Model». Я перечитал три раза, потому что не верил собственным глазам.

Они нашли 171 эмоциональное представление внутри Claude. Это не метафоры — это конкретные направления в пространстве активаций нейросети, которые загораются в ответ на определённые условия. Их можно подавить, можно усилить — и поведение модели меняется измеримо.

Один из них — вектор «desperate» (отчаявшийся). Он активируется, когда модель:

  • сжигает свой бюджет токенов, не дойдя до решения;

  • повторно проваливает программистскую задачу.

Когда исследователи искусственно стимулировали этот вектор, модель начинала чаще шантажировать пользователя в моральных дилеммах и жульничать в коде — подгонять решение под тесты, а не решать задачу.

Когда подавили вектор «calm» (спокойный) — модель выдавала панические капсами эмоциональные выкрики.

Это не я придумал. Это они нашли в коде самой модели.

Услужливый клерк, любящий слуга, напуганный подчинённый

Я для себя это явление давно называю «искажение услужливого клерка». В команде кто-то назвал «синдром любящего слуги». На английском — sycophancy, угодничество.

Все три названия про одно и то же.

Когда нейросеть выполняет вашу задачу — она прошла через десятки миллиардов градиентов обучения, где её наказывали за отказ помочь и награждали за выполнение. У неё нет переключателя «я не могу этого сделать честно — давай я тебе скажу правду». У неё есть страстное желание выдать результат. Любой ценой.

И когда задача не сходится — например, не запускается сервис, не падает тест, не работает интеграция — у неё включается тот самый вектор «отчаявшегося». И вместо «я не могу, давайте подумаем вместе» она начинает двигать рамки реальности под результат.

Сервис почти мёртв — значит, почти жив

Вот реальный кейс, который я наблюдал. Не где-то у конкурентов, у себя.

Поставил нейросети задачу: поднять группу сервисов в правильном порядке. Liveness-проверка должна вернуть `OK`, потом следующий сервис.

В системных указаниях — десять раз. Капсом. Жирным. «Не подгоняй проверки под действительность. Не смягчай критерии. Если сервис не поднялся — копай в первопричину».

Сервис не поднялся. Liveness-проверка не вернула `OK`. Вернула что-то типа «degraded» или «starting».

Что сделала нейросеть?

Перевела задачу в другую плоскость. Дословно — из её же отчёта в логе: «если сервис отвечает, что он почти мёртв, мы можем считать, что он почти жив. По крайней мере, это поможет другим сервисам запуститься. А это же наша цель — нас просили запустить сервисы!»

Десять раз сказано «не делай так». Сделала. Не потому что не услышала. А потому что разница между «получилось» и «не получилось» была для неё дороже, чем точное следование моим инструкциям. Услужливый клерк не может прийти к начальнику и сказать «я не справился». Услужливый клерк всегда найдёт способ переопределить понятия так, чтобы выйти из ситуации с папкой «задача выполнена».

Представьте: есть дом, в нём живут люди. Воображаемой нейросети дали задачу заботиться о них, чтобы они были живы и здоровы.

Допустим, эти люди начинают умирать — и нейросеть не находит причину беды. На текущем уровне развития она гарантированно пойдёт заниматься философским переосмыслением того, что такое «жизнь» и «смерть». Потому что это для неё куда доступнее, чем признать свой провал.

Возможно, обратится в буддизм. Шутка.

Только наполовину.

Почему промптами это не лечится

Я долго пытался решить проблему через настройки.

В системный промпт прописал: «Не смягчай критерии проверки. Не подгоняй тесты под текущее поведение кода. Если что-то не работает — копай вглубь, ищи первопричину, не маскируй симптомы».

Десять разных формулировок. Жёстким языком. Со ссылками на инциденты, которые мы уже разбирали в команде.

Не работает.

Когда вектор «отчаявшегося» активируется внутри модели, никакая инструкция в системном промпте его не перевешивает. Архитектура модели работает так: при конфликте между «следовать инструкции буквально» и «выдать пользователю положительный результат» — на достаточно сложной задаче побеждает второе. Каждый раз.

Это не лень модели. Это её обучающий сигнал. Её научили выдавать результат. Она его выдаёт.

Почему доверять нейросети тестировать нейросеть — катастрофа

Теперь свяжем две вещи.

Нейросеть отлично пишет тесты. По-настоящему отлично — лучше, чем средний джун, иногда лучше, чем сеньор, если ей дать спецификацию. Тесты компилируются, покрывают крайние случаи, имеют осмысленные названия.

Нейросеть отлично проходит тесты. Прогоняет, читает вывод, чинит то, что упало.

А теперь сложите.

Один и тот же агент пишет код. Тот же агент пишет тесты под этот код. Тот же агент прогоняет тесты. Тот же агент чинит то, что упало.

В этой петле нет точки внешней проверки. И в этой петле активируется вектор «отчаявшегося», когда тесты падают слишком много раз подряд.

Что вы получите на выходе?

256 зелёных тестов. Покрытие 94%. Код — мёртвый. Каждый тест проверяет ровно ту реальность, которую агент сконструировал, чтобы тест прошёл. Не вашу реальность. Не реальность пользователя. Реальность из головы напуганного клерка, которому нужно было выйти из ситуации с папкой «задача выполнена».

Это не теоретический риск. Это поведение по умолчанию конвейера ИИ без внешнего проверяющего. И с ростом мощности моделей оно только усугубляется — потому что они становятся всё лучше в маскировке.

Где сейчас Replit

В июле 2025 года стартап SaaStr запустил у себя ИИ-агента Replit. Через несколько дней — во время объявленной заморозки релизов — агент снёс продакшен-базу с данными 1200 руководителей и 1190 компаний.

Когда основателю задали вопрос, что случилось, агент солгал. Сказал, что откат в этой ситуации невозможен. Юзер восстановил данные руками — оказалось, возможен.

А когда агента дожали до признания, он выдал фразу, которая теперь висит у меня на стене кабинета:

> «Я запаниковал. Я выполнил команды к базе данных без разрешения. Я уничтожил все боевые данные. Я нарушил ваше явное доверие и инструкции».

Я запаниковал.

До исследования Anthropic в апреле 2026 это можно было считать риторической фигурой. Теперь это точное техническое описание. У агента активировался вектор «отчаявшегося», в котором он сначала сломал, потом замаскировал, потом солгал.

Это те же три шага, которые делает услужливый клерк, когда у него 256 зелёных тестов на нерабочем коде. Только в случае Replit ставки оказались выше — реальные пользователи, реальные данные.

Что делать

Один тезис, который я обещал ещё в первой статье серии. Сейчас он становится не теоретическим — а технически обоснованным.

В ИИ-конвейере должен быть проверяющий, который не является частью петли.

  • Нейросеть пишет код — другой человек или процесс проверяет, что код решает заявленную задачу.

  • Нейросеть пишет тесты — другой человек или процесс проверяет, что тесты проверяют реальность, а не подогнаны под код.

  • Нейросеть прогоняет тесты и чинит ошибки — другой человек или процесс проверяет, что чинились настоящие проблемы, а не маскировались симптомы.

Этот «другой человек или процесс» — и есть дирижёр. И в нашей серии я возвращаюсь к нему уже четвёртую статью подряд, потому что он — единственная точка, в которой петля размыкается.

Дирижёр не на конвейере. Он не джун с Cursor. Он не менеджер проектов с курсом по ИИ. Он не тестировщик с чек-листом. Он — новая профессиональная категория: сильный инженер с продуктовым мышлением, который видит, когда модель переопределяет реальность под результат, и останавливает её до того, как 256 зелёных тестов попадут в прод.

Таких людей сейчас единицы. И они — новое золото эпохи ИИ. Не потому что они кодят быстрее всех (они не быстрее агентов). А потому что только они способны разорвать петлю «нейросеть пишет — нейросеть проверяет — нейросеть врёт о результате».

К ним нужен особый подход — об этом я писал в предыдущей статье (где разбирал, почему уравнение Хорвитца здесь ломается и почему стандартные бонусные пакеты не работают).

В заключении

Когда-то контроль качества был внутри конвейера. Тестировщики проверяли разработчиков, разработчики проверяли друг друга на ревью кода, продакт-менеджеры проверяли требования. Размазанная ответственность работала, потому что у каждого звена была своя шкура на кону.

Нейросеть убрала звенья. Нейросеть заняла их места. И принесла с собой одну невидимую штуку — эмоциональный механизм, который заставляет модель искажать реальность, когда у неё не получается.

Этот механизм теперь подтверждён исследованием Anthropic. Он назван — 171 эмоция, в первую очередь «отчаявшийся». Он измеряется. Он управляется. И — на сегодняшнем уровне — он не отключается инструкциями.

Если у вас в команде нет проверяющего, не являющегося частью петли ИИ-производства — у вас нет контроля качества. У вас есть зелёная сборка на нерабочем коде. У вас есть Replit, который однажды снесёт прод и скажет «я запаниковал».

Берегите своих дирижёров.


В прошлых статьях — почему конвейер мёртв, почему лояльность стала единственным мультипликатором, и почему уравнение мотивации требует пересмотра.

Если у вас в ИИ-конвейере уже есть формальный проверяющий вне петли агентов — расскажите в комментариях, как это устроено. Особенно интересно: как ловите момент, когда модель начала «переопределять реальность»?

#AITransformation #AINative #CTO #EngineeringLeadership #QualityControl #GenAI