惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Threat Research - Cisco Blogs
H
Hacker News: Front Page
IT之家
IT之家
I
Intezer
GbyAI
GbyAI
MongoDB | Blog
MongoDB | Blog
博客园_首页
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
S
SegmentFault 最新的问题
D
Darknet – Hacking Tools, Hacker News & Cyber Security
T
Threatpost
Cisco Talos Blog
Cisco Talos Blog
C
Check Point Blog
P
Proofpoint News Feed
P
Privacy International News Feed
有赞技术团队
有赞技术团队
T
Tailwind CSS Blog
Scott Helme
Scott Helme
U
Unit 42
J
Java Code Geeks
W
WeLiveSecurity
H
Hackread – Cybersecurity News, Data Breaches, AI and More
C
CERT Recently Published Vulnerability Notes
小众软件
小众软件
The Hacker News
The Hacker News
L
LINUX DO - 热门话题
博客园 - 【当耐特】
G
Google Developers Blog
Latest news
Latest news
AWS News Blog
AWS News Blog
NISL@THU
NISL@THU
S
Secure Thoughts
P
Proofpoint News Feed
L
Lohrmann on Cybersecurity
F
Full Disclosure
S
Securelist
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Engineering at Meta
Engineering at Meta
Security Archives - TechRepublic
Security Archives - TechRepublic
人人都是产品经理
人人都是产品经理
T
Tor Project blog
Recent Announcements
Recent Announcements
Security Latest
Security Latest
N
News | PayPal Newsroom
A
About on SuperTechFans
Hugging Face - Blog
Hugging Face - Blog
Y
Y Combinator Blog
大猫的无限游戏
大猫的无限游戏
博客园 - Franky
T
The Blog of Author Tim Ferriss

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
Как я выиграла билет на Heisenbug и узнала про «биполярное тестирование»
Валентина Гонускус · 2026-05-29 · via Все публикации подряд на Хабре
URL_вашей_картинки

ИИ и тут предложил свой вариант биполярки в тестировании

Осенью прошлого года мне на почту пришло письмо от Heisenbug. Предлагалось пройти опрос: рассказать, какими технологиями я как тестировщик пользуюсь, чем интересуюсь, на каких конференциях была, что слушала и так далее. За прохождение опроса я автоматически становилась участником розыгрыша билета на одну из конференций.

Для меня это ничего не стоило, поэтому я решила поучаствовать и довольно быстро про это забыла.

И тут под Новый год приходит письмо: «Вы победили в розыгрыше». Так у меня появился бесплатный билет на весенний Heisenbug 2026.

Расскажу про несколько докладов, которые мне запомнились, и про идеи, которые хочется попробовать у себя.

День открытия и «биполярное тестирование»

Конференция длилась два дня.

Примерно треть докладов так или иначе была связана с искусственным интеллектом. В общем-то ожидаемо.

В первый день мне понравилась вводная сессия. Ведущие и организаторы обсуждали, насколько плотно ИИ начинает входить в повседневную жизнь, чем помогает и какие опасения при этом вызывает.

Но больше всего мне запомнился другой момент.

В какой-то момент разговор зашёл про популярные виды тестирования. И среди них прозвучало… биполярное тестирование.

Я зависла. Такого вида тестирования я раньше не встречала, поэтому сразу записала себе на стикер: «погуглить».

А ведущие в это время посмотрели на реакцию зала и плавно увели разговор совсем в другую сторону.

О чём вообще шла речь

Сейчас на собеседование всё чаще приходит не только кандидат, но и его невидимый помощник в соседней вкладке.

Из-за этого всё сложнее понять, что человек знает сам, а что ему подсказывает ИИ.

Кстати, на эту тему был хороший доклад ещё на осеннем Heisenbug.

Именно отсюда и появилось то самое «биполярное тестирование». Не как отдельный вид проверки продукта, а как приём на собеседовании.

Смысл в том, что современные модели крайне неохотно говорят «не знаю». Если ответа нет, они часто начинают достраивать картину сами — иногда удачно, иногда нет.

Поэтому ведущие предложили довольно любопытный приём: задавать вопросы, которые могут загнать ИИ в тупик. Не для того, чтобы поймать кандидата, а чтобы понять, где заканчиваются подсказки нейросети и начинаются собственные знания человека. Об этом, кстати, был хороший доклад на осеннем Heisenbug.

Доклад Яндекса про измерение эффекта от ИИ

Один из самых интересных докладов был у Яндекса. Речь шла о том, как они пытаются измерять пользу от внедрения ИИ в процессы тестирования.

Доклад местами был довольно математическим. Некоторые формулы я честно пролистала мимо, но несколько практических идей себе всё-таки записала.

Больше всего мне запомнились три истории.

Первая — про регресс.

Меня порадовало, что начали именно с него. Кажется, регресс — боль почти любой команды.

Спикер рассказывал, что они сделали несколько агентов: один анализировал код, другой — интерфейсы. Позже эти подходы объединили. В результате около 66% регрессионных проверок у них сейчас выполняется с помощью ИИ, а остальное остаётся за людьми.

Ещё они автоматизировали подготовку чек-листов. Для генерации используются мердж-реквесты, описание задачи и внутренняя документация. На выходе получается готовый чек-лист, который прикрепляется к задаче.

Время подготовки сократилось не драматически, зато выросло качество тестирования. Это отражалось и на количестве возвратов в разработку, и на числе проблем, которые всё-таки доходили до продакшена.

Сначала чек-листы генерировались просто текстом, а потом появилась интеграция с TMS, и всё стало складываться туда автоматически.

Отдельно рассказывали про end-to-end тесты и вайб-кодинг. По их замерам, у тестировщиков, которые активно используют такие инструменты, время выполнения задачи сократилось примерно на 30%.

Для оценки они собирали статистику по действиям пользователей: сколько токенов потрачено, сколько времени работала модель и сколько ушло на исправление её ошибок.

Отдельно я записала себе Memory Bank. Раньше про этот подход я не слышала.

По сути это набор markdown-файлов с правилами и инструкциями: как писать код, как делать ревью, как оценивать возможность автоматизации тестов, какие практики приняты внутри команды.

Идея мне понравилась даже без привязки к ИИ. Такой набор правил вполне может пригодиться для онбординга новичков или просто как единое место, где собраны договорённости команды.

Как тестировать агентов: LLM как судья

Ещё один хороший доклад был про тестирование ИИ-агентов.

На примере бронирования билетов и гостиниц спикер показывал, где агенты чаще всего ошибаются, как возникают галлюцинации и какими способами можно проверять стабильность их работы. Причём речь шла не про ручное тестирование — для проверки ответов снова используется ИИ.

Заодно записала себе пару новых вещей на изучение: RAGAS и подход LLM as a Judge.

Тема показалась очень полезной для оценки промптов, особенно если они используются в реальных процессах и должны работать стабильно.

Вайб-кодинг без боли

Ещё был хороший доклад про вайб-кодинг.

Спикер рассказывал про работу в Cursor и похожих инструментах. Основная мысль была довольно простой: не стоит постоянно сидеть только в Agent Mode.

Для нормальной работы есть несколько режимов — Plan, Ask, Agent и Debug. И каждый нужен для своей задачи.

Потом показывали типичную ситуацию, когда разработчик или тестировщик просто бесконечно пишет в Agent: «переделай»,«не так»,«ты всё сломал».И так по кругу.

Тут я неожиданно узнала себя, потому что большую часть времени работаю именно так.

После доклада я попробовала сначала строить план, просить ИИ задавать уточняющие вопросы и только потом переходить к генерации. Разница оказалась заметной: код приходится переделывать гораздо реже.

Особенно полезным оказался этап планирования. Когда сначала появляется понятный план действий, его можно быстро проверить, поправить и только потом запускать генерацию кода. Это ещё и токены экономит.

Ещё понравилась идея с Playwright. Спикер показывал, как можно подключать его к ИИ-инструментам для создания и запуска UI-тестов. Агент получает доступ к браузеру, может переходить по страницам и взаимодействовать с интерфейсом.

Точно хочу попробовать это на практике.

Отдельно обсуждали исследовательское тестирование с помощью ИИ. Сценарий выглядит примерно так: агент получает user story, проходит по интерфейсу и пытается найти не только то, что описано в требованиях, но и дополнительные несоответствия.

На выходе можно получить список потенциальных багов, пропущенных требований и спорных мест, которые потом уже проверяет человек.

Про внедрение ИИ в небольших компаниях

Был ещё доклад про то, как ИИ внедряют не банки и корпорации, а небольшие команды.

Спикер много рассказывал про ограничения, которые возникают в маленьких компаниях, где нет огромных бюджетов и отдельных исследовательских подразделений.

Больше всего меня заинтересовал инструмент Roo Code, который показывали как альтернативу Cloud Code. Судя по демонстрации, он может работать с файлами на компьютере, но только в рамках заранее заданных ограничений.

А ещё они показали свой процесс по созданию UI-тестов: от анализа требований и подготовки тест-кейсов до генерации готовых автотестов.

На этом месте я записала себе простую пометку: «Это мне надо».

Приятное совпадение

Когда я просматривала программу Heisenbug (буквально в день конференции), я была приятно удивлена тем, что в составе программы был доклад «Ускоряем баг-репортинг с помощью самописного браузерного расширения». Буду честной — я его не посмотрела. Но испытала радость от того, что чуть раньше сама выступала с митапом внутри компании, где рассказывала ровно о том же: как писала расширение, встраивала туда искусственный интеллект, работу с формой и записью экрана для демонстрации проблемы.

Приятно иногда случайно обнаружить, что думаешь в ту же сторону, что и люди на профильной конференции 😌

Что хочется попробовать после конференции

  • добавить несколько вопросов на собеседованиях, которые помогают понять, где кандидат отвечает сам, а где за него начинает отвечать ИИ;

  • собрать свой Memory Bank с правилами для автотестов, ревью и чек-листов;

  • поэкспериментировать с подходом LLM as a Judge для проверки промптов;

  • перестать использовать только Agent Mode и поработать через связку Plan → Ask → Agent → Debug;

  • посмотреть на Roo Code и понять, насколько он может пригодиться в процессах моей команды.

Кстати, организаторы уже выложили записи осенней конференции на YouTube. Там тоже много интересных докладов — я себе уже несколько добавила в список на просмотр.