惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
News | PayPal Newsroom
IT之家
IT之家
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
大猫的无限游戏
大猫的无限游戏
GbyAI
GbyAI
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
L
LangChain Blog
S
SegmentFault 最新的问题
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
Project Zero
Project Zero
P
Privacy & Cybersecurity Law Blog
V
Vulnerabilities – Threatpost
博客园 - 三生石上(FineUI控件)
Recorded Future
Recorded Future
The Hacker News
The Hacker News
C
CXSECURITY Database RSS Feed - CXSecurity.com
C
CERT Recently Published Vulnerability Notes
宝玉的分享
宝玉的分享
aimingoo的专栏
aimingoo的专栏
T
Tor Project blog
T
The Exploit Database - CXSecurity.com
Schneier on Security
Schneier on Security
H
Help Net Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
M
MIT News - Artificial intelligence
W
WeLiveSecurity
P
Proofpoint News Feed
A
About on SuperTechFans
S
Securelist
I
InfoQ
G
Google Developers Blog
博客园 - 司徒正美
博客园 - 叶小钗
Latest news
Latest news
F
Fortinet All Blogs
G
GRAHAM CLULEY
腾讯CDC
Jina AI
Jina AI
S
Schneier on Security
I
Intezer
V
Visual Studio Blog
美团技术团队
V2EX - 技术
V2EX - 技术
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The Cloudflare Blog
Microsoft Security Blog
Microsoft Security Blog
Blog — PlanetScale
Blog — PlanetScale
P
Proofpoint News Feed
罗磊的独立博客
Y
Y Combinator Blog

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
Как мы научили ИИ за 3 минуты делать работу патентного поверенного: путь от «обертки» до победы в «ОСНОВА-2026»
Сергей · 2026-05-19 · via Все публикации подряд на Хабре

Простой

5 мин

9.1K

Привет, Хабр! Меня зовут Кирилл, я партнер брендингового агентства «Бунов+Устинов». Пока индустрия спорит, заменит ли ИИ кожаных мешков, мы с архитектором проекта Сергеем Либединским решили проверить это на самой «душной», долгой и дорогой части нейминга - юридическом скрининге товарных знаков.

Это история о том, как превратить галлюцинирующую LLM в строгий экспертный инструмент, пережить «догфудинг» собственной нейронкой и получить награду «ОСНОВА-2026» за автоматизацию процессов в брендинге.

Боль: 3 дня ожидания или риск на миллионы

Если вы когда-нибудь придумывали название для компании или продукта, вы знаете этот цикл боли. Креатор выдает 20–50 гениальных вариантов, команда выбирает шорт-лист, а затем несет его патентному поверенному.

Здесь вскрывается классическая проблема: время и деньги. Ручной скрининг занимает 2–3 рабочих дня. В деньгах проверка пачки названий может стоить 15 000 - 30 000 рублей. Если все варианты отваливаются (что бывает часто), итерация повторяется, а темп работы креативной команды умирает.

Казалось бы, на дворе эра ИИ - закинь варианты в ChatGPT! Но попытки использовать LLM «в лоб» провалились сразу по двум критическим причинам:

  1. Галлюцинации. На запрос: «Проверь название "Кипрей" для ЖК» любая модель выдает уверенную и складную чушь: «Название свободно, прямых конфликтов нет, рекомендуется к регистрации». А в реальности в реестре ФИПС под 36 классом МКТУ (недвижимость) уже лежит свежая заявка с точно таким же фонетическим сходством. Модель об этом не знает, так как её база не обновляется в реальном времени.

  2. Конфиденциальность (Blind spot большинства AI-стартапов). Сливать строго конфиденциальные, еще не анонсированные имена продуктов в публичные чаты типа ChatGPT - прямой путь к утечкам. Для энтерпрайза это абсолютное табу.

Мы поняли: просто «промпт в чат» - это билет в суд. Нужна своя система, которая работает через API с zero-data-retention политиками (без обучения на данных пользователей) и не угадывает факты, а сверяет их.

Архитектура: Разделяй и властвуй

Чтобы победить галлюцинации, мы создали xyma.ru. Главный принцип работы: детерминированная часть - на классике, нечеткая - на ИИ.

Наш стек: бэкенд на Java (нам нужен был надежный асинхрон для работы с тяжелыми API), а ИИ-ядро спроектировано как модельно-независимое. Мы не привязаны ни к OpenAI, ни к Anthropic, ни к Яндексу. Под капотом стоит роутер, раздающий задачи: одна модель лучше/дешевле делает summary, другая лучше классифицирует юридические тексты.

Самое важное звено пайплайна - прямые запросы к актуальным реестрам, особенно к свежим заявкам за последние 30 дней. Это та самая «слепая зона», на которой горят даже опытные юристы: знак еще нигде не светится, но уже подан и потенциально блокирует вас.

Борьба со сходством: от Левенштейна до эмбеддингов

Главный вызов при скрининге - поиск сходства «до степени смешения».

Здесь мы запускаем двухступенчатый фильтр. Сначала классические строковые алгоритмы (расстояние Левенштейна, совпадение префиксов/суффиксов, индекс Jaro-Winkler) отсекают очевидный мусор и находят графические совпадения.

Но дальше начинается боль - фонетика и семантика. Как понять, что кириллическое «Хума», латинское «Xyma» и даже «Ксима» - это конфликт? Для классических алгоритмов это разные строки. Для эксперта Роспатента - одно и то же.

Мы внедрили метод эмбеддингов, переводя названия из реестров в векторное пространство для поиска пересечений по смыслу и звучанию.

Псевдокод упрощенной ветки в Java выглядит примерно так:

// 1. Получаем кандидатов (узкий пул по МКТУ)
List<Trademark> candidates = rospatentClient.search(classes, brand);
List<Trademark> risks = new ArrayList<>();

// 2. Считаем разные типы сходства
for (Trademark tm : candidates) {
    double phon = cosine(phoneticEmbed(brand), phoneticEmbed(tm.name));
    double sem  = cosine(semanticEmbed(brand), semanticEmbed(tm.name));
    double graph = graphicDistance(brand, tm.name); // Левенштейн + Jaro-Winkler

    if (phon > 0.82 || sem > 0.85 || graph > 0.78) {
        risks.add(tm);
    }
}

// 3. Отдаем в LLM сырые факты для анализа по 1483 ГК РФ
String verdict = legalLLM.classify(brand, risks, GK_RF_1483_RULES);

Как мы ограничиваем LLM: промпт-инжиниринг и логика

Чтобы машина не фантазировала, мы запретили ей принимать решения «на глазок». Мы передаем ей жесткую формулу скоринга рисков. Модель получает сырые найденные факты и обязана вернуть не эссе, а строгий JSON, который программно валидируется:

{
  "risk_level": "medium",
  "protectability": {
    "score": 0.62,
    "issues": ["possible descriptiveness"]
  },
  "conflicts": [
    {
      "source": "Rospatent",
      "mark": "NEBULA",
      "risk": "high",
      "reason": "В базе выявлены действующие компании с идентичным названием, что может создать риски претензий по фирменному наименованию."
    }
  ]
}

Что видит пользователь

Вместо унылых юридических выписок и 3 дней ожидания, система за 3 минуты генерирует PDF-отчет, состоящий из 4 ключевых блоков:

  1. Защищаемость (описательность, различительная способность, соответствие нормам морали).

  2. Конфликты (найденные риски по базам Роспатента/WIPO/ЕГРЮЛ по нужным классам).

  3. Домены (свободны ли .ru.com.tech и т.д.).

  4. SEO и Wordstat (забит ли поиск одноименными конкурентами).

Защищаемость и Конфликты

Защищаемость и Конфликты

Домены и SEO

Домены и SEO

Самари по анализу

Самари по анализу

Догфудинг: проверяем сами себя

Имя нашего сервиса мы проверяли через собственный, тогда еще безымянный пайплайн. Для нас семантика имени была важна: xyma = птица счастья Хума из мифологии + human (человек) + ум.

Это был стресс-тест в чистом виде: короткое название на латинице, с кучей вариантов прочтения. Если бы система нашла критический конфликт в ЕГРЮЛ или свежих заявках, пришлось бы переделывать всё - от логотипа до доменов. Но xyma прошла проверку (что потом подтвердил и живой поверенный). Это было лучшее доказательство жизнеспособности продукта.

Честные факапы и "где машина проигрывает человеку"

Чтобы не выглядеть инфоцыганами, поделюсь нашими проблемами:

  1. Стоимость инференса. Гонять несколько тяжелых LLM и считать эмбеддинги на каждый запрос - это дорого. В API-токенах один глубокий репорт обходится нам в сумму, которая на порядки больше обычного чат-запроса (хотя всё равно в 100 раз дешевле 15 000 рублей за поверенного).

  2. Государственные API. Реестры иногда «виснут». В моменты их падений наши 3 минуты элегантно превращаются в 5, коннекты отваливаются, а на бэкенде начинают потеть ретраи.

  3. Культурный контекст и юмор. Это главное слепое пятно алгоритмов. Допустим, вы называете логистическую компанию «Песец» или «Ёшкин Кот». Машина поймет это буквально - как животное или фольклорный персонаж. А вот живой эксперт сразу увидит двусмысленность, игру слов и возможные риски отказа по этическим соображениям. Там, где идиомы и мемы сплетаются воедино, человек пока стабильно выигрывает.

Притопали к признанию: что дальше?

За два месяца после релиза мы прогнали тысячи проверок. А главным подтверждением того, что мы не просто «сделали обертку», стала победа на брендинговом фестивале ОСНОВА-2026 в номинации «Технологии: Автоматизация процессов в брендинге».

Сейчас xyma.ru работает в бете - полностью бесплатно и без ограничений. Вы можете зайти, попробовать.

В планах на второй квартал - добавление генерации «чистых» (уже проверенных) неймов, командные кабинеты и бесшовная подача заявки в Роспатент прямо из интерфейса. (Кстати, на базе этого опыта маршрутизации моделей и RAG мы сейчас еще и собираем кастомных ИИ-ассистентов под сложные B2B-задачи).

Заходите потестить и ломайте наш алгоритм. Давайте обсудим холиварный вопрос: где еще, помимо культурного контекста, автоматика неизбежно проиграет живому юристу, а где мы можем прямо сейчас разогнать процессы в 100 раз?