惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

云风的 BLOG
云风的 BLOG
P
Privacy International News Feed
Vercel News
Vercel News
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
博客园 - 叶小钗
F
Fortinet All Blogs
Security Archives - TechRepublic
Security Archives - TechRepublic
L
LINUX DO - 最新话题
AWS News Blog
AWS News Blog
Engineering at Meta
Engineering at Meta
Attack and Defense Labs
Attack and Defense Labs
Recent Announcements
Recent Announcements
Recent Commits to openclaw:main
Recent Commits to openclaw:main
PCI Perspectives
PCI Perspectives
Cloudbric
Cloudbric
AI
AI
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
IT之家
IT之家
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
J
Java Code Geeks
M
MIT News - Artificial intelligence
Cisco Talos Blog
Cisco Talos Blog
V2EX - 技术
V2EX - 技术
Webroot Blog
Webroot Blog
Microsoft Security Blog
Microsoft Security Blog
Cyberwarzone
Cyberwarzone
博客园 - 聂微东
G
Google Developers Blog
W
WeLiveSecurity
罗磊的独立博客
P
Privacy & Cybersecurity Law Blog
阮一峰的网络日志
阮一峰的网络日志
A
About on SuperTechFans
WordPress大学
WordPress大学
The GitHub Blog
The GitHub Blog
T
Tailwind CSS Blog
V
Visual Studio Blog
Application and Cybersecurity Blog
Application and Cybersecurity Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
S
Secure Thoughts
Apple Machine Learning Research
Apple Machine Learning Research
Hugging Face - Blog
Hugging Face - Blog
Google DeepMind News
Google DeepMind News
Google DeepMind News
Google DeepMind News
雷峰网
雷峰网
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
F
Full Disclosure
Blog — PlanetScale
Blog — PlanetScale
The Last Watchdog
The Last Watchdog
P
Proofpoint News Feed

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания Автономность как точка невозврата: кто будет субъектом в цифровом будущем Обучение ИИ в «диких» условиях: как рутинные действия превращаются в датасеты Как измерить LLM для задач кибербеза: обзор открытых бенчмарков Где хранить код? Сравнение GitHub, GitLab и Bitbucket Математика объясняет, почему нормальное распределение встречается повсюду Почему ваш FinOps не работает: 12 тезисов от практиков Как подписать проектную документацию УКЭП с использованием бесплатных лицензий Pilot Адаптивное администрирование Sigla Vision Я грузил уран в бочки, а потом 20 лет строил ИТ в атомной отрасли Чем позвонить с Эвереста? История и обзор спутниковой связи. Часть 2 Как языковая модель помогает контролировать качество инструктажей по охране труда в металлургии Как не передать на desktop свой IP в РКН Анатомия SAP Privileges: как устроено управление правами в macOS MoneyDev: Сказка про три главных слова Обновлённый токенизатор видео K-VAE 2.0 от Сбера Как сделать диспетчеризацию дома на 1284 квартиры почти бесплатно Как мы разогнали железную дорогу Мы дали агентам рутину. Теперь надо решить — что делать с освободившимся временем Токсичный контент, промпт-хакинг и защита ИИ — всё о Guardrails для LLM Умный город начинается с точного взгляда: как «Фалькон Тех» меняет пространство к лучшему Навайбкодил приложение для анализа графов Почему Дюну так интересно читать? Упрощаем работу с рутиной или как стать Гендальфом Белым Деконструкция Go: CPU, RAM и что там происходит. Go Assembler база. Часть 1.1 Какие профессии исчезнут из-за ИИ, а какие появятся? И что с этим делать Как мы построили IT-отдел, где хочется расти: архитектурные встречи, прозрачные метрики и книжные подарки Rufler: Делаем из Claude Code автономный рой через один YAML-конфиг Sing-box и белый список приложений Как построить надёжный обмен сообщениями в микросервисах: лучшие практики для enterprise OpenAI строит MLM-пирамиду, а McKinsey и Accenture помогают ей в этом Дом, который не построил Фишер (Часть 2) «Сверхзвуковой математик» против «Вдумчивого логиста»: битва алгоритмов 3D-упаковки Мультимодальные модели – грубый и дорогой инструмент Разговоры ничего не стоят. Код тоже Проверки физических лиц: с кого начнет ФНС Топ-10 бесплатных нейросетей для создания видео в 2026 году Первые слои кода: как наши решения сегодня определяют архитектуру ИИ на десятилетия Разработка нового статического анализатора: PVS-Studio JavaScript Поиск уязвимостей ПО: базовый минимум или роскошный максимум Почему оценка персонала не работает как инструмент управления Как мы разработали ИИ-ассистента и сократили рутину продуктовой команды на 50% Как я ушел из найма, нажарил косточек и продал на маркетплейсах на 168 млн в год Когда 1С:ERP уже внедрена, а нормального производственного плана всё ещё нет Как я сделал Claude мультимодальным, подключив к нему Qwen Omni Как приглашение на вакансию мечты превращается в атаку Infrastructure as Code: философия и лучшие практики IaC Тестируем Yandex Code Assistant на задаче, в которой нужно хранить секреты nxs-universal-chart v3.0: новое поколение универсального Helm-чарта Callback Injection: Техника, которая отправила Microsoft Defender в глухой нокаут «Все идеи на стол»: митап как способ вывести проект из тупика Сегодня я узнал нечто новое о GPU благодаря багу в своей игре Как заставить LLM ̶ ̶г̶а̶л̶л̶ю̶ ̶ эволюционировать Карта событий как фундамент аналитики: практический кейс для E-commerce Что выбрать для AI: x86, ARM или RISC-V? Дайджест железа за март Роль соматических мутаций в развитии аутоиммунных заболеваний: путь к избирательной терапии Mythos от Anthropic — тревожный сигнал для всех, а не только для банков Guardrails для LLM на Java: как приручить промпт‑инъекции и токсичные ответы Green-VLA: как мы собрали VLA-модель для реального антропоморфного робота и не потеряли обобщение Финансовая гонка вооружений: почему умные люди добровольно в ней участвуют Эра ИИ-агентов наступила: выбираем лучшего цифрового сотрудника # Практический опыт внедрения WinCC Redundancy на производственном предприятии Сделал MVP за 3 дня, а потом неделю прикручивал оплату. Оно того стоило? Физика против Маска: почему Starship V3 может оказаться ещё одной катастрофой Нефть Венесуэлы: крупнейшие запасы в мире, но не крупнейшая нефтяная держава JPA 4. Переосмысление Hibernate Почему зеркальная фотокамера Nikon D5 десятилетней давности идеально подошла для миссии «Артемида-2» Проект «Уровень-Спутник» или как мы сделали платформу для гидрологов «Замедлиться, чтобы ускориться»: почему ИИ повышает цену ошибок в требованиях и архитектуре Как с нуля поднять трафик IT-компании на 1657% при бюджете 55 тыс. и выжить Pixel-perfect Downsampling — идеальная отрисовка 50 миллионов точек без потерь
Решение задачи удаления избыточных терминов в заданном контекте без потери информации. Примеры в Colab
asiver · 2026-05-18 · via Все публикации подряд на Хабре

Уровень сложностиСредний

Время на прочтение4 мин

Охват и читатели6

Туториал

Recovery Mode

Как известно, LLM - это машина, которая “видела” “весь Интернет”, много чего запомнила и много чему научилась. Задавая ей правильные вопросы можно получать “правильные” ответы (где “правильные” стоит понимать в статистическом смысле). Широта и универсальность таких способностей дает возможность ставить новые универсальные задачи и получать общее решение таких задач.

В этой статье рассмотрим универсальную задачу “удаления избыточных терминов из заданного списка без потери информации в рамках заданной перспективы”. Эта задача рано или поздно появляется у всех, кто разрабатывает документацию, и перед кем стоит задача изложить материал и передать его другим людям как можно проще, логичнее, оптимальнее. Такая задача также возникает, когда требуется объединить ответы от разных LLM, заданные как список терминов. В каком-то смысле это обратная задача к задаче генерации информации и можно ожидать, что с ростом количества сгенерированной информации потребность в решении такой задачи будет также возрастать.

Постановка задачи: дан список терминов и задана перспектива рассмотрения. Требуется удалить из списка избыточные термины, которые не несут дополнительной информации с точки зрения этой перспективы, сохранив при этом всю существенную информацию. Иными словами, нужно найти минимальное подмножество терминов, которое покрывает смысл всех остальных терминов (и тем самым полностью отражает содержание исходного списка терминов в рамках заданной перспективы).

С точки зрения мета-знаний задача представляется следующим образом:

  • из описание перспективы требуется определить полные детали перспективы: 1.point_of_view - точка зрения наблюдателя — это позиция, с которой рассматривается или оценивается информация, определяющая, какие термины считаются избыточными в заданном контексте 2.basis_of_consideration - основание рассмотрения - это совокупность критериев и принципов, определяющих, какие термины считаются избыточными и подлежат удалению, а какие сохраняются для обеспечения полноты информации в рамках заданной перспективы 3.perspective_observer_strategy - стратегия наблюдателя, которая дополняет определение перспективы рассмотрения basis_of_consideration и perspective_observer_strategy введены дополнительно к point_of_view, т.к. известно, что простой точки зрения наблюдателя для определения полной перспективы рассмотрения недостаточно.

  • для каждого термина из заданного списка требуется определить отношения этого термина к другим терминам. Как известно из теории Логики: всё, что человек может помыслить является, либо “понятием”, либо “атрибутом” понятия, либо “отношением” между понятиями. Стоит отметить, что все LLM это знают, понимают и используют смысл категорий понятие", “атрибут” и “отношение”. Это позволяет использовать следующий подход:

    • определим онтологию как упрощенную схему данных для определения элементов данных и отдельно от нее непосредственную онтологию как коллекцию JSON-based элементов данных, заданную согласно схеме данных

    • в term-elimination онтологии (схема+онтология) определим ключевые отношения: sameIdentityAs, instanceOf, subclassOf, partOf, которые соответствуют отношениям, которые современные LLM-модели вполне распознают. Эти отношения выбраны так, чтобы по их наличию и отсутствию можно было судить о том, какой термин можно признать избыточным:

      • sameIdentityAs отношение означает, что термин выражает то же самое понятие, что и другой термин. Очевидно, что в рамках одного контекста нужно оставить только один термин без потери смысла

      • instanceOf отношение означает, что понятие является реализацией другого понятия. Как правило считается, что в рамках одного контекста реализация понятия и класс понятия несовместимы и поэтому реализацию можно откинуть из этого контекста без потери смысла

      • если какой-то термин является подклассом (subclassOf) другого термина и присутствует в том же самом контексте, то его можно отбросить из этого контекста, т.к. этот контекст является для подкласса слишком широким. На практике на этапе “расшифровки” терминов это означает, что сначала требуется “расшифровать” родительский термин и уже после этого, на отдельном шаге, можно “расшифровать” дочерние термины (подклассы)

      • partOf отношение означает, что понятие является частью (составной или пространственной частью) другого понятия. Также можно считать, что в рамках одного контекста понятие-часть и понятие-целое несовместимы в одном контексте и поэтому понятие-часть можно откинуть из этого контекста без потери смысла

    • отношения между понятиями могут образовать достаточно разветвленный граф. Для выбора минимального количества понятий, “содержащих в себе” другие понятия, и в сумме “покрывающие” все исходные понятия требуется решение комбинаторной задачи поиска минимального количества множеств, покрывающих все элементы (“задача о покрытии множества”). Для решения этой задачи используем интеграцию с ASP-движком Clingo

Для решения этой задачи в фреймворке core-kbt сделана ИИ-функция concept_set_covering, реализующая вышеизложенную логику, по которой можно откинуть термины без потери смысла.

ИИ-функцию concept_set_covering можно также вызывать из Google Colab ноутбука и мы можем продемонстрировать пример ноутбука с решением этой задачи для 5 примеров в совершенно разных областях:

  • 1. Удаление избыточных терминов по биологической классификации

  • 2. Выбор верхнеуровных терминов для каталога компьютерных комплектующих

  • 3. Удаление избыточных терминов в описании этапов разработки программного обеспечения

  • 4. Создание глоссария для внутреннего руководства по разработке программного обеспечения

  • 5. Оптимизация набора ключевых тем для статьи

Комментарии к таблицам в сolab-ноутбуке:

  • таблица total_dt:

    • input_terms - исходный список терминов

    • deleted_terms - удаленные термины

    • result_terms - получившийся список терминов

  • таблица details_dt - список удаленных терминов, с указанием списка отношений к другим терминам, из-за которых этот термин был удален

    • в колонке relations - список отношений термина к другим терминам

С другими деталями о core-kbt фреймворке можно ознакомиться в этой статье.

Итого, что можно было узнать в этой статье:

  • постановку важной задачи: удаление избыточных терминов из заданного списка без потери информации в рамках заданной перспективы

  • представление этой задачи в категориях мета-знаний и вариант её решения

  • вариант решения этой задачи в фреймворке core-kbt через ИИ-функцию perspective_concept_relations

  • приведен пример Colab-ноутбука с решением задачи для 5 примеров в совершенно разных областях: от каталога компьютерных комплектующих до оптимизация набора ключевых тем для статьи.


Предложения, отзывы и любая обратная связь приветствуется.