惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
J
Java Code Geeks
小众软件
小众软件
D
Docker
腾讯CDC
H
Hackread – Cybersecurity News, Data Breaches, AI and More
V
V2EX
博客园 - 叶小钗
GbyAI
GbyAI
Microsoft Azure Blog
Microsoft Azure Blog
Stack Overflow Blog
Stack Overflow Blog
B
Blog RSS Feed
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 【当耐特】
IT之家
IT之家
博客园 - 司徒正美
M
MIT News - Artificial intelligence
T
The Blog of Author Tim Ferriss
The GitHub Blog
The GitHub Blog
罗磊的独立博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
L
LangChain Blog
阮一峰的网络日志
阮一峰的网络日志
C
Check Point Blog

Все публикации подряд на Хабре

Ловим музу за клавиатуру: как айтишнику стать автором Что умеет Midjourney в 2026? Мой немного грустный разбор этого шикарного инструмента Никто не любит писать тесты, но ИИ может исправить это IPv8 выглядит как мечта. Поэтому почти наверняка не взлетит Производители вернули в продажу материнки с DDR3. Что происходит? Управление агентом с телефона через Telegram теперь в KodaCode От координации к лидерству: как меняется роль руководителя разработки Я сделала родителям бизнес вместо пенсии: зарабатываем 70 тысяч, мама не даёт продать В три раза быстрее приемка товара и оптимизация трудозатрат на 73%: как «РСТ-Инвент» помог Gulliver Group ИИ-шечный мир победил? О влиянии искусственного интеллекта на игропром Кремль снижает давление на Телеграмм пока Европа строит интернет по паспорту Как CEO, CTO и CIO за 8 часов собрали ИИ-директора, который умеет держать позицию под давлением Как (не) потерять домен за выходные Вместо 8 разных VPS: как я организовал практику студентам на одном сервере Почему твой Open Source проект не замечают? R&D: искусство управления неопределенностью в разработке AI-дефляция: вакансий для разработчиков больше, а рост зарплат — худший за 15 лет Мы отдали управление роботами OpenClaw. Что из этого вышло Галактический ID: система идентификации для всех форм разумной жизни Шесть основ бизнес-анализа: начинаем с вопроса «Кто в игре?» Код-ревью, в котором дело не в коде Данные переехали. Команда — нет Системной подход к сдаче OSWE в 2025 Почему комната управления реактором покрашена в цвет морской пены 4 YAML-файла вместо PySpark: как аналитикам строить пайплайны без разработчиков LLM-агент для поиска свободных доменов: автоматизируем подбор Когда, зачем и как правильно начинать новую сессию в Claude Code? Как я заставил нейросеть писать макросы для FreeCAD Анатомия ИИ‑агента для подбора персонала. От тысячи резюме к топ‑10 за минуты Опыт разработчика как экономика внимания
Сбор сведений из открытых источников: почему это рискован...
letsweb (Onl · 2026-05-13 · via Все публикации подряд на Хабре

Сбор сведений из открытых источников: почему это рискованно, если выкачивается информация из чужих баз данных?

Уровень сложностиПростой

Время на прочтение4 мин

Охват и читатели0

Обзор

Собрать информацию о человеке или продукте с использованием высоких технологий стало делом техники. В прямом и переносном смысле слова. Однако такое выкачивание данных может стать поводом для судебного разбирательства. Почему это происходит — далее в материале.

Сайт как база данных

Нередко информация, систематизированная на сайте (каталог, соцсеть, маркетплейс), является официально созданной базой данных. Права на нее могут принадлежать компании-разработчику этого сайта. Соответственно, использовать многочисленные указанные материалы на коммерческой основе без разрешения их правообладателя — признается нарушением.

В 2017 году в российских судах началось слушание по делу ООО «В Контакте» против ООО «Дабл Дата».

«Дабл Дата» запустила несколько программ:

  • Поисковую систему (позволяет обнаружить нужный аккаунт человека и предоставить ссылку на него);

  • ПО для визуализации информации по ссылкам;

  • ПО, позволяющее обнаруживать «дубли» аккаунтов пользователей.

ООО «В Контакте» посчитало, что указанное программное обеспечение:

  • работает без надлежащего разрешения;

  • предназначено для скоринга;

  • нарушает их права на сформированную базу данных. 

Последовало обращение в суд.

Дело рассматривалось несколько лет, пройдя последовательно ряд инстанций.

В конечном счете — в Суде по интеллектуальным правам утвердили мировое соглашение между корпорациями.

Юристы-аналитики, разбирая решения СИП (хотя финальной позиции по ключевым вопросам не было), указывают на следующие важные детали:

1. Даже если информацию в базу данных сайта «скидывали» сами пользователи, то это не означает, что создатель (организатор) не имеет прав на эту БД.

2. Изготовителем базы данных считается лицо, вложившее серьезные ресурсы в создание продукта. 

Как найти грань между «можно обрабатывать» и «нельзя»?

Во-первых, свобода доступа к информации закреплена в Конституции. Отдельные факты (цена товара, их характеристика, общедоступные материалы и так далее) — не относятся к категории объектов авторского права.

Во-вторых, изготовитель базы данных получает на нее исключительное право, если в создание продукта были вложены финансовые, организационные или иные затраты.

В-третьих, субъект не может на систематической основе использовать существенную часть чужой базы данных без разрешения правообладателя. Это означает, например, что отдельные элементы или несущественную часть продукта — извлекать разрешено.

Грань между существенностью и несущественностью в этом случае очень тонкая. Она может проходить, например, по объемам извлечения: если используете неважные данные максимум из одного или двух профилей в соцсети, то это может считаться законным; если вы на коммерческой основе извлекаете данные из тысячи профилей, а потом анализируете их и предоставляете третьим лицам, — то это могут признать неправомерным действием.

В-четвертых, под юридической защитой оказывается структура созданной базы данных. 

Базовые правила выкачивания информации в автоматизированном режиме (парсинге)

Не стоит парсить:

  • Относимое к персональным данным (если разрешение прямо не прописано в законе);

  • Размещенный эксклюзивный контент.

При парсинге:

  • Отследите, что указывает владелец сайта в файле robots.txt (он определяет, какие разделы сайта разрешены для индексации поисковиками, а какие — нет);

  • Не направляйте частые запросы к системе (они могут быть расценены как атака).

А на западе кейсов, связанных с парсингом, не было?

Были.

Одно из значимых (и интересных) дел — противостояние соцсети LinkedIn против hiQ Labs.

Представители LinkedIn заявили, что их противники (конкуренты) собирают доступные данные пользователей. Чтобы это пресечь, соцсеть поставила блок на открытые страницы.

В суде ситуация развивалась так:

  • В первой инстанции — LinkedIn запретили ограничивать hiQ Labs по доступу к данным;

  • В апелляции — подобное решение было подтверждено (раз сами пользователи открыли свои страницы, то не стоит их ограничивать в подобном волеизъявлении).

Дело дошло до Верховного Суда, который направил кейс на пересмотр.

Мотивируя свое решение, ВС сослался на дело правоохранителя Роберта Ван Бюрена, который, пользуясь своим должностным положением, вошел в полицейскую базу данных и за взятку предоставил сведения другому о номерном знаке женщины-водителя. Суд посчитал, что в данном случае произошел незаконный неавторизованный доступ к защищенному компьютеру. То есть: полицейский имел полномочия по получению информации, но использовал он их для незаконной цели.

Апелляция, учтя подобное решение, посчитала, что к сайтам, размещенным в публичном поле, невозможно применить концепцию неавторизованного доступа. Доступ к открытым данным ограничивать не стали, нарушение профильного Закона не увидели.

Но компании, имеющие подобные сайты, без защиты не оставили: в пользовательском соглашении можно предусмотреть ограничения, за несоблюдение которых последует иск.

О сервисе Онлайн Патент:

Онлайн Патент — цифровая система № 1 в рейтинге Роспатента. С 2013 года мы создаем уникальные LegalTech‑решения для защиты и управления интеллектуальной собственностью. Зарегистрируйтесь в сервисе Онлайн‑Патент и получите доступ к следующим услугам: