Парсинг данных в 2026: где проходит граница между легальным и судом
Публичные данные можно собирать — так думали многие до исков LinkedIn, Meta и Reddit. Разбираю на реальных делах, что в 2026 году отделяет обычный парсинг от повестки в суд.
Меня часто спрашивают: «Парсить сайты вообще законно?» Честный ответ — вопрос поставлен неправильно. У законности парсинга нет тумблера «да/нет». Она собирается из нескольких слоёв, и в каждом можно нечаянно наступить на мину. Я сам разбирал материалы по искам LinkedIn, Meta и Reddit, читал жалобу LinkedIn против Nubela — и вынес оттуда простую вещь. Суд начинается там, где вы нарушаете конкретное правило. Не там, где качаете данные.
Разложу эти слои по порядку.
Публичные данные ≠ разрешённые данные
Главное заблуждение звучит так: «данные открыты в интернете, значит их можно брать». История с hiQ против LinkedIn это заблуждение сначала подкормила, а потом разрушила. Апелляционный суд признал, что сбор публичных профилей вряд ли нарушает CFAA — американский закон о несанкционированном доступе к компьютерам. Многие выдохнули. Но hiQ всё равно проиграла — по другому основанию: нарушение пользовательского соглашения LinkedIn.
Вот граница номер один. Доступ к публичной странице и право её систематически выкачивать — разные вещи. CFAA может вас и не задеть. А договор задевает.
Условия использования — это договор, который вы подписали кликом
Когда вы регистрируете аккаунт, вы соглашаетесь с ToS. Там почти всегда прямым текстом запрещён автоматический сбор. Именно на этом строится иск LinkedIn против Nubela: используешь залогиненный аккаунт для парсинга — нарушаешь договор, к которому присоединился добровольно.
Отсюда практический вывод, которым я пользуюсь сам:
- Сбор данных без авторизации, из полностью открытого доступа — зона относительно светлая.
- Сбор под своим или купленным аккаунтом, в обход технических ограничений — зона тёмная, здесь и живут повестки.
Разница между этими двумя сценариями и есть та самая граница между «инструментом» и «ответчиком».
Дело Meta против Bright Data: почему платформа не всегда выигрывает
Чтобы картинка не выглядела односторонней. В споре Meta с Bright Data суд встал на сторону скрапера: сбор публичных данных без входа в аккаунт нарушением договора не признали. Логика та же, что и в hiQ, только результат для платформы обратный.
Я читаю это так: суды всё чаще смотрят, был ли логин и обход защиты. Нет авторизации — нет и договорного нарушения, за которое можно зацепиться. Появляется аккаунт — появляется договор, а вместе с ним и риск.
Технические барьеры трогать опасно
Есть отдельный слой — обход технической защиты. В США это DMCA, статья 1201: закон про взлом средств контроля доступа. Капчи, rate-limit, блокировки по IP, требование залогиниться — если вы это активно ломаете, разговор смещается от «сбора данных» к «взлому». А это уже другая весовая категория ответственности.
Здесь моё правило простое: уважайте robots.txt и не выламывайте замки. Замедлились, получили 403, упёрлись в капчу — остановитесь. Это сигнал притормозить, обход тут придумывать не надо.
GDPR и EU AI Act: европейский слой про персональные данные
Даже если с доступом всё чисто, остаётся вопрос: что вы собираете. Имена, email, должности, фото — это персональные данные. В Европе действует GDPR, и он применяется к обработке независимо от того, лежали данные открыто или нет. Публичность в интернете не отменяет обязанностей: основание для обработки, права людей на удаление, ограничения на профилирование.
EU AI Act добавил свежий пласт для тех, кто парсит ради обучения моделей. Свежий спор Reddit против Perplexity — как раз про это: платформы всё активнее защищают контент от сбора под ИИ. Собираете данные для датасета — теперь держите в голове ещё и вопрос доступа, и то, что скажет европейский регулятор про источник.
Как я определяю свою границу на практике
Сведу всё к чек-листу, который держу в голове перед любым проектом по сбору данных:
- Логин. Захожу под аккаунтом? Тогда я связан условиями использования. Сто раз подумаю.
- Защита. Обхожу ли капчу, лимиты, блокировки? Если да — останавливаюсь.
- Персональные данные. Собираю данные о людях, особенно из ЕС? Нужно основание и уважение к GDPR.
- Цель. Обучаю модель на чужом контенте? Смотрю на AI Act и позицию платформы.
- robots.txt и нагрузка. Не гружу сайт так, будто устраиваю DoS.
Если по всем пяти пунктам чисто — я работаю спокойно. Загорается хоть один — торможу и советуюсь с юристом.
Парсинг в 2026 году остаётся рабочим инструментом. Суд начинается там, где сбор данных превращается в обход правил: чужой аккаунт, сломанная защита, персональные данные без основания. Держитесь по светлую сторону этих трёх линий — и повестка обойдёт вас стороной.