сайт в бете
нашли баг? напишите
левин. записаться
весь блог

Парсинг данных в 2026: где проходит граница между легальным и судом

Публичные данные можно собирать — так думали многие до исков LinkedIn, Meta и Reddit. Разбираю на реальных делах, что в 2026 году отделяет обычный парсинг от повестки в суд.

Л
Проект Левин
автор
Парсинг данных в 2026: где проходит граница между легальным и судом

Меня часто спрашивают: «Парсить сайты вообще законно?» Честный ответ — вопрос поставлен неправильно. У законности парсинга нет тумблера «да/нет». Она собирается из нескольких слоёв, и в каждом можно нечаянно наступить на мину. Я сам разбирал материалы по искам LinkedIn, Meta и Reddit, читал жалобу LinkedIn против Nubela — и вынес оттуда простую вещь. Суд начинается там, где вы нарушаете конкретное правило. Не там, где качаете данные.

Разложу эти слои по порядку.

Публичные данные ≠ разрешённые данные

Главное заблуждение звучит так: «данные открыты в интернете, значит их можно брать». История с hiQ против LinkedIn это заблуждение сначала подкормила, а потом разрушила. Апелляционный суд признал, что сбор публичных профилей вряд ли нарушает CFAA — американский закон о несанкционированном доступе к компьютерам. Многие выдохнули. Но hiQ всё равно проиграла — по другому основанию: нарушение пользовательского соглашения LinkedIn.

Вот граница номер один. Доступ к публичной странице и право её систематически выкачивать — разные вещи. CFAA может вас и не задеть. А договор задевает.

Условия использования — это договор, который вы подписали кликом

Когда вы регистрируете аккаунт, вы соглашаетесь с ToS. Там почти всегда прямым текстом запрещён автоматический сбор. Именно на этом строится иск LinkedIn против Nubela: используешь залогиненный аккаунт для парсинга — нарушаешь договор, к которому присоединился добровольно.

Клик по чекбоксу превращается в подписанный договор

Отсюда практический вывод, которым я пользуюсь сам:

  • Сбор данных без авторизации, из полностью открытого доступа — зона относительно светлая.
  • Сбор под своим или купленным аккаунтом, в обход технических ограничений — зона тёмная, здесь и живут повестки.

Разница между этими двумя сценариями и есть та самая граница между «инструментом» и «ответчиком».

Развилка: путь инструмента и путь судебного молотка

Дело Meta против Bright Data: почему платформа не всегда выигрывает

Чтобы картинка не выглядела односторонней. В споре Meta с Bright Data суд встал на сторону скрапера: сбор публичных данных без входа в аккаунт нарушением договора не признали. Логика та же, что и в hiQ, только результат для платформы обратный.

Я читаю это так: суды всё чаще смотрят, был ли логин и обход защиты. Нет авторизации — нет и договорного нарушения, за которое можно зацепиться. Появляется аккаунт — появляется договор, а вместе с ним и риск.

Технические барьеры трогать опасно

Есть отдельный слой — обход технической защиты. В США это DMCA, статья 1201: закон про взлом средств контроля доступа. Капчи, rate-limit, блокировки по IP, требование залогиниться — если вы это активно ломаете, разговор смещается от «сбора данных» к «взлому». А это уже другая весовая категория ответственности.

Здесь моё правило простое: уважайте robots.txt и не выламывайте замки. Замедлились, получили 403, упёрлись в капчу — остановитесь. Это сигнал притормозить, обход тут придумывать не надо.

GDPR и EU AI Act: европейский слой про персональные данные

Даже если с доступом всё чисто, остаётся вопрос: что вы собираете. Имена, email, должности, фото — это персональные данные. В Европе действует GDPR, и он применяется к обработке независимо от того, лежали данные открыто или нет. Публичность в интернете не отменяет обязанностей: основание для обработки, права людей на удаление, ограничения на профилирование.

EU AI Act добавил свежий пласт для тех, кто парсит ради обучения моделей. Свежий спор Reddit против Perplexity — как раз про это: платформы всё активнее защищают контент от сбора под ИИ. Собираете данные для датасета — теперь держите в голове ещё и вопрос доступа, и то, что скажет европейский регулятор про источник.

Как я определяю свою границу на практике

Сведу всё к чек-листу, который держу в голове перед любым проектом по сбору данных:

  1. Логин. Захожу под аккаунтом? Тогда я связан условиями использования. Сто раз подумаю.
  2. Защита. Обхожу ли капчу, лимиты, блокировки? Если да — останавливаюсь.
  3. Персональные данные. Собираю данные о людях, особенно из ЕС? Нужно основание и уважение к GDPR.
  4. Цель. Обучаю модель на чужом контенте? Смотрю на AI Act и позицию платформы.
  5. robots.txt и нагрузка. Не гружу сайт так, будто устраиваю DoS.

Если по всем пяти пунктам чисто — я работаю спокойно. Загорается хоть один — торможу и советуюсь с юристом.

Парсинг в 2026 году остаётся рабочим инструментом. Суд начинается там, где сбор данных превращается в обход правил: чужой аккаунт, сломанная защита, персональные данные без основания. Держитесь по светлую сторону этих трёх линий — и повестка обойдёт вас стороной.

теги #парсинг#скрапинг#cfaa#tos#судебная практика#доступ

один разговор — и поймём, чем я могу помочь.

В эпоху ИИ человеку нужен человек. Сяду рядом и доведу до результата — встреча длится столько, сколько нужно. Без скрипта продаж и пакетов «за 999 000 ₽». Если пойму, что помочь не смогу, — скажу сразу.