Сбор данных из Instagram: что действительно работает (а что нет)

Scraping Instagram: What Actually Works (And What Doesn't)

Если вы зашли сюда в поисках способа «массового сбора списков подписчиков в Instagram путем сбора данных из учетных записей, в которых пользователи вошли в систему», — знайте: этот подход уже не работает. Компания Meta заблокировала его в течение последних нескольких лет, а неофициальные библиотеки на Python, которые его реализовывали (Instagramy, старые форки instagram-scraper, режим «logged-in» в instaloader), с 2022 года либо не работают, либо представляют активную опасность.

Устали от того, что IP-блокировки тормозят вашу работу? Воспользуйтесь нашими прокси-серверами из частных сетей для высокоскоростной ротации или безопасными прокси-серверами от интернет-провайдеров, чтобы обеспечить максимальный срок службы аккаунта.

В результате получается более узкая, но более честная картина: в Instagram есть значимые общедоступные данные, которые можно собирать; официальный Graph API охватывает конкретный бизнес-сценарий, а несколько легальных методов позволяют восполнить пробел между ними. В этой статье мы рассмотрим, что на самом деле работает при сборе данных из Instagram в 2026 году, а что нет, а также где пролегают правовые и этические границы.

Что можно собирать, а что нельзя

Самое главное, что нужно понять перед тем, как приступить к проекту по работе с данными Instagram в 2026 году: ограничения на доступ стали более жесткими. Существуют открытые и закрытые данные, и разрыв между ними стал шире, а его соблюдение — более строгим, чем это признается в большинстве старых статей.

Доступно для общего пользования без входа в систему (можно скопировать):

  • Данные публичного профиля — имя пользователя, полное имя, биография, количество подписчиков (приблизительное), количество подписок, количество публикаций, статус подтверждения, контактная информация для деловых целей в бизнес-аккаунтах
  • Публичные записи в открытых аккаунтах — изображения, URL-адреса видео, подписи, хештеги, количество лайков, количество комментариев
  • Комментарии к публичным записям — текст, имя пользователя автора, отметка времени, количество лайков
  • Публичные ленты по хештегам — последние и самые популярные посты по любому хештегу
  • Страницы общедоступных мест — посты с геотегами этих мест

Требуется официальный Graph API (только для ваших собственных учетных записей):

  • Подробная аналитика по аккаунтам, которыми вы владеете или которыми управляете
  • Доступ к личным сообщениям (только к своим собственным)
  • Публикация и управление контентом
  • Данные об эффективности рекламных объявлений
  • Аналитические данные по вашим собственным публикациям

Запрещено независимо от метода:

  • Данные личного аккаунта — всё, что недоступно для просмотра пользователям, не вошедшим в систему
  • Личные сообщения между другими пользователями
  • Адреса электронной почты, номера телефонов или иная личная информация
  • Подробные списки подписчиков в больших объемах для аккаунтов любого значимого размера (Instagram жестко ограничивает частоту запросов даже при законном доступе к данным о подписчиках)
  • Публикации в личных аккаунтах (а также, всё чаще, даже в общедоступных)

Последний момент, касающийся списков подписчиков, заслуживает особого внимания. Первоначальное название этой статьи было «Сбор данных о подписчиках в Instagram», и описанный в ней алгоритм действий — войти в аккаунт, собрать данные о подписчиках целевого аккаунта, повторить — как раз и является тем, что компания Meta стремится предотвратить больше всего. Даже официальный Graph API не предоставляет списки подписчиков в каком-либо пригодном для использования виде. Считайте, что в 2026 году сбор данных о подписчиках любой конкретной учетной записи практически невозможен, а любой «скрепер», утверждающий, что делает это надежно, либо не работает, либо лжет, либо через несколько недель перестанет работать.

Почему старые методы не работают

Стоит подробно объяснить, что именно изменилось, ведь в интернете до сих пор полно устаревших руководств:

Сбор данных с помощью аутентификации ушел в прошлое. Вход в Instagram с помощью реальной учетной записи через автоматизированный инструмент, а затем сбор данных в рамках сеанса этой учетной записи — такой подход был стандартным примерно с 2015 по 2020 год. Сейчас системы безопасности учетных записей Meta выявляют такую схему в течение нескольких минут. Учетная запись сначала получает запрос на подтверждение, затем подвергается временной блокировке, а в итоге — постоянному бану. Это происходит независимо от того, используете ли вы instagrapi, instaloader в режиме входа в систему, Selenium с реальной учетной записью в Instagram или любой из графических инструментов типа «Instagram scraper», которые запрашивают ваши учетные данные. Не делайте этого.

Официальный Graph API перестал поддерживать данный сценарий использования. В период с 2022 по 2025 год ограничения на использование API компании Meta постепенно ужесточались. Устаревший Instagram Basic Display API был признан устаревшим. Текущий Graph API по-прежнему существует, но его цель — помочь компаниям управлять собственными аккаунтами в Instagram, а не проводить аналитику по чужим аккаунтам, не заниматься исследованием конкурентов и не агрегировать данные. Если ваш сценарий использования заключается в «получении данных по аккаунтам, которые мне не принадлежат», официальный API — не то, что вам нужно.

Большинство библиотек Python для «парсинга Instagram» больше не поддерживаются или не работают. Список действующих библиотек гораздо короче, чем можно было бы предположить, судя по старым статьям. К любой библиотеке, которая не обновлялась в течение последних шести месяцев, следует относиться как к неработающей, пока не будет доказано обратное.

IP-адреса центров обработки данных сразу попадают под подозрение. Это не новость, но порог чувствительности стал более строгим. Система обнаружения ботов Instagram выявляет диапазоны IP-адресов центров обработки данных ещё до завершения первого запроса во многих случаях. Прокси-серверы для частных пользователей — это минимальный уровень защиты; мобильные прокси обеспечивают более высокую степень защиты.

requests имеет обнаруживаемый отпечаток TLS. Значение по умолчанию в Python requests Библиотека инициирует TLS-рукопожатие, которое система защиты Instagram от ботов распознает как автоматическое, независимо от IP-адреса и заголовков. В 2026 году стандартным способом обхода этой проблемы является curl_cffi, который имитирует стек TLS реального браузера.

Что действительно работает: три эффективных метода

Для законного сбора общедоступных данных из Instagram в 2026 году реалистичными вариантами являются:

Способ 1: Официальный Graph API (только для ваших собственных аккаунтов)

Если вам нужна аналитика по аккаунтам, которыми вы владеете или управляете в рамках своей коммерческой деятельности — аккаунтам вашего бренда, аккаунтам ваших клиентов, аккаунтам, к которым у вас есть прямой доступ, — то Instagram Graph API — это именно то, что вам нужно. Этот API стабилен, поддерживается официально и предоставляет подробные данные, недоступные в открытом Интернете: статистику на уровне отдельных постов, демографические данные аудитории (анонимизированные и агрегированные), показатели Stories и разбивку показателей вовлеченности.

Чего он не делает: не предоставляет данные по счетам, которыми вы не управляете. API был специально разработан так, чтобы исключить такую возможность.

Для настройки потребуется аккаунт Meta Developer, приложение для Facebook, подтверждение статуса компании для этого приложения, а также аккаунт Instagram Business или Creator, привязанный к странице Facebook. Весь процесс занимает несколько часов, если всё проходит гладко, и дольше — в противном случае.

Способ 2: Прямой сбор данных из общедоступных веб-ресурсов

Что касается данных об аккаунтах, которые вам не принадлежат — анализ конкурентов, мониторинг бренда, отслеживание хештегов, поиск инфлюенсеров — то в этом случае лучше всего использовать прямой скрапинг открытых веб-ресурсов. Веб-интерфейс Instagram взаимодействует с бэкенд-конечными точками GraphQL; эти конечные точки возвращают структурированные данные в формате JSON, с которыми гораздо проще работать, чем с HTML-кодом.

Скелет на языке Python с использованием curl_cffi:

python

from curl_cffi import requests
import json

def get_public_profile(username):
    url = f"https://www.instagram.com/{username}/?__a=1&__d=dis"
    headers = {
        "x-ig-app-id": "936619743392459",  # Public app ID used by web frontend
        "Accept": "*/*",
        "Accept-Language": "en-US,en;q=0.9",
    }
    response = requests.get(
        url,
        headers=headers,
        impersonate="chrome120",  # curl_cffi browser impersonation
        proxies={"https": "http://USER:PASS@proxy.example.com:8080"},
    )
    if response.status_code != 200:
        return None
    return response.json()

Несколько практических советов, которых нет в большинстве руководств:

  • Внутренняя структура конечных точек регулярно меняется — Instagram меняет направление doc_id параметры конечных точек GraphQL каждые несколько недель. Все, что вы создадите, потребует постоянного обслуживания.
  • «Стикки-сессии» необходимы для пагинации. Ленты хэштегов, цепочки комментариев и любые пагинированные конечные точки используют токены курсора, привязанные к вашей IP-сессии. Смена IP-адреса в процессе пагинации приводит к потере действительности токена курсора, в результате чего ваш скрипт перестает работать без каких-либо предупреждений.
  • Ограничение скорости применяется довольно строго даже при работе с общедоступными данными. Разумным начальным значением является 1 запрос каждые 3–5 секунд с каждого IP-адреса с отсрочкой при получении любого ответа 429 или 401.
  • Мобильные конечные устройства часто имеют более либеральные ограничения по скорости, чем настольные. По этой причине некоторые скриперы направляют все запросы через мобильный API.

Этот метод работает, но требует значительных затрат на обслуживание. Конечные точки меняются, эффективность обнаружения повышается, и то, что работало в прошлом месяце, в следующем месяце может потребовать исправлений.

Способ 3: API для управляемого сбора данных

Для большинства команд, которым требуются данные из Instagram, но которые не могут выделить инженерные ресурсы на обслуживание скрейпера, оптимальным решением станет управляемый API для сбора данных. Эти сервисы обеспечивают работу инфраструктуры сбора данных и возвращают данные в формате JSON; оплата производится за каждый запрос.

Стоит обратить внимание на следующие доступные на данный момент варианты: скрейпер для Instagram от ScrapFly, «акторы» Instagram от Apify (поддерживаемые сообществом, существует несколько различных вариантов для разных задач), набор данных Instagram и API SERP от Bright Data, а также ряд менее крупных сервисов (SociaVault, различные поставщики «API Instagram», появившиеся после того, как Meta прекратила поддержку Basic Display API).

Компромиссы:

  • Плюс: не требует обслуживания. Поставщик сам занимается ротацией прокси-серверов, обходом систем обнаружения, изменением конечных точек и разбором данных.
  • Плюс: быстрее запускать проект. Вы интегрируете API, а не создаете инфраструктуру.
  • Недостаток: при увеличении масштабов затраты на каждый запрос суммируются. При объёме 100 тыс. запросов в месяц с точки зрения затрат обычно выгоднее использовать простой скрапинг с помощью собственных прокси-серверов, предназначенных для частного использования — при условии, что вы уже создали необходимую инфраструктуру.
  • Недостаток: риск, связанный с поставщиком. Если скрейпинг поставщика будет заблокирован, ваш конвейер перестанет работать до тех пор, пока он не устранит неполадку.
  • Недостаток: качество данных варьируется. Некоторые поставщики предоставляют более чистые и полные данные, чем другие. Перед принятием окончательного решения проведите тестирование на небольшой выборке.

Для большинства команд оптимальной отправной точкой является управляемый API. Переходить на собственный скрапинг следует только в том случае, если затраты или особые требования к данным оправдывают инвестиции в разработку.

Уровень прокси

Какой бы метод вы ни выбрали, уровень IP имеет значение. В случае «сырого» сбора данных (метод 2) ответственность за это лежит на вас. В случае управляемых API (метод 3) этим занимается поставщик, но «под капотом» он использует прокси-серверы для частных пользователей — именно поэтому API не является бесплатным.

Что касается именно Instagram, то требования следующие:

  • Только частные или мобильные IP-адреса. Центр обработки данных определяется ещё до завершения первого запроса. Прокси-серверы интернет-провайдеров располагаются между пользователем и сервером и в некоторых случаях работают, но менее эффективны при доступе к сложным целям, таким как Instagram.
  • Сохранение сеансов для рабочих процессов с пагинацией. Ленты по хештегам, цепочки комментариев, конечные точки подписчиков (если они вообще доступны) — всё, что использует курсор, требует одного и того же IP-адреса на протяжении всего сеанса. Ротация IP-адресов нарушает эту связь.
  • Географическая таргетировка на уровне стран для контента, ориентированного на конкретные регионы. Instagram предоставляет слегка различающиеся результаты в зависимости от географического положения IP-адреса, с которого поступает запрос; если вы собираете данные по конкретным регионам (например, о бразильских инфлюенсерах или японских трендах по хештегам), ваши IP-адреса должны находиться в этих регионах.
  • IP-адреса мобильных операторов — наиболее эффективный способ обхода системы обнаружения. Системы Instagram доверяют IP-адресам мобильных операторов (AT&T, T-Mobile, Verizon, Vodafone) больше, чем IP-адресам частных пользователей. Стоимость выше, но и вероятность успеха при работе с самыми сложными конечными точками соответственно выше.

Домашние и мобильные прокси от IPBurger идеально подходят для сбора данных из открытых источников — чистые IP-адреса, таргетинг по странам, «прилипающие» сессии при необходимости — и этот общий принцип действует независимо от провайдера: при значительных объемах именно IP-уровень определяет, завершится ли сбор данных или застрянет на отметке 30 %.

Правовой и этический аспект

Именно этот аспект в исходном посте был освещён недостаточно полно, а в 2026 году он действительно имеет большое значение. Стоит уточнить:

Сбор данных из открытых источников в США, как правило, является законным. Решение по делу «hiQ Labs против LinkedIn» (Девятый окружной апелляционный суд, вынесенное в 2022 году) установило, что сбор общедоступных данных не нарушает Закон о компьютерном мошенничестве и злоупотреблении. Это относится к общедоступным профилям, постам, хештегам и комментариям в Instagram — любой пользователь может просматривать их без входа в систему, и их сбор в больших объемах, как правило, является правомерным.

Нарушения Условий использования — это совсем другое дело. Даже если скрапинг является законным, Условия использования Instagram запрещают автоматизированный доступ. Компания Meta может возбудить гражданский иск (она уже делала это) и заблокировать любые аккаунты, связанные со скрапингом. Закон о компьютерном мошенничестве и злоупотреблении (CFAA) и Условия использования — это отдельные вопросы; соблюдение одного из них не означает, что вы не нарушаете другой.

GDPR распространяется на данные пользователей из ЕС независимо от того, являются ли они общедоступными. Именно в эту ловушку попадает большинство разработчиков скриптов из США. Если вы собираете данные о гражданах ЕС — даже общедоступные — вам необходимо иметь задокументированное правовое основание в соответствии с GDPR, четкую политику хранения данных и возможность обрабатывать запросы на удаление. Общедоступность данных не освобождает их от действия GDPR.

Не допускайте следующих схем независимо от правового статуса:

  • Вход в систему с использованием поддельных учетных записей для доступа к закрытым данным
  • Сбор и хранение персональных данных, выходящих за рамки той информации, которая доступна общественности
  • Перепубликация скопированного контента способами, нарушающими авторские права
  • Использование данных, полученных с помощью скрейпинга, для целенаправленных преследований или доксинга
  • Перепродажа персональных данных, полученных путем сбора с веб-сайтов, без законных коммерческих целей

Простая эвристика: если вам было бы неловко объяснять свою операцию по сбору данных журналисту или юристам Meta, то лучше передумайте. Правовая основа для сбора данных из открытых источников действительно существует, но она весьма ограничена.

Разумный начальный рабочий процесс

Если вы сейчас разрабатываете проект, связанный с данными Instagram, и не знаете, с чего начать:

  1. Чётко определите, какие именно данные вам нужны. В большинстве проектов не требуется вся информация. Сузьте сферу охвата — это снизит затраты, уменьшит площадь уязвимости и прояснит ваши правовые риски.
  2. Проверьте, поддерживает ли это Graph API. Если вас интересуют только учетные записи, которыми вы управляете, воспользуйтесь официальным API. Оно стабильно, бесплатно и поддерживается.
  3. Для проектов, связанных с открытыми данными, начинайте с управляемого API — например, ScrapFly, Apify или чего-то подобного. Настройте интеграцию, запустите проект и посмотрите, действительно ли эти данные приносят бизнес-ценность.
  4. Переходите на собственный скрейпинг только в том случае, если это оправдано с точки зрения затрат или масштаба. В большинстве проектов в этом нет необходимости. Затраты на техническое обслуживание скрейпера для Instagram являются значительными и носят постоянный характер.
  5. Если вы решите реализовать проект собственными силами, подходите к этому как к полноценным инвестициям в разработку. Стационарные или мобильные прокси-серверы, curl_cffi для идентификации по отпечаткам TLS, фиксированных сеансов, экспоненциального отката, мониторинга изменений конечных точек и выделенного времени на техническое обслуживание. Это настоящий проект, а не скрипт, написанный за выходные.
  6. Если речь идет о данных из ЕС, с самого начала следует обеспечить соответствие требованиям GDPR. Обеспечить соответствие требованиям задним числом гораздо сложнее, чем предусмотреть его изначально.

Честный вывод

Эпоха «массового сбора подписчиков в Instagram» 2018–2021 годов подошла к концу. Методы, которые были характерны для этого периода — сбор данных с использованием учетных данных, «фермы» аккаунтов для обхода ограничений по частоте запросов, сбор списков подписчиков — больше не работают надежно, приводят к блокировке аккаунтов и все чаще нарушают закон.

Реалистичная картина на 2026 год выглядит более ограниченной, но вполне достижимой: значительный объем общедоступных данных можно собрать с помощью правильного скрапинга открытого веб-пространства или управляемых API, официальный Graph API охватывает аккаунты, принадлежащие компаниям, а надлежащая инфраструктура (домашние или мобильные прокси, современная обработка TLS, «липкие» сессии, тщательное ограничение скорости запросов) обеспечивает устойчивость процесса сбора общедоступных данных. Ничто из этого не даст вам доступа к личным личным сообщениям или масштабным спискам подписчиков. Но всего этого достаточно для легитимных бизнес-сценариев — мониторинга конкурентов, оценки состояния бренда, отслеживания хештегов, поиска инфлюенсеров, анализа общественного мнения — для поддержки которых, по идее, и был написан исходный пост.

Методы, которые работают, менее увлекательны, чем те, которые не работают. При этом именно они остаются актуальными и в следующем году.

Успех вашего бизнеса напрямую зависит от времени безотказной работы ваших прокси-серверов. Перейдите на статические прокси-серверы бизнес-класса от интернет-провайдера, чтобы обеспечить выделенную пропускную способность и непоколебимую надежность. ИЛИ внедрите ротирующиеся прокси-серверы для частных пользователей и достигните коэффициента успешности сбора данных на уровне 99,9%.

В этой статье:
Хватит беспокоиться о качестве вашего прокси

Наши статические прокси-серверы от интернет-провайдера гарантированно чисты и на 100 % выделены исключительно для вас. Никаких общих нагрузок — только высокая производительность.

Получить статические прокси-серверы интернет-провайдеров

Еще глубже погрузиться в тему

Как безопасно управлять несколькими скрытыми аккаунтами на eBay, не рискуя получить бан
Прокси для электронной коммерции
дональд
Как безопасно управлять несколькими «скрытыми» аккаунтами на eBay в 2026 году, не рискуя получить бан

Ведение «скрытого» аккаунта на eBay в 2026 году сопряжено с большим риском, чем думает большинство продавцов. Маржа ошибки постоянно сокращается. В 2024 году eBay заблокировал более 37 000 аккаунтов из-за IP-адресов

Прокси-серверы
Эй Джей Тейт
Как мы едва не потеряли более 1500 постоянных клиентов и как нам удалось их удержать

Наши самые преданные клиенты ценят только одно — свой постоянный и быстрый статический «свежий»/частный IP-адрес. Эти «свежие»/частные и статические IP-адреса относятся к диапазонам, которые

Готовы попробовать прокси, которые справятся с этой задачей?

Настраивается менее чем за 60 секунд. Ему доверяют более 24 100 компаний по всему миру.

Setup in <60 seconds
Отменить в любое время
Круглосуточная поддержка в режиме реального времени