Что такое web scraping: простое объяснение для B2B
Web scraping, веб-скрапинг или веб-скрейпинг — это автоматический сбор публичной информации со страниц сайтов. В B2B-задаче результатом должна быть не выгрузка «всего подряд», а проверяемая таблица компаний и контактов.
Коротко
- Web scraper извлекает открытые данные со страниц сайта и приводит их к структуре: компания, контакт, источник, статус проверки.
- Для поиска компаний обычно начинают с карт или веб-поиска, а сайты используют для добора email, реквизитов и соцсетей.
- Корректный сценарий работает с публичными бизнес-страницами и не обходит авторизацию, капчи, paywall или другие ограничения доступа.
Содержание
Что значит web scraping
Web scraping — это процесс, в котором программа открывает доступные страницы, находит нужные фрагменты и сохраняет их в понятную структуру. На русском чаще говорят «парсинг сайтов», «веб-скрапинг» или «скрейпинг сайтов»; web scraper — инструмент, который выполняет эту работу.
Для бизнеса цель не в том, чтобы собрать максимум текста. Нужен список компаний с полезными полями: сайт, телефон, email, адрес, юридические реквизиты и ссылка на страницу, где найден контакт. Так менеджер может проверить данные и выбрать подходящий канал связи.
Web scraper, парсер и email scraper: в чём разница
Термины пересекаются, но описывают разные задачи в одном процессе.
- Web scraper. Общее название инструмента, который собирает публичные данные со страниц сайта.
- Парсер сайтов. Практическое русскоязычное название того же сценария: проверка сайта компании и сохранение контактов в таблицу.
- Email scraper. Узкий сценарий поиска опубликованных корпоративных email: на главной, в футере, контактах, реквизитах и публичных документах.
- Google Maps scraper или 2GIS scraper. Инструмент для сбора карточек организаций из карт. После этого сайт компании можно проверить отдельно, чтобы добрать контакты.
Парсер сайтов Просто Парсера решает второй этап: проверяет публичные страницы уже найденных компаний и сохраняет источник каждого найденного поля.
Как выглядит рабочий B2B-сценарий
- Найдите компании.Соберите карточки из Яндекс Карт, 2ГИС, Google Maps или веб-поиска.
- Уберите повторы.Сопоставьте название, домен, телефон и адрес, чтобы филиалы и дубли не засоряли базу.
- Проверьте сайты.Ищите контакты на главной странице, в футере, contacts, about, support, реквизитах, оферте и публичных PDF-документах.
- Сохраните источник.Записывайте URL и тип страницы: это помогает отличить официальный корпоративный контакт от случайного текста.
- Разделите базу по каналам.Телефон, корпоративный email, сайт и мессенджер дают разные сценарии дальнейшей работы.
Такой подход полезнее, чем пытаться получить все поля из одного источника. Карты хорошо находят локальные компании, а сайт чаще даёт email и реквизиты.
Какие данные стоит собирать
Минимальная B2B-строка включает название компании, источник, сайт или телефон, город и категорию. Для обогащённой базы добавляют email, адрес, юридическое лицо, ИНН, ОГРН, мессенджеры, соцсети и ссылку на источник каждого контакта.
Отсутствие поля — нормальный результат. Если компания не публикует email, лучше оставить ячейку пустой, чем подставлять предполагаемый адрес. Подробный сценарий проверки опубликованных контактов есть в материале «Парсинг сайтов для B2B».
Ограничения и качество базы
Web scraping не означает доступ к закрытой информации. Рабочий и безопасный сценарий ограничен публично доступными страницами компаний. Не используйте инструмент для обхода авторизации, капч, paywall, технических ограничений или для сбора личных контактов сотрудников.
Перед рассылкой, звонками или загрузкой базы в CRM проверьте правила источника, требования вашей юрисдикции, применимые нормы о рекламе, персональных данных и антиспаме. Официальные контакты компании и личные данные физлиц нужно разделять.
Частые вопросы
Web scraping и парсинг сайтов — это одно и то же?
В большинстве B2B-задач да: оба термина описывают сбор публичных данных со страниц. Для пользователя важнее, какие поля найдены и можно ли проверить их источник.
Web scraper найдёт email у всех компаний?
Нет. Email есть не на каждом сайте, а некоторые компании используют только форму связи. Отсутствие email не означает, что компания нерелевантна: для части ниш достаточно телефона или сайта.
Чем Google Maps scraper отличается от web scraper?
Google Maps scraper собирает карточки организаций из карт. Web scraper проверяет публичные страницы сайта компании. Обычно их используют последовательно: сначала находят компании, затем обогащают контакты.