Перейти к содержимому
2base
Материал 2base

2BASE vs самостоятельный парсинг: реальная стоимость DIY-сбора B2B-данных

Каждые 2-3 месяца появляется команда, которая решает «зачем нам 2BASE — соберём сами». На бумаге всё открытое, источники бесплатны, ChatGPT напишет парсер. Реальность: первая версия данных в production — 8 месяцев, бюджет 8-15M ₽, и в итоге результат хуже коммерческого продукта. Цифры — из 4 проектов клиентов 2BASE, которые до подписания пробовали DIY и быстро свернулись.

Почему DIY кажется простым

Открытые источники B2B-данных в РФ:

  1. ЕГРЮЛ/ЕГРИП — выгрузка XML на egrul.nalog.ru, обновляется ежедневно
  2. Реестр МСП — XML на nalog.gov.ru, обновляется 10-го числа каждого месяца
  3. ГИРБО — БФО ЮЛ, выгрузка через bo.nalog.ru
  4. открытые источники — публичный API + парсинг карточек организаций
  5. Госзакупки — XML на zakupki.gov.ru
  6. Реестры регуляторов (Росздравнадзор, Росалкогольрегулирование, Росаккредитация...) — десятки разных форматов

Кажется: написать 6-8 парсеров, сложить в БД, добавить веб-интерфейс — задача на 2-3 месяца команде из 1 разработчика и 1 аналитика.

Что покажет первый месяц DIY

Неделя 1-2: «Просто выгрузим ЕГРЮЛ»

Реальность: ФНС публикует EGRUL.zip — ZIP-архив на 25 ГБ, содержащий несколько тысяч XML-файлов. Один полный update — 4 часа на загрузку, 12 часов на парсинг (XML тяжёлый). У ФНС нет API «дай свежие записи» — каждый раз нужен дельта-расчёт самостоятельно.

Парсер должен: понимать переменные структуры XML (десятки «вариантов»), мапить ОКВЭД на справочник, определять ликвидации, обрабатывать смену директора и т.д.

Месяц 2: «Дублей слишком много»

Открываете БД, видите: компания «Ромашка ООО» с одним и тем же ИНН представлена в 3-4 версиях с разными адресами и директорами. Это потому что ФНС публикует историю изменений, и нужна логика «текущая запись + history».

Перепишите схему, перепарсите, потеряете 2 недели.

Месяц 3: «Контактов нет»

Из ЕГРЮЛ не выходит ни одного телефона, email, сайта компании. Только юридический адрес. Подключаете публичные API источников: первые 2K запросов бесплатны, дальше — деньги. Стоит 10K ₽/мес за «корпоративный» лимит. Парсер не учитывает rate limit, открытые источники банит на день. Чините — теряете ещё неделю.

Через открытые источники покрытие контактами — 35%. Остальные 65% компаний без контактов остаются.

Месяц 4: «А что с ИП?»

ЕГРИП в открытом виде на egrul.nalog.ru показывает только ФИО + ИНН + ОГРНИП + ОКВЭД. Адрес — нет (защита персональных данных). У ИП в открытые источники индекс редко встречается. У SmartFNS-выгрузки доступ — платный.

Покрытие контактами по ИП = 8%.

Месяц 5: «Реестр МСП»

nalog.gov.ru/opendata имеет API. Но: данные обновляются только 10-го числа, между обновлениями статус «Микро/Малое/Среднее» меняется в реальности. Нужен ежемесячный re-import + мердж с ЕГРЮЛ-таблицей по ИНН. Логика «свежий статус выигрывает», обработка дубликатов.

Месяц 6: «БФО»

bo.nalog.ru API не документирован, ограничения по запросам в час неизвестны, формат данных меняется без объявления. Стабильно подключиться — недели работы реверс-инжиниринга. Иногда после очередного обновления всё ломается.

Месяц 7-8: «Веб-интерфейс»

Сделать UI для поиска и фильтрации, экспорта CSV, работы с правами доступа — отдельный проект. Если делать «по-нормальному» с авторизацией, аудитом, биллингом — ещё 3-4 месяца работы фронт + бэк.

Скрытые расходы DIY

КатегорияГод 1 (₽)Год 2 (₽)
Разработка (1 senior + 1 middle)5 400 0003 600 000
Аналитик данных1 800 0001 800 000
Инфраструктура (сервер, БД, бэкапы)360 000360 000
публичные API источников + другие источники240 000240 000
Поддержка и фиксы парсеров900 000
Юр. сопровождение (152-ФЗ, 38-ФЗ)200 000100 000
Простой при поломках источников500 000500 000
ИТОГО8 500 0007 500 000

Сравните с тарифом 2BASE «Бизнес» — 238 800 ₽/год. Разница в 35× в первый год.

Качественные различия

Даже с бюджетом 10M ₽ DIY-результат уступает коммерческим решениям по нескольким причинам:

1. Глубина источников

2BASE подключает 12+ открытых реестров (ФНС, ФССП, ЦБ, Росстат, Росздравнадзор, Росаккредитация, госзакупки и т.д.). DIY-команда обычно ограничивается 3-4 основными.

2. Качество дедупликации

Один и тот же ИП может появляться в ЕГРИП, в реестре МСП, в открытые источники с разными вариациями ФИО. Свести их в одну запись с >95% точностью — нетривиальная ML-задача (fuzzy matching, нормализация, geo-кластеризация). У DIY обычно 70-80% точность.

3. Свежесть данных

Профессиональные источники синхронизируются ежедневно. DIY-команды чаще раз в неделю или вообще руками. Через 2-3 месяца DIY-данные «устаревают» по сравнению с реальностью на 10-15%.

4. Правовая инфраструктура

2BASE имеет согласованную с юристами политику обработки данных по 152-ФЗ + 209-ФЗ. DIY-проект редко проходит эту проверку: либо игнорируют, что грозит штрафами Роскомнадзора, либо нанимают юристов с нуля.

Когда DIY всё-таки оправдан

В трёх случаях:

  1. Очень узкая ниша. Например, «производители мёда в Татарстане». В 2BASE 200 компаний, и они не покрывают вашу специфику. DIY-парсинг сайтов и Telegram-каналов — реальный путь, но заранее ограничьте бюджет.
  2. Сверхспецифические поля. Например, «у каких компаний есть колл-центр > 100 операторов». В 2BASE такого нет, у никого не публикуется. Нужен ML-классификатор по сайтам компаний.
  3. Стратегический data-актив. Если данные — ваш core-актив, и вы строите Data-as-a-Service-бизнес, конкурирующий с 2BASE. Тогда у вас другая calculus, и расходы оправданы.

Для всех остальных кейсов — outbound, ABM, lead generation, market research — DIY не окупится.

Гибридная модель

Часто оптимальное решение — 2BASE + DIY для специфики:

  • Базовые данные о компаниях — из 2BASE (12.3M записей, 24 поля)
  • Специфические сигналы — DIY-парсинг (вакансии, упоминания в новостях, тех-стек сайтов)
  • Объединение — на ИНН в вашем складе данных (data warehouse)

Бюджет: 240K ₽ (2BASE) + 1.5M ₽ (узкоспецифические парсеры) = 1.7M ₽. На порядок меньше полного DIY, при этом качество базы в разы выше.

FAQ

Можно ли арендовать данные у 2BASE через API без подписки на интерфейс?

Да, есть тариф «API only» — данные доступны через REST/GraphQL без интерфейса. Это удобно для интеграции в свой data-pipeline или Data-as-a-Service.

Какая часть DIY-затрат — это поддержка?

На второй год обычно 60-70% бюджета первого года уходит на поддержку: парсеры ломаются, источники меняют форматы, дубли копятся. Это «болото», на которое DIY-команды не закладывают бюджет.

Можно ли купить готовый dump ЕГРЮЛ?

Технически — да, ФНС иногда продаёт «полные выгрузки», но они без контактов и без свежих изменений. Это сырьё, не готовый B2B-продукт.

А если использовать ChatGPT для парсинга?

ChatGPT хорошо генерирует первый черновик кода, но 95% работы DIY-проекта — это дальнейшая отладка под реальные edge cases (битые XML-записи, изменение форматов, rate-limit handling). LLM не сокращает это время на порядок, только в 2-3×.


Связанные: 2BASE vs SPARK · 2BASE vs ZoomInfo · API документация

Нужна база компаний?

11 772 841 организаций и ИП с контактами

Открыть конструктор
Онлайн Реестры ФНС от 14.06.2026 · контакты от 17.07.2026
11 772 841 компаний и ИП Источник: ЕГРЮЛ / ЕГРИП