Каждые 2-3 месяца появляется команда, которая решает «зачем нам 2BASE — соберём сами». На бумаге всё открытое, источники бесплатны, ChatGPT напишет парсер. Реальность: первая версия данных в production — 8 месяцев, бюджет 8-15M ₽, и в итоге результат хуже коммерческого продукта. Цифры — из 4 проектов клиентов 2BASE, которые до подписания пробовали DIY и быстро свернулись.
Почему DIY кажется простым
Открытые источники B2B-данных в РФ:
- ЕГРЮЛ/ЕГРИП — выгрузка XML на egrul.nalog.ru, обновляется ежедневно
- Реестр МСП — XML на nalog.gov.ru, обновляется 10-го числа каждого месяца
- ГИРБО — БФО ЮЛ, выгрузка через bo.nalog.ru
- открытые источники — публичный API + парсинг карточек организаций
- Госзакупки — XML на zakupki.gov.ru
- Реестры регуляторов (Росздравнадзор, Росалкогольрегулирование, Росаккредитация...) — десятки разных форматов
Кажется: написать 6-8 парсеров, сложить в БД, добавить веб-интерфейс — задача на 2-3 месяца команде из 1 разработчика и 1 аналитика.
Что покажет первый месяц DIY
Неделя 1-2: «Просто выгрузим ЕГРЮЛ»
Реальность: ФНС публикует EGRUL.zip — ZIP-архив на 25 ГБ, содержащий несколько тысяч XML-файлов. Один полный update — 4 часа на загрузку, 12 часов на парсинг (XML тяжёлый). У ФНС нет API «дай свежие записи» — каждый раз нужен дельта-расчёт самостоятельно.
Парсер должен: понимать переменные структуры XML (десятки «вариантов»), мапить ОКВЭД на справочник, определять ликвидации, обрабатывать смену директора и т.д.
Месяц 2: «Дублей слишком много»
Открываете БД, видите: компания «Ромашка ООО» с одним и тем же ИНН представлена в 3-4 версиях с разными адресами и директорами. Это потому что ФНС публикует историю изменений, и нужна логика «текущая запись + history».
Перепишите схему, перепарсите, потеряете 2 недели.
Месяц 3: «Контактов нет»
Из ЕГРЮЛ не выходит ни одного телефона, email, сайта компании. Только юридический адрес. Подключаете публичные API источников: первые 2K запросов бесплатны, дальше — деньги. Стоит 10K ₽/мес за «корпоративный» лимит. Парсер не учитывает rate limit, открытые источники банит на день. Чините — теряете ещё неделю.
Через открытые источники покрытие контактами — 35%. Остальные 65% компаний без контактов остаются.
Месяц 4: «А что с ИП?»
ЕГРИП в открытом виде на egrul.nalog.ru показывает только ФИО + ИНН + ОГРНИП + ОКВЭД. Адрес — нет (защита персональных данных). У ИП в открытые источники индекс редко встречается. У SmartFNS-выгрузки доступ — платный.
Покрытие контактами по ИП = 8%.
Месяц 5: «Реестр МСП»
nalog.gov.ru/opendata имеет API. Но: данные обновляются только 10-го числа, между обновлениями статус «Микро/Малое/Среднее» меняется в реальности. Нужен ежемесячный re-import + мердж с ЕГРЮЛ-таблицей по ИНН. Логика «свежий статус выигрывает», обработка дубликатов.
Месяц 6: «БФО»
bo.nalog.ru API не документирован, ограничения по запросам в час неизвестны, формат данных меняется без объявления. Стабильно подключиться — недели работы реверс-инжиниринга. Иногда после очередного обновления всё ломается.
Месяц 7-8: «Веб-интерфейс»
Сделать UI для поиска и фильтрации, экспорта CSV, работы с правами доступа — отдельный проект. Если делать «по-нормальному» с авторизацией, аудитом, биллингом — ещё 3-4 месяца работы фронт + бэк.
Скрытые расходы DIY
| Категория | Год 1 (₽) | Год 2 (₽) |
|---|---|---|
| Разработка (1 senior + 1 middle) | 5 400 000 | 3 600 000 |
| Аналитик данных | 1 800 000 | 1 800 000 |
| Инфраструктура (сервер, БД, бэкапы) | 360 000 | 360 000 |
| публичные API источников + другие источники | 240 000 | 240 000 |
| Поддержка и фиксы парсеров | — | 900 000 |
| Юр. сопровождение (152-ФЗ, 38-ФЗ) | 200 000 | 100 000 |
| Простой при поломках источников | 500 000 | 500 000 |
| ИТОГО | 8 500 000 | 7 500 000 |
Сравните с тарифом 2BASE «Бизнес» — 238 800 ₽/год. Разница в 35× в первый год.
Качественные различия
Даже с бюджетом 10M ₽ DIY-результат уступает коммерческим решениям по нескольким причинам:
1. Глубина источников
2BASE подключает 12+ открытых реестров (ФНС, ФССП, ЦБ, Росстат, Росздравнадзор, Росаккредитация, госзакупки и т.д.). DIY-команда обычно ограничивается 3-4 основными.
2. Качество дедупликации
Один и тот же ИП может появляться в ЕГРИП, в реестре МСП, в открытые источники с разными вариациями ФИО. Свести их в одну запись с >95% точностью — нетривиальная ML-задача (fuzzy matching, нормализация, geo-кластеризация). У DIY обычно 70-80% точность.
3. Свежесть данных
Профессиональные источники синхронизируются ежедневно. DIY-команды чаще раз в неделю или вообще руками. Через 2-3 месяца DIY-данные «устаревают» по сравнению с реальностью на 10-15%.
4. Правовая инфраструктура
2BASE имеет согласованную с юристами политику обработки данных по 152-ФЗ + 209-ФЗ. DIY-проект редко проходит эту проверку: либо игнорируют, что грозит штрафами Роскомнадзора, либо нанимают юристов с нуля.
Когда DIY всё-таки оправдан
В трёх случаях:
- Очень узкая ниша. Например, «производители мёда в Татарстане». В 2BASE 200 компаний, и они не покрывают вашу специфику. DIY-парсинг сайтов и Telegram-каналов — реальный путь, но заранее ограничьте бюджет.
- Сверхспецифические поля. Например, «у каких компаний есть колл-центр > 100 операторов». В 2BASE такого нет, у никого не публикуется. Нужен ML-классификатор по сайтам компаний.
- Стратегический data-актив. Если данные — ваш core-актив, и вы строите Data-as-a-Service-бизнес, конкурирующий с 2BASE. Тогда у вас другая calculus, и расходы оправданы.
Для всех остальных кейсов — outbound, ABM, lead generation, market research — DIY не окупится.
Гибридная модель
Часто оптимальное решение — 2BASE + DIY для специфики:
- Базовые данные о компаниях — из 2BASE (12.3M записей, 24 поля)
- Специфические сигналы — DIY-парсинг (вакансии, упоминания в новостях, тех-стек сайтов)
- Объединение — на ИНН в вашем складе данных (data warehouse)
Бюджет: 240K ₽ (2BASE) + 1.5M ₽ (узкоспецифические парсеры) = 1.7M ₽. На порядок меньше полного DIY, при этом качество базы в разы выше.
FAQ
Можно ли арендовать данные у 2BASE через API без подписки на интерфейс?
Да, есть тариф «API only» — данные доступны через REST/GraphQL без интерфейса. Это удобно для интеграции в свой data-pipeline или Data-as-a-Service.
Какая часть DIY-затрат — это поддержка?
На второй год обычно 60-70% бюджета первого года уходит на поддержку: парсеры ломаются, источники меняют форматы, дубли копятся. Это «болото», на которое DIY-команды не закладывают бюджет.
Можно ли купить готовый dump ЕГРЮЛ?
Технически — да, ФНС иногда продаёт «полные выгрузки», но они без контактов и без свежих изменений. Это сырьё, не готовый B2B-продукт.
А если использовать ChatGPT для парсинга?
ChatGPT хорошо генерирует первый черновик кода, но 95% работы DIY-проекта — это дальнейшая отладка под реальные edge cases (битые XML-записи, изменение форматов, rate-limit handling). LLM не сокращает это время на порядок, только в 2-3×.
Связанные: 2BASE vs SPARK · 2BASE vs ZoomInfo · API документация