База User-Agent для парсинга: 100 000 строк (браузеры, ОС, устройства)
ЧТО ВНУТРИ
ZIP-архив 2 МБ, внутри — текстовый файл user_agents.txt: 100 000 строк, одна строка — один User-Agent. В распакованном виде 13 МБ. Кодировка UTF-8, перевод строки LF, без BOM. Все строки уникальны (проверено без учёта регистра), битых и пустых нет. Архив нужен потому, что площадка не принимает контент больше 10 МБ.
ДЛЯ ЧЕГО
Ротация User-Agent в парсерах и краулерах, тесты антибот-защиты, нагрузочные прогоны, аналитика клиентских устройств, заполнение тестовых данных, проверка редиректов под мобильные и десктопные клиенты.
СОСТАВ (посчитано по файлу, не заявлено)
- Браузеры: Chrome 56,8 %, Safari 19,4 %, Firefox 8,7 %, Opera 3,8 %, IE 11 1,6 %, Edge 1,3 %, Samsung Internet 1,2 %, Yandex 0,5 %, прочие (UC Browser, Pale Moon, Amazon Silk, встроенные WebView) 6,7 %.
- Операционные системы: Android 57,1 %, Windows 17,4 %, iOS 8,8 %, Linux 7,0 %, macOS 6,4 %, ChromeOS 0,4 %.
- Устройства: мобильные 67,8 %, настольные 32,2 % (телефоны 54,2 %, планшеты 13,6 %) — близко к распределению реального веб-трафика.
- Редких строк 77 %: их нет ни в одном популярном топ-списке из 10 000 значений, то есть база не повторяет то, что лежит в открытом доступе на первых страницах поиска.
ЧЕГО В БАЗЕ НЕТ
Строк поисковых роботов и библиотек (Googlebot, python-requests и подобных) — оставлены только браузерные User-Agent, которые не вызывают подозрений у антибот-систем.
ЧЕМ ОТЛИЧАЕТСЯ ОТ БЕСПЛАТНЫХ СПИСКОВ
Бесплатные наборы — это 100–10 000 строк, которые видит каждый. Здесь 100 000 строк, собранных из открытых датасетов под свободными лицензиями (MIT, BSD, Apache) и очищенных от дублей: из 825 328 просканированных строк осталось 350 719 уникальных, в базу взяты 100 000.
ФОРМАТ И ВЫДАЧА
Один User-Agent на строку, готов к построчному чтению в Python, PHP, Node.js и любом другом языке. Распакуйте архив — и файл сразу готов к работе. Файл скачивается сразу после оплаты, повторно — в любой момент в личном кабинете.
Отзывов от покупателей не поступало.