Github Trends®
6028 findingsmedian surprise 0.00592window 1 day
UNIT / TREND-MONITOR · REV 2.6
[ 1 day window ]
SOURCE: own snapshots
РЕПО НЕТ В ОКНЕ 30D. ПОКАЗАН FINDING ИЗ ОКНА 1D (1 day) — РАНГ #14.
FINDING #14 · UNIT ID 1183934088
Anakin-Inc/anakin
Open-source web scraping API. Turn any website into clean markdown or structured JSON. Anti-detect browser, proxy auto-selection, self-hosted. One command: make up
[ GO ][ ORG ]ЗАРАБОТОК D · 44/100[ GITHUB ↗ ]
SURPRISE SCORE
0.00

Score Breakdown

SURPRISE0.61
ENGAGEMENT1.36
FRESHNESS1.00
SCORE = SURPRISE × ENGAGEMENT^0.7 × FRESHNESS × VISIBILITY × CONFIDENCE
SURPRISE = WINDOW STARS / DAYS / (AUDIENCE + FLOOR)
15% OF STARS IN ARCHIVE

Growth Telemetry

VELOCITY /D
384.00
ACCEL
0.00
RETENTION
0.0%
PEAK 2026-08-04 · FORK-RETENTION 0.0% · 384 STARS / WINDOW

Author Audience

AUDIENCE
589
FOLLOWERS
37
OWNER ★
1,492

Engagement Signals

FORKS
81
ISSUE AUTH
0
PR AUTH
0
UNIQUE STARGAZERS 384 / 384 (DIVERSITY 1.00)

Потенциал заработка

D44/100
СПРОС82
Деньги в теме есть: web scraping нужен для AI/RAG, agents, price intelligence, SEO, lead enrichment и monitoring; собранные рыночные оценки дают порядок от сотен миллионов до нескольких миллиардов долларов.
ЗАХВАТ34
Удерживать ценность тяжело: OSS-сегмент уже занят Firecrawl, Crawl4AI, Scrapy/Crawlee, а коммерческий рынок — Bright Data, Apify, Zyte, ScraperAPI и ScrapingBee; AnakinScraper пока ранний v0.1.1 с 2,091 stars.
ДОСТУП46
Для автора доступ хороший благодаря Anakin.io и AGPL-защите, но для стороннего коммерческого использования AGPL-3.0, малый bus-factor, молодость проекта и scraping/compliance риски заметно ограничивают доступ.
«Коммерческий потенциал топит capture: ниша денежная, но уже занята сильными OSS-лидерами и платными вендорами.»

Рыночный анализ · Обзор

AnakinScraper OSS — self-hosted API для веб-скрейпинга, который превращает сайты в чистый Markdown или структурированный JSON для AI/RAG-задач.
web scraping / AI data extraction / self-hosted crawler / anti-detect browser infrastructureЗРЕЛОСТЬ · РАСТЁТ
ЯЗЫК
Go
ЛИЦЕНЗИЯ
AGPL-3.0
РЕЕСТР
none
РЕЛИЗ
v0.1.1
КОНТРИБЬЮТОРЫ
3
Что делает

Проект поднимает локальный scraping API: принимает URL, пробует получить страницу через HTTP, при необходимости fallback-ится на anti-detect browser Camoufox, а затем на внешний API handler. Результат очищается и отдаётся как LLM-ready Markdown, а при наличии Gemini API key может дополнительно превращаться в структурированный JSON. В комплекте есть REST API, batch/async режимы, domain configs, proxy auto-selection и React dashboard.

Какую боль решает

Снимает типичную боль скрейпинга для AI-приложений: JS-страницы, блокировки, прокси, CAPTCHA/anti-bot, очистку HTML и приведение результата к формату, который можно сразу подавать в RAG, AI agents или LLM-пайплайны.

Сценарии использования
  • Сбор страниц документации, блогов и каталогов в Markdown для RAG-пайплайнов.
  • Batch scraping URL-ов с передачей результата в AI-agent или LLM.
  • Извлечение структурированного JSON из произвольных страниц через Gemini.
  • Внутренний self-hosted scraping gateway в компании без полной зависимости от Firecrawl, Bright Data или ScrapingBee.
  • Снижение затрат на платные scraping API за счёт локальной цепочки HTTP/browser и внешнего API только как fallback.
Целевой пользователь

Backend, data и AI-разработчики, а также команды, строящие RAG, AI agents, price monitoring, market intelligence, lead enrichment и web data pipelines.

Open-source аналоги

firecrawl/firecrawlСИЛЬНЕЕ160,600
Самый прямой OSS-аналог: web-to-Markdown/JSON API для AI, open-source + hosted SaaS; существенно больше комьюнити, SDK и hosted-продукт.
unclecode/crawl4aiСИЛЬНЕЕ76,000
LLM-friendly crawler с Markdown/JSON и развивающимся Cloud API; Python, Apache-2.0, значительно больше adoption.
scrapy/scrapyСМЕЖНЫЙ63,600
Зрелый классический Python crawling/scraping framework, поддерживаемый Zyte и сообществом; не AI-first и не zero-config API.
apify/crawleeСИЛЬНЕЕ25,200
TypeScript/Node.js crawler framework с Playwright/Puppeteer, proxy rotation, storage и интеграцией с Apify cloud.
browserbase/stagehandСМЕЖНЫЙ23,700
AI browser automation SDK с natural language + code, extract/act/observe; больше про browser agents, чем bulk scraping API.
microsoft/playwrightСМЕЖНЫЙ91,000
Фундаментальная browser automation платформа, а не готовый scraper API; Anakin использует Playwright-подобный browser layer через Camoufox.
Позиционирование

AnakinScraper — догоняющий/нишевый игрок с позиционированием «self-hosted Firecrawl + anti-detect + proxy auto-selection», но не лидер OSS-категории: сегмент уже занят Firecrawl и Crawl4AI, а foundation-слой — Scrapy, Crawlee и Playwright.

Коммерческие аналоги

Anakin.ioB2BFREEMIUM
Коммерческий API автора: URL Scraper, Crawl, Search API, Agentic Research, Browser API и Wire actions.
Homepage заявляет 99.5% success rate за последние 90 дней и наличие SOC 2 Type II / ISO 27001 / GDPR; это self-claim вендора.
Starterfree, 300 credits
Pro$19/mo, 5,000 credits
Scale$100/mo, 120,000 credits
Enterprisecustom
FirecrawlB2BFREEMIUM
Hosted web scraping, crawling и search API для AI, Markdown/JSON и browser interaction.
GitHub traction указан как 160.6k stars; сайт указывает YC-backed и SOC 2 Type 2.
Free1,000 credits/mo
Hobby$16/mo yearly, 5,000 pages
Standard$83/mo, 100,000 pages
Growth$333/mo, 500,000 pages
Scale$599/mo, 1M credits
ApifyB2BFREEMIUM
Cloud platform для Actors, web scraping, browser automation, datasets и proxy.
Pricing page приводит customer outcome-метрики: 28M+ AI chats для Intercom Fin и 800+ retailers monitored для EU Commission.
Free$0
Starter$29/mo + PAYG
Scale$199/mo + PAYG
Business$999/mo + PAYG
Compute unitsпримерно $0.2/CU до $0.13/CU по плану
Enterprise scraping API, proxies, JS rendering, CAPTCHA solving, validation и datasets.
Pricing page указывает 20,000+ customers worldwide; меню заявляет 400M+ global IPs для residential proxies.
Free5K records/mo
PAYG$1.5 / 1K records
Scale$499/mo, 384,000 records included, $1.3 / 1K extra
Enterprisecustom
ScrapingBeeB2BFREEMIUM
Developer scraping API с headless browser, rotating proxies, JS rendering и extraction rules.
Публичный масштаб пользователей/выручки на pricing page не раскрыт.
Free1,000 free credits
Freelance$49/mo, 250,000 credits
Startup$99/mo, 1,000,000 credits
Business$249/mo, 3,000,000 credits
Business+$599/mo, 8,000,000 credits
ScraperAPIB2BFREEMIUM
Scraping API с JS rendering, premium proxies, CAPTCHA/anti-bot и structured data APIs.
Публичный масштаб не найден на pricing page.
Free1,000 credits
Hobby$49/mo, 100,000 credits
Startup$149/mo, 1M credits
Business$299/mo, 3M credits
Scaling$475/mo, 5M credits
Professional$975/mo, 10.5M credits
Advanced$1,975/mo, 21.5M credits
Zyte APIB2BПО ПОТРЕБЛЕНИЮ
API от Zyte/Scrapinghub для автоматического выбора HTTP/browser/proxies/extraction по сложности сайта.
Zyte поддерживает Scrapy вместе с community; выручка/пользователи не раскрыты.
PAYG HTTP$0.13–$1.27 / 1K requests
PAYG browser rendered$1.01–$16.08 / 1K requests
Commitments$100/$200/$500 per month со скидками
Oxylabs Web Scraper APIB2BПОДПИСКА
Web Scraper API, proxies, Web Unblocker и data collection для market, price и SEO monitoring.
Pricing page указывает ISO/IEC 27001:2022 certified products; масштаб клиентов на странице не раскрыт.
Web Scraper APIstarts from $49/mo
Residential proxiesfrom $6/GB
Web Unblockerstarts from 9.4; валюта/единица в собранном snippet неявная
BrowserbaseB2BFREEMIUM
Cloud browser infrastructure для Playwright, Puppeteer, Selenium и Stagehand, а также agents, fetch и search API.
Stagehand указан как 23.7k GitHub stars; docs snippet заявлял 700k+ weekly downloads, это вендорский claim.
Free$0, 3 concurrent browsers, 1 browser hour
Developer$20/mo, 100 browser hours, then $0.12/browser hr
Startup$99/mo, 500 browser hours, then $0.10/browser hr
Search$7/1k calls
Fetchfrom $1/1k calls
Browse AIB2B / B2CFREEMIUM
No-code AI web scraper и monitoring robots для non-technical users.
Публичный масштаб не найден на pricing page.
Free$0
Personal$19/mo billed annually, 12,000 credits/year
Professional$69/mo billed annually, 60,000 credits/year
Premiumfrom $500/mo billed annually
OctoparseB2B / B2CFREEMIUM
No-code desktop/cloud scraper с templates, cloud runs, scheduling и export API.
Публичный масштаб пользователей/выручки в найденном pricing snippet не раскрыт.
Free10 tasks, 50,000 rows/month
Standardfrom $69/mo
Professional$199/mo sale / $249/mo regular
Enterprisecustom
Текущая монетизация проекта

Да, проект уже монетизируется через Anakin.io. README содержит встроенный anakin.io API handler и ANAKIN_API_KEY как fallback для сложных сайтов, а Anakin.io продаёт облачный API с free/Pro/Scale/Enterprise тарифами. Модель выглядит как commercial SaaS + AGPL OSS funnel, а не чистое хобби; GitHub Sponsors не подтверждался.

Коммерческий потенциал

ПОТЕНЦИАЛ · СРЕДНИЙ

Заработать можно, но в первую очередь Anakin-Inc, а не стороннему форку. Лучший путь — не продавать «ещё одну библиотеку», а развивать managed scraping API или self-hosted enterprise gateway с SLA, proxy pool, anti-bot success metrics, compliance controls и hosted fallback.

Спрос и рынок

Спрос высокий: web scraping нужен для AI/RAG, price intelligence, SEO, real estate, finance, recruiting, lead enrichment и monitoring. Рыночные оценки расходятся, но порядок — сотни миллионов–несколько миллиардов долларов: web scraper software оценён в $922.63M в 2026 → $2.50B к 2034, broader web scraping market — до $2.28B к 2030, AI-driven web scraping — $10.2B в 2026, но последняя оценка выглядит широкой/агрессивной.

Ров / защищённость

Сейчас ров слабый: handler chain, browser rendering, Markdown extraction, proxy rotation и JSON extraction уже есть у конкурентов или легко повторяемы. Потенциальный ров может появиться через proprietary success telemetry по доменам, обучаемую proxy-selection модель, готовые domain configs, premium anti-bot browser stack, enterprise compliance и сеть fallback providers с оптимизацией cost/success.

Модели монетизации
  • Hosted API / usage-based credits
  • Managed self-hosted / enterprise deployment
  • Premium fallback handlers
  • Vertical scrapers / Wire actions
  • Support & compliance package
  • Observability layer для success rate, proxy scores, cost per successful page, CAPTCHA rate и drift detection
Что нужно, чтобы сделать продукт
  • Доказанные benchmark-и success rate против Firecrawl, Crawl4AI, ScrapingBee и Bright Data.
  • Production-grade auth, quotas, billing, multi-tenancy и team management.
  • Стабильные SDK для Python, JavaScript и Go.
  • Hosted dashboard с logs, retries, proxy analytics и cost analytics.
  • Compliance-политики: robots.txt mode, PII redaction, allow/deny lists, audit trail.
  • Документация по AGPL/SaaS deployment boundaries.
  • Больше контрибьюторов и регулярных релизов.
⚖ ЛИЦЕНЗИЯ · МОЖНО ЛИ КОММЕРЦИАЛИЗИРОВАТЬ
AGPL-3.0 — коммерчески использовать можно, но закрытый SaaS или закрытые модификации поверх этой кодовой базы рискованны. Для Anakin-Inc лицензия логична: она защищает проект от закрытых конкурирующих форков и направляет коммерческий спрос в Anakin.io. Для стороннего стартапа безопаснее использовать библиотеку как отдельный unmodified service с юридической проверкой либо договариваться о commercial license, если автор её предложит.
Риски и подводные камни
ВЫСОКИЙЛИЦЕНЗИЯ
AGPL-3.0 ограничивает закрытые деривативы и SaaS: если модифицированный сервис доступен по сети, обычно нужно предоставить corresponding source. Для proprietary embedding или closed SaaS fork это серьёзный риск; для автора — защитная open-core лицензия.
ВЫСОКИЙКОНКУРЕНЦИЯ
Firecrawl, Crawl4AI, Bright Data, Apify, Zyte, ScraperAPI и ScrapingBee уже имеют аудиторию, цены, инфраструктуру и доверие.
ВЫСОКИЙЮР. СЕРАЯ ЗОНА
Anti-detect, proxy rotation, scraping behind logins и обход Cloudflare/DataDome/Akamai могут конфликтовать с ToS, privacy, data protection и platform policies.
ВЫСОКИЙЗАВИСИМОСТЬ ОТ АВТОРА
Проект очень молодой: v0.1.1, около 3 контрибьюторов; для enterprise scraping ключевой критерий — стабильный success rate, а не только наличие фич.
СРЕДНИЙПРОЧЕЕ
Browser rendering, proxies, CAPTCHA solving и LLM extraction быстро съедают маржу; заявленная экономия через fallback chain требует реальных cost benchmarks.
СРЕДНИЙЗАВИСИМОСТЬ ОТ АВТОРА
Молодая unverified GitHub organization, малый bus-factor и резкий underdog star growth; bot_flag отрицательный, но enterprise-доверие ещё нужно строить.
СРЕДНИЙПРОЧЕЕ
README продаёт self-hosted/no cloud dependencies, но structured JSON требует Gemini, а сложные сайты — внешний API fallback.

Достоверность разбора

УВЕРЕННОСТЬ · СРЕДНЯЯgpt-5.5 · 2026-08-04 · ОКНО 1D
Оговорки / что не проверено
  • Цены, stars и market-size цифры взяты из собранного анализа на 4 августа 2026 и не перепроверялись заново в этой задаче.
  • Часть scale-метрик коммерческих продуктов — self-claims вендоров, а не независимо подтверждённые показатели.
  • Требование подтверждать каждую коммерческую цифру минимум двумя источниками не выполнено для большинства pricing/scale claims; confidence поэтому не high.
  • Для ScrapingBee, ScraperAPI, Zyte, Oxylabs, Browse AI и Octoparse публичный масштаб пользователей/выручки не был найден в собранных данных.
  • Для Oxylabs Web Unblocker значение «starts from 9.4» имеет неявную валюту/единицу в snippet и помечено как неуверенное.
  • Оценки market size из Research and Markets и Straits Research относятся к разным определениям рынка; AI-driven web scraping оценка выглядит широкой/агрессивной.
  • Юридический вывод по AGPL-3.0 и scraping/compliance рискам является аналитической оценкой, а не юридической консультацией.
  • Сравнение конкурентной силы OSS-проектов основано на собранных GitHub stars, позиционировании и известных категориях, но без нового deep benchmark тестирования.
  • Success rate, экономия 90%+ на API costs и эффективность Thompson Sampling взяты из README/собранного анализа и не подтверждены независимыми benchmark-ами.
ИСТОЧНИКИ (25)

Why This Is A Finding

Anakin-Inc/anakin собрал 384 звёзд за окно, тогда как у автора всего 37 подписчиков — эффективная аудитория ≈ 589. Это даёт surprise-индекс 0.61 (звёзды относительно охвата автора, а не в абсолюте). Удержание форков 0.0% и 0 внешних контрибьюторов отделяют реальный инструмент от разовой вспышки. Акселерация положительная — рост ещё не выдохся.

METRICS IN CONTEXT

MEDIAN ACROSS ALL 6028 FINDINGS · Δ vs MEDIAN · PERCENTILE = SHARE RANKED BELOW
METRICVALUEMEDIANΔ MEDPERCENTILE
SCORE0.760.00+0.76ABOVE 100%
VELOCITY384.0010.00+374.00ABOVE 99%
RETENTION0.0%0.0%0.0 PPABOVE 0%
FORKS81436-355ABOVE 21%
SURPRISE0.610.01+0.60ABOVE 99%