Архив · репо вне текущей выдачи
FIRST SEEN 2026-09-14 · LAST SEEN 2026-09-29
Потенциал заработка
C48/100
СПРОС82
Тема горячая: AI coding assistants и AI observability растут, а история локальных AI coding conversations становится ценной для backup, analytics, evals, fine-tuning и governance.
ЗАХВАТ34
Сам raw extractor имеет слабый ров: парсеры легко копируются, схемы локальных приложений нестабильны, а крупные observability/evals vendors уже продают более широкий value layer.
ДОСТУП68
MIT разрешает коммерческое использование, Python stdlib-only снижает friction, но bus factor 1, отсутствие релизов/пакетов и чувствительность данных мешают enterprise adoption.
«Потенциал топит capture: raw extractor легко скопировать без security/search/evals/governance слоя.»
Рыночный анализ · Обзор
kruzovic7/ai-data-extractor — локальный Python-экстрактор, который собирает историю чатов из разных AI coding assistants и приводит её к единому JSONL-формату для бэкапа, анализа и подготовки данных.
Developer tools / AI coding assistant data extraction / local-first AI data tooling / LLMOps-adjacent AI observabilityЗРЕЛОСТЬ · ЭКСПЕРИМЕНТ
Что делает
Проект автоматически ищет локальные хранилища Claude Code, Codex CLI, Cursor, Windsurf, Trae, Continue, Gemini CLI, OpenCode, Cline/Roo Code и Aider. Он читает разные форматы — JSONL, SQLite, JSON-деревья и markdown-транскрипты — и нормализует переписки в единый JSONL со структурой messages/source/session_id и дополнительными полями вроде timestamps, project path, tool calls, code context и diffs, если они есть в исходном инструменте.
Какую боль решает
Решает боль разработчиков и команд, у которых рабочая AI-память размазана по нескольким AI-редакторам и локальным агентам, может исчезнуть при очистке локальной базы и плохо пригодна для бэкапа, анализа, evals или fine-tuning без единого экспорта.
Сценарии использования
- +Бэкап AI coding history перед переустановкой Cursor, Claude Code, Windsurf или очисткой локальных баз.
- +Personal analytics: понять, сколько и как разработчик использует разные AI coding tools.
- +Подготовка датасета для fine-tuning или evals на собственных coding conversations с обязательной чисткой секретов.
- +Миграция между инструментами: сохранить Claude Code, Cursor или Aider-сессии в нейтральном формате.
- +Корпоративный audit/export: выгрузить локальные AI-сессии разработчиков для security review, policy enforcement и knowledge retention.
Целевой пользователь
Individual power developers, AI engineers, ML engineers, команды с активным использованием Claude Code/Cursor/Windsurf/Cline/Roo/Aider, а также DevTools, platform engineering и security teams.
Open-source аналоги
Сфокусирован на Claude Code: search, bulk export, Markdown/JSON/HTML; не мульти-ассистентный extractor.
Cursor-only, но богаче как продукт: CLI/library, list/view/search/export/migrate/backup/restore, npm install, 14 releases.
MCP server для поиска Claude Code history, чтобы ассистент сам мог вытаскивать прошлый контекст.
Импортирует coding agents и web chats в searchable SQLite DB, есть CLI/TUI/MCP/API, search, export и resume; концептуально более продуктовый, но с меньшим traction.
Rust CLI для Claude Code, Codex и Cursor; ориентирован на agent skill usage, BM25 search, resume/export.
VS Code extension для поиска, анализа и управления AI chat history, prompt library, token analytics и MCP server; лицензия MIT + Commons Clause, то есть не OSI-certified open source.
Не extractor для analytics, а secret/credential scrubber по AI assistant logs; поддерживает много похожих источников.
Позиционирование
ai-data-extractor сейчас выглядит ранним лидером по GitHub traction среди универсальных open-source инструментов формата “extract to normalized JSONL”, но не лидером по product depth. Риск в том, что без search, UI, security, evals и governance он быстро станет “ещё одним парсером”.
Коммерческие аналоги
Observability, tracing, evals и deployment tooling для LLM/agent apps.
LangChain объявляла funding $125M при valuation $1.25B; среди упомянутых клиентов/пользователей — Replit, Clay, Harvey, Rippling, Cloudflare, Workday, Cisco. Точность зависит от публичных заявлений компании и материалов анализа.
Developer$0/seat/month, до 5k base traces/month
Plus$39/seat/month, до 10k base traces/month
Enterprisecustom
Usageнапример $1.50/LCU и $1.00/LSU
Open-source LLM observability, tracing, prompt management, evals и datasets.
Pricing page указывает trusted-by logos вроде Canva, Twilio, SumUp, Brevo для Pro-tier context; точные revenue/users не раскрыты.
Hobbyfree, 50k units/month, 30 days data access, 2 users
Core$29/month, 100k units included, $8/100k overage
Pro$199/month
Teams add-on$300/month
Enterprise$2499/month
LLM gateway и observability: request logging, cost tracking, analytics, caching и rate limits.
YC W23; Helicone объявила acquisition by Mintlify, сервисы остаются live в maintenance mode; YC profile также помечает company status as Acquired.
Hobbyfree, 10k requests/month, 1 GB storage
Pro$79/month
Team$799/month
Enterprisecustom
AI evals, tracing, datasets, experiments, human/LLM scoring и observability.
Braintrust объявляла $36M Series A; total funding $45M указан в материалах анализа. Показатели пользователей и выручки не подтверждены.
Starter$0/month, $10 credits, 1 GB processed data, 10k scores
Pro$249/month, $100 credits, 5 GB processed data, 50k scores
Enterprisecustom
OverageStarter $4/GB и $2.50/1k scores; Pro $3/GB и $1.50/1k scores; retention $0.50/GB/month
Enterprise LLM evals platform: prompt management, observability, logs, monitoring, human review и CI/CD evals.
Публично приводит enterprise customer quotes, например Dixa и Filevine; точная выручка/users не раскрыты.
Try for free2 members, 50 eval runs, 10k logs/month
Enterprisecontact sales
VPC deployment add-oncustom
AI gateway, observability, prompt management и guardrails: universal API, fallbacks, load balancing, retries, logs, traces, feedback и alerts.
Точные users/revenue не раскрыты; позиционирование — production LLM apps.
Production$49/month, 100k recorded logs/month, overage +$9 per additional 100k requests
Enterprisecustom
Gateway, observability, evals, monitoring и tracing для AI agents.
Сайт заявляет “80 trillion+ tokens”; customer proof: Retell AI quote about scaling from 5M to 500M+ monthly API calls. Это vendor-claim, не audited metric.
Free$0, 100k logs, 1k scores, 5 datasets, 2 evaluators, 5 prompts
Team$199/month, billed yearly
Enterprisecontact sales
Additional usage$8/100k logs; $1/1k scores
AI observability, trace waterfalls, model analytics и workflow tracing.
Публичные revenue/users не подтверждены; продукт находился в Free Beta в собранном анализе.
Free Beta$0, 1 project, up to 5,000 traces/month, 7-day retention
Propricing TBD after beta
Teampricing TBD after beta
Broader LLM app development platform: workflows, prompts, evals и deployments.
Точные revenue/users не подтверждены.
Base fee$10/month
Usage credits$1 = 1 credit; credits тратятся на AI responses, web search, image generation и third-party APIs
Текущая монетизация проекта
Подтверждённой монетизации самого ai-data-extractor не видно: в README нет cloud, paid support, hosted version или enterprise plan; homepage отсутствует, registry install отсутствует, релизов нет. Проект выглядит как hobby/community OSS project на MIT, а не open-core business.
Коммерческий потенциал
ПОТЕНЦИАЛ · СРЕДНИЙ
Заработать можно, но не на скрипте-экстракторе как таковом, а на privacy-first AI coding history platform для команд: extraction → secret redaction → search → analytics → eval/fine-tuning datasets → governance.
Спрос и рынок
Спрос выглядит высоким: AI coding assistants становятся массовыми, а LLM/AI observability превращается в отдельный бюджет. В собранном анализе приведены оценки Grand View Research по AI code assistants ($8.5B в 2025 → $42.9B к 2033, CAGR 22.5%), MarketsandMarkets по AI observability ($1.24B в 2025 → $12.75B к 2032, CAGR 40%), JetBrains про 90% developers using AI tools at work in January 2026 и Gartner projection про LLM observability investments in 50% GenAI deployments by 2028. Но сама либа занимает небольшой слой ingestion/extraction; большие деньги лежат в governance, observability, evals, security и enterprise workflows.
Ров / защищённость
Сейчас рва почти нет: локальные парсеры легко переписать, а конкуренты могут быстро добавить те же sources. Потенциальный ров возможен через connector knowledge для приватных схем, большой анонимизированный fixture/test corpus, security/compliance слой, интеграции с LangSmith/Langfuse/Braintrust/SIEM/SSO и trust moat в виде signed releases, reproducible builds, no telemetry и security audits.
Модели монетизации
- +Open-source core + paid Team/Enterprise с admin console, SSO, RBAC, audit logs, policy packs, SLA и enterprise support.
- +Self-hosted AI Coding History Lake: Docker/on-prem appliance для ingest локальных exports, search, dedup, project mapping, token/cost analytics и tool usage analytics.
- +Security-first product: secret scanning/redaction, DLP/policy controls и безопасный export для команд.
- +Dataset preparation for evals/fine-tuning: очистка, dedup, role normalization, quality scoring и экспорт в Braintrust/LangSmith/Langfuse/OpenAI fine-tuning formats.
- +Paid connector maintenance для Cursor/Windsurf/Claude Code и других приватных схем, которые будут ломаться.
- +Desktop или VS Code продукт: unified history search, semantic search, replay, export, scheduled backups и freemium/cloud sync/team sharing.
Что нужно, чтобы сделать продукт
- +PyPI, Homebrew, uv install или packaged binaries.
- +Версионированные релизы.
- +Test fixtures по каждому supported source.
- +CI и parser regression tests.
- +Стабильная schema spec для output JSONL.
- +Secret scanning/redaction встроенный по умолчанию.
- +Deduplication, incremental sync и resume.
- +Local search UI, TUI или VS Code extension.
- +Optional local semantic search/embeddings.
- +Export targets: LangSmith, Langfuse, Braintrust, OpenTelemetry, Hugging Face datasets.
- +Admin/team mode.
- +Документация по legal/privacy/ToS.
- +Policy controls: exclude paths, exclude projects, redact file paths, redact tokens.
- +Telemetry-free/offline guarantee.
- +Security review, threat model и signed releases.
⚖ ЛИЦЕНЗИЯ · МОЖНО ЛИ КОММЕРЦИАЛИЗИРОВАТЬ
MIT — коммерчески благоприятно: можно использовать, модифицировать, встраивать в закрытый продукт и продавать поддержку, hosted или self-hosted продукт. Нет GPL/AGPL copyleft-ограничений. Главный риск не в лицензии кода, а в данных, которые извлекаются: proprietary code, secrets, PII, client data и Terms of Service исходных AI tools.
Риски и подводные камни
ВЫСОКИЙЮР. СЕРАЯ ЗОНА
AI coding histories могут содержать API keys, database URLs, proprietary code, client data и PII; экспорт в JSONL увеличивает риск утечки.
ВЫСОКИЙПРОЧЕЕ
Cursor/Windsurf/Trae используют undocumented private schemas; README прямо говорит, что схемы менялись, а heuristic extraction является best-effort.
ВЫСОКИЙСЛАБЫЙ РОВ
Парсеры локальных файлов легко переписать; уже есть Claude/Cursor/hstry/ChatWizard и смежные аналоги.
ВЫСОКИЙЮР. СЕРАЯ ЗОНА
Пользователь отвечает за права на extracted data; corporate code и assistant outputs могут быть ограничены policy, contract или ToS исходных AI tools.
СРЕДНИЙЗАВИСИМОСТЬ ОТ АВТОРА
Bus factor = 1, проект очень новый, нет релизов и пакетной дистрибуции; для enterprise это blocker.
СРЕДНИЙПРОЧЕЕ
Hosted SaaS конфликтует с privacy positioning: самые ценные данные одновременно самые чувствительные, поэтому self-hosted/local-first вероятнее SaaS.
СРЕДНИЙКОНКУРЕНЦИЯ
Cursor, Claude, GitHub или другие vendors могут добавить official export/search/history APIs и обесценить сторонний extractor.
СРЕДНИЙПРОЧЕЕ
Истории чатов шумные, содержат ошибки, tool outputs и proprietary snippets; fine-tuning без очистки может ухудшить модель или нарушить права.
СРЕДНИЙПРОЧЕЕ
839 stars и +122 за 7 дней могут быть трендовым всплеском без долгосрочного retention.
Достоверность разбора
УВЕРЕННОСТЬ · СРЕДНЯЯgpt-5.5 · 2026-09-19 · ОКНО 7D
Оговорки / что не проверено
- +Звёзды OSS-аналогов и сведения о релизах/установке взяты из собранного анализа и не перепроверялись в текущем ответе.
- +Для коммерческих аналогов цены, tiers и scale взяты из собранного разбора; не все цифры подтверждены ≥2 независимыми источниками.
- +Оценки рынка Grand View Research, MarketsandMarkets, Gartner и JetBrains приведены из собранного разбора без повторной верификации и без URL в исходном тексте.
- +Vendor claims вроде “80 trillion+ tokens” у Keywords AI и customer logos/quotes у Langfuse/Humanloop являются заявлениями поставщиков, не audited metrics.
- +Сведения о funding/valuation LangChain и funding Braintrust приведены из собранного разбора; независимая проверка ≥2 источниками здесь не выполнялась.
- +Выводы о коммерческом потенциале, moat, рисках и подходящих моделях монетизации являются аналитической оценкой на основе предоставленных фактов, а не подтверждёнными рыночными метриками.
- +Данные о том, что сам автор не монетизирует проект, основаны на README/GitHub enrichment и собранном разборе; отсутствие платной версии не является доказательством полного отсутствия частных коммерческих планов.
- +Правовые оценки по ToS исходных AI tools и правам на extracted data являются общими caveats; конкретные Terms of Service каждого инструмента не анализировались постатейно.
ИСТОЧНИКИ (28)