Github Trends®
9585 findingsmedian surprise 0.00648window 30 days
UNIT / TREND-MONITOR · REV 2.6
[ 30 days window ]
SOURCE: own snapshots
FINDING #338 · UNIT ID 652712035
lyogavin/airllm
AirLLM 70B inference with single 4GB GPU
[ JUPYTER NOTEBOOK ]ЗАРАБОТОК C · 51/100[ GITHUB ↗ ]
SURPRISE SCORE
0.00

Score Breakdown

SURPRISE0.0568
ENGAGEMENT0.33
FRESHNESS1.36
SCORE = SURPRISE × ENGAGEMENT^0.7 × FRESHNESS × VISIBILITY × CONFIDENCE
SURPRISE = WINDOW STARS / DAYS / (AUDIENCE + FLOOR)
23% OF STARS IN ARCHIVE

Growth Telemetry

VELOCITY /D
250.70
ACCEL
-7.40
RETENTION
10.9%
PEAK 2026-08-04 · FORK-RETENTION 51.4% · 7,521 STARS / WINDOW

Author Audience

AUDIENCE
4,374
FOLLOWERS
1,051
OWNER ★
33,228

Engagement Signals

FORKS
3,422
ISSUE AUTH
0
PR AUTH
0
UNIQUE STARGAZERS 7,521 / 7,521 (DIVERSITY 1.00)

Потенциал заработка

C51/100
СПРОС82
Деньги в AI inference есть: сторонние market reports оценивают рынок в сотни миллиардов долларов к 2030, а платёжная готовность видна по token pricing у LLM API и GPU-hour pricing у inference endpoints.
ЗАХВАТ38
AirLLM решает реальную боль, но ценность трудно защищать: сильные OSS runtimes и hosted API конкурируют по скорости, удобству и SLA, а аудитория часто cost-sensitive.
ДОСТУП74
Apache-2.0 позволяет коммерческое использование, есть PyPI/GitHub adoption и активность, но individual owner, около 10 contributors, bus-factor и отдельные model/dependency licenses остаются рисками.
«AirLLM топит слабая защищаемость ценности, а не спрос или лицензия.»

Рыночный анализ · Обзор

AirLLM — Python-библиотека, которая позволяет запускать очень большие open-weight LLM на слабой видеокарте за счёт подгрузки модели частями, а не полного размещения весов в VRAM.
LLM inference / memory-efficient inference / local AI / model offloading / open-weight LLM toolingЗРЕЛОСТЬ · РАСТЁТ
ЯЗЫК
Jupyter Notebook
ЛИЦЕНЗИЯ
Apache-2.0
РЕЕСТР
none
РЕЛИЗ
v3.1.0
КОНТРИБЬЮТОРЫ
10
Что делает

AirLLM снижает требования к видеопамяти при inference больших языковых моделей. README заявляет запуск 70B на 4GB GPU, Llama 3.1 405B на 8GB, DeepSeek-V3 671B на ~12GB и Kimi K3 2.8T на <4GB за счёт послойной или поэкспертной streaming-подгрузки. Цена подхода — перенос bottleneck в скорость диска, CPU↔GPU transfer и общий I/O.

Какую боль решает

Решает боль дорогого железа: обычно 70B+ модели требуют GPU с десятками или сотнями GB VRAM либо облачного API, а AirLLM даёт возможность хотя бы запустить такие модели локально на consumer/слабом GPU.

Сценарии использования
  • Локальные эксперименты с огромными open models без аренды A100/H100.
  • Демо и исследовательские ноутбуки для запуска DeepSeek, Qwen, Llama, Kimi на consumer GPU.
  • Приватный офлайн-инференс для малых команд, где важнее доступность и конфиденциальность, чем latency.
  • Образование и прототипирование: дать студентам и разработчикам доступ к большим моделям без дорогого железа.
  • Edge/SMB-пайплайны с редкими запросами, где можно терпеть медленную генерацию ради низкой стоимости железа.
Целевой пользователь

ML-инженеры, AI-энтузиасты, исследователи, стартапы с ограниченным GPU-бюджетом и разработчики локальных LLM-инструментов.

Open-source аналоги

ggml-org/llama.cppСИЛЬНЕЕ122,800
C/C++ runtime для локального LLM/VLM inference с GGUF, сильной quantization-линейкой, CPU/GPU/Metal/Vulkan/SYCL и hybrid CPU+GPU inference. Сильнее как массовый локальный runtime, но не про тот же сценарий запуска 671B на ~12GB без полной загрузки.
huggingface/transformersСИЛЬНЕЕ163,400
Базовый framework для model definitions, inference и training; умеет offload/quantization через экосистему, но не является узкой ultra-low-VRAM библиотекой.
vllm-project/vllmСИЛЬНЕЕ88,300
Production-grade LLM serving с PagedAttention, continuous batching, CUDA/HIP graphs, quantization и OpenAI-compatible API. Цель — throughput и serving, а не запуск гигантских моделей на tiny VRAM.
sgl-project/sglangСМЕЖНЫЙ31,300
High-performance serving framework для LLM/VLM; конкурирует с vLLM за production serving, меньше сфокусирован на экстремальном снижении VRAM.
oobabooga/text-generation-webuiСМЕЖНЫЙ47,500
Desktop app/web UI для локальных LLM с разными backends и API-совместимостью; сильнее как UX, но не решает сам layer streaming.
Rust/Python/gRPC server для production text generation; в собранном разборе указан как maintenance/архивный проект, исторически сильный, но сейчас менее перспективный относительно vLLM/SGLang/llama.cpp.
turboderp-org/exllamav2НИШЕВЫЙ4,600
Быстрый inference для quantized LLM на consumer GPU с EXL2/GPTQ, dynamic batching и paged attention; быстрее в своей нише, но не про тот же ultra-low-VRAM профиль.
Quantization primitives для PyTorch: LLM.int8, QLoRA, 4/8-bit ops; помогает снижать память, но не является standalone inference engine.
Позиционирование

AirLLM — нишевый сильный игрок в ultra-low-VRAM inference, но не лидер LLM inference в целом. В production serving его обгоняют vLLM, SGLang, llama.cpp и Hugging Face-экосистема; уникальность AirLLM — возможность “вообще запустить” огромную модель на слабой GPU, а не максимальная скорость.

Коммерческие аналоги

OpenAI APIB2B / B2CПО ПОТРЕБЛЕНИЮ
Hosted frontier LLM API для chat, reasoning, coding и multimodal-сценариев.
Масштаб огромный, но свежие revenue/users в использованных official sources не подтверждены; в разборе используются только цены.
gpt-5.6-luna short context$0.10 input / $0.60 output per 1M tokens
gpt-5.4$1.25 input / $7.50 output per 1M tokens
gpt-5.4-mini$0.375 input / $2.25 output per 1M tokens
Anthropic Claude API / ClaudeB2B / B2CПО ПОТРЕБЛЕНИЮ
Hosted Claude models для chat, coding и agentic workflows.
Крупный vendor, но users/revenue не подтверждены из price source.
Opus 4.8$5 input / $25 output per 1M tokens
Sonnet 5 intro до 2026-08-31$2 input / $10 output per 1M tokens
Sonnet 5 standard$3 input / $15 output per 1M tokens
Google Gemini Developer APIB2B / B2CПО ПОТРЕБЛЕНИЮ
Hosted Gemini API для multimodal LLM-сценариев.
Google Cloud scale, но конкретные Gemini API users/revenue не подтверждены.
Gemini paid tier row ≤200k context$1.25 input / $10 output per 1M tokens
Flash-class rows$0.30 input text/image/video / $2.50 output per 1M tokens
Flash-Lite-class rows$0.05 input / $0.20 output per 1M tokens
AWS BedrockB2BПО ПОТРЕБЛЕНИЮ
Managed access к моделям разных vendors, private cloud интеграция и provisioned throughput.
AWS-scale; конкретные Bedrock usage/revenue не подтверждены в использованной странице.
MiniMax M2/M2.1/M2.5 US regions$0.30 input / $1.20 output per 1M tokens
Mistral Large 3$0.50 input / $1.50 output per 1M tokens
Kimi K2.5$0.60 input / $3.00 output per 1M tokens
Together AIB2BПО ПОТРЕБЛЕНИЮ
Cloud для open-source models: serverless inference, dedicated/provisioned throughput и fine-tuning.
Together заявляет customer logos; в отдельном блоге заявлен рост token volume с 30B до >400T tokens/month за 9 месяцев, но это vendor claim, не аудит.
DeepSeek V4 Pro serverless$1.74 input / $3.48 output per 1M tokens
MiniMax M3 serverless$0.30 input / $1.20 output per 1M tokens
Kimi K2.7 Code serverless$0.95 input / $4.00 output per 1M tokens
Fireworks AIB2BПО ПОТРЕБЛЕНИЮ
Serverless inference для open models, optimized endpoints для latency и throughput.
Масштаб/выручка не подтверждены official pricing source; vendor показывает enterprise case studies.
GLM 5.2 Fast$2.10 input / $0.21 cached / $6.60 output per 1M tokens
GroqCloudB2BПО ПОТРЕБЛЕНИЮ
Fast inference API на Groq LPU для open models.
Масштаб/выручка не подтверждены в price source.
Llama 3.1 8B Instant$0.05 input / $0.08 output per 1M tokens
Qwen 3.6 27B$0.60 input / $3.00 output per 1M tokens
Hugging Face Inference EndpointsB2BПО ПОТРЕБЛЕНИЮ
Dedicated managed endpoints для моделей с выбором hardware, autoscaling и backends вроде vLLM/TGI/SGLang/llama.cpp.
Hugging Face ecosystem крупный; конкретные endpoint users/revenue не подтверждены в pricing source.
AWS CPU x1$0.033/hr
AWS CPU x16$0.536/hr
GPU small example$0.5/hr
GPU advanced example$0.75/hr или $547.5/month по формуле страницы
ReplicateB2B / B2CПО ПОТРЕБЛЕНИЮ
Hosted public/private model inference и custom models через Cog; billing by hardware seconds или per-output для некоторых моделей.
Конкретные users/revenue не подтверждены price source.
CPU small$0.000025/sec / $0.09/hr
A100 80GB$0.001400/sec / $5.04/hr
H100$0.001525/sec / $5.49/hr
Runpod Serverless / GPU CloudB2BПО ПОТРЕБЛЕНИЮ
GPU pods и serverless endpoints для AI inference/training.
Масштаб не подтверждён official pricing source.
Serverless/GPU pricingper-second metering, from $0.58/hr 16GB class to $9.98/hr 280GB B300
Текущая монетизация проекта

Сам проект AirLLM монетизируется слабо и не как полноценный продукт: в README есть ссылки на Patreon и GitHub Sponsors, а также блок AI Agents Recommendation с внешними ссылками, похожий на промо/affiliate/ads, но размер оплаты не подтверждён. Не найдено официального AirLLM Cloud, paid enterprise support page, open-core edition или pricing page самого AirLLM.

Коммерческий потенциал

ПОТЕНЦИАЛ · СРЕДНИЙ

На AirLLM можно заработать как на private/local huge-model enablement product, но не как на обычном hosted LLM API. Самый реалистичный путь — packaged local inference server, enterprise support и compatibility/cost tooling для команд, которым нужно запускать большие open models на дешёвом или приватном железе.

Спрос и рынок

Broad TAM у AI inference очень большой: в собранном разборе указаны оценки Grand View Research $97.24B в 2024, $113.5B estimate 2026 и $253.75B к 2030, а MarketsandMarkets — $106.15B в 2025 → $254.98B в 2030. Но AirLLM SAM/SOM — узкая и не измеренная отдельно ниша ultra-low-VRAM local inference; её нельзя автоматически приравнивать ко всему рынку AI inference.

Ров / защищённость

Текущий ров слабый. Есть узнаваемость, сильная формулировка value prop “70B on 4GB GPU”, совместимость с популярными моделями и Apache-2.0. Нет proprietary infrastructure, hosted network effects, enterprise contracts, large maintainer org, strong performance moat или de-facto standard status как у llama.cpp/vLLM/Transformers. Потенциальный ров можно строить на distribution, packaging, trust, compatibility database и support SLA.

Модели монетизации
  • Платная enterprise support-подписка для compatibility fixes, настройки offload/cache и SLA по поддержке.
  • Managed local appliance: Docker/desktop/server package с OpenAI-compatible local endpoint и приватным режимом.
  • Enterprise offline inference kit для air-gapped/data residency сценариев.
  • Low-VRAM inference SDK/support для OEMs, edge devices и education labs.
  • Benchmarking и cost optimizer для выбора между AirLLM local, cloud APIs и GPU endpoints.
  • Hosted “slow but cheap huge model” demo API как showcase, но не основной бизнес.
Что нужно, чтобы сделать продукт
  • OpenAI-compatible server mode из коробки.
  • Reproducible benchmarks: latency, tokens/sec, disk I/O, model load time, accuracy impact и сравнение с llama.cpp/vLLM/ExLlama.
  • Hardware compatibility matrix.
  • Installers и containers для Windows, Linux и macOS.
  • Enterprise docs: security, model license handling, HF gated models и offline cache.
  • Observability: metrics, tracing, profiling UI.
  • Queueing, batching и concurrency.
  • Clear roadmap and governance.
  • Paid support/pricing page.
  • CI/model-regression tests на популярных architectures.
  • Чёткое позиционирование: не fastest inference, а largest model on smallest GPU.
⚖ ЛИЦЕНЗИЯ · МОЖНО ЛИ КОММЕРЦИАЛИЗИРОВАТЬ
Apache-2.0 — коммерчески безопасная permissive license: можно использовать AirLLM в закрытых коммерческих продуктах, SaaS, internal tools и дистрибутивах при соблюдении условий Apache-2.0, включая сохранение license/notice, указание изменений и соблюдение patent/license terms. Риск по коду низкий, но лицензия AirLLM не покрывает автоматически веса моделей, данные, tokenizer assets и сторонние зависимости.
Риски и подводные камни
ВЫСОКИЙПРОЧЕЕ
Layer/expert streaming экономит VRAM, но может быть медленным из-за disk/CPU↔GPU transfer; для production chat, agents и high-QPS serving это критично.
ВЫСОКИЙКОНКУРЕНЦИЯ
llama.cpp, vLLM, SGLang, Transformers, Groq, Together, Fireworks, Bedrock и HF Endpoints закрывают большую часть рынка быстрее и удобнее.
ВЫСОКИЙСЛАБЫЙ РОВ
Основная аудитория AirLLM часто не хочет платить за дорогие GPU/API, поэтому willingness-to-pay и ARPU могут быть низкими.
СРЕДНИЙПРОЧЕЕ
Сейчас это библиотека/README/ноутбуки, а не polished product; без installers, API server, observability и support page продавать сложно.
СРЕДНИЙЗАВИСИМОСТЬ ОТ АВТОРА
Владелец — individual GitHub user, около 10 contributors по входным данным; для enterprise buyers это bus-factor и support risk.
СРЕДНИЙПРОЧЕЕ
Новые open models часто меняют architecture, remote code, attention kernels, FP8/compressed formats; AirLLM должен постоянно догонять совместимость.
СРЕДНИЙЮР. СЕРАЯ ЗОНА
Загрузка gated/open models и trust_remote_code-подобные flows в HF-экосистеме требуют sandboxing и supply-chain hygiene.
СРЕДНИЙЛИЦЕНЗИЯ
Код AirLLM Apache-2.0, но model weights могут иметь отдельные ограничения: Llama, Qwen, DeepSeek, Kimi и другие требуют отдельного compliance layer.
СРЕДНИЙАВТОР МОНЕТИЗИРУЕТ САМ
GitHub Sponsors/Patreon есть, но нет доказанной B2B-монетизации, pricing page или paid support contracts.

Достоверность разбора

УВЕРЕННОСТЬ · СРЕДНЯЯgpt-5.5 · 2026-08-05 · ОКНО 3D
Оговорки / что не проверено
  • Confidence medium: основные технические факты взяты из GitHub/README/PyPI и входных данных, но коммерческие масштабы многих vendors не подтверждены двумя независимыми источниками.
  • Цены commercial analogs структурированы из собранного разбора и указанных pricing pages; часть конкретных model rows может быть vendor-specific и не перепроверялась дополнительно.
  • Оценки звёзд OSS-аналогов взяты из собранного разбора, не перепроверялись заново и могут устаревать.
  • PyPI/pepy downloads AirLLM указаны из собранного разбора, но не подтверждены вторым независимым источником.
  • Заявления README о запуске 405B/671B/2.8T на малой VRAM взяты как claims проекта; независимые benchmarks в разборе не подтверждены.
  • Market size по AI inference взят из market reports, но URL-источники самих отчётов в собранном списке не были явно предоставлены, поэтому это caveat для demand score.
  • Together token volume >400T tokens/month указан как vendor claim, не аудит.
  • Fireworks, Groq, HF Endpoints, Replicate, Runpod, Bedrock: users/revenue/scale не подтверждены official pricing sources, поэтому scale описан осторожно.
  • Блок AI Agents Recommendation в README интерпретирован как возможное промо/affiliate/ads, но факт оплаты не подтверждён.
  • Выводы о moat, capture, willingness-to-pay и productization — аналитическая оценка, а не подтверждённые метрики.
  • Лицензия Apache-2.0 относится к коду AirLLM; model weights и сторонние зависимости требуют отдельной проверки в реальном коммерческом использовании.
ИСТОЧНИКИ (23)

Why This Is A Finding

lyogavin/airllm собрал 7,521 звёзд за окно, тогда как у автора всего 1,051 подписчиков — эффективная аудитория ≈ 4,374. Это даёт surprise-индекс 0.0568 (звёзды относительно охвата автора, а не в абсолюте). Удержание форков 51.4% и 0 внешних контрибьюторов отделяют реальный инструмент от разовой вспышки. Акселерация отрицательная — внимание остывает после пика.

METRICS IN CONTEXT

MEDIAN ACROSS ALL 9585 FINDINGS · Δ vs MEDIAN · PERCENTILE = SHARE RANKED BELOW
METRICVALUEMEDIANΔ MEDPERCENTILE
SCORE0.040.00+0.03ABOVE 96%
VELOCITY250.703.60+247.10ABOVE 100%
RETENTION10.9%25.3%-14.5 PPABOVE 22%
FORKS3,422144+3,278ABOVE 97%
SURPRISE0.060.01+0.05ABOVE 94%