Github Trends®
9560 findingsmedian surprise 0.00824window 30 days
UNIT / TREND-MONITOR · REV 2.6
[ 30 days window ]
SOURCE: own snapshots
FINDING #6765 · UNIT ID 1296688895
Helldez/BigMoeOnEdge
Run MoE models bigger than your RAM. Frontier-size MoE on a 12 GB phone, CPU only, lossless, on stock llama.cpp
[ C++ ]ЗАРАБОТОК C · 52/100[ GITHUB ↗ ]
SURPRISE SCORE
0.00

Score Breakdown

SURPRISE0.0778
ENGAGEMENT0.39
FRESHNESS1.44
SCORE = SURPRISE × ENGAGEMENT^0.7 × FRESHNESS × VISIBILITY × CONFIDENCE
SURPRISE = WINDOW STARS / DAYS / (AUDIENCE + FLOOR)
61% OF STARS IN ARCHIVE
[BOT] SUSPECTED STAR BOT — SCORE PENALIZED. SIGNATURES:
S2 · NO EXTERNAL ISSUE/PR AUTHORS DESPITE 100+ STARS
S5 · PREDATES WINDOW, YET HALF+ OF ALL ITS STARS LANDED IN IT

Growth Telemetry

VELOCITY /D
10.83
ACCEL
+0.02
RETENTION
15.6%
PEAK 2026-08-14 · FORK-RETENTION 63.2% · 325 STARS / WINDOW

Author Audience

AUDIENCE
99
FOLLOWERS
33
OWNER ★
662

Engagement Signals

FORKS
52
ISSUE AUTH
0
PR AUTH
0
UNIQUE STARGAZERS 325 / 325 (DIVERSITY 1.00)

Потенциал заработка

C52/100
СПРОС78
Деньги в теме есть: AI inference и edge AI растут, а коммерческие аналоги уже берут оплату за inference per token / GPU-hour.
ЗАХВАТ42
Узкая техника ценна, но трудно удерживать: llama.cpp, MLC, ExecuTorch, ONNX Runtime и hardware vendors могут встроить похожее; flash-moe уже близок.
ДОСТУП64
Apache-2.0 коммерчески удобна, но проект очень молодой, contributor ≈1, нет registry/package, команды поддержки и ясности по лицензиям конкретных весов.
«Коммерциализацию топит слабая capture-защита: подход легко станет feature в крупных runtimes и SDK.»

Рыночный анализ · Обзор

BigMoeOnEdge — C++-движок и Android-демо для запуска больших MoE-LLM, которые не помещаются в RAM устройства, за счёт потокового чтения нужных экспертов с flash/SSD.
Edge AI / on-device LLM inference / MoE streaming runtime / llama.cpp-adjacent infrastructureЗРЕЛОСТЬ · РАСТЁТ
ЯЗЫК
C++
ЛИЦЕНЗИЯ
Apache-2.0
РЕЕСТР
none
РЕЛИЗ
v0.19.0
КОНТРИБЬЮТОРЫ
1
Что делает

Проект использует свойство Mixture-of-Experts моделей: на каждый токен активируется только часть экспертов. Он держит dense-часть модели и кеш популярных экспертов в RAM, а остальные routed experts читает с накопителя по требованию. README заявляет lossless-режим: ответ byte-identical к запуску той же модели полностью в памяти; пример — DeepSeek V4 Flash 0731, 284B параметров, ~91 GB на диске, около 0.94–1 tok/s на телефоне с 12 GB RAM.

Какую боль решает

Обычные LLM runtime пытаются держать весь файл модели в памяти или полагаются на mmap, из-за чего 20–90 GB модель на телефоне с 12 GB RAM либо не стартует, либо уходит в page-fault/swapping и становится непригодной. BigMoeOnEdge превращает flash storage в часть memory hierarchy и даёт запускать MoE-модели, которые в несколько раз больше оперативной памяти устройства.

Сценарии использования
  • Оффлайн-чат на Android с моделями класса Qwen/Gemma/gpt-oss/DeepSeek, которые больше RAM телефона.
  • Приватный on-device AI для приложений, где нельзя отправлять данные в облако: заметки, документы, voice assistant, field-service.
  • Демо и исследования edge-inference: проверка, насколько далеко можно растянуть телефон или ноутбук без GPU/NPU.
  • Десктоп с маленькой RAM, но быстрым SSD: запуск MoE-моделей, которые не помещаются в оперативную память.
  • Инструмент для разработчиков llama.cpp/GGUF, потому что проект построен поверх публичного API llama.cpp, а не как fork.
Целевой пользователь

Энтузиасты local LLM / LocalLLaMA, Android-разработчики offline/private LLM, исследователи edge AI, команды privacy-first consumer apps и потенциально OEM/SDK-команды.

Open-source аналоги

ggml-org/llama.cppСМЕЖНЫЙ120,400
Универсальный C/C++ inference runtime и фактический стандарт GGUF; BigMoeOnEdge не конкурирует напрямую, а надстраивается над llama.cpp и решает более узкую задачу MoE expert streaming.
mlc-ai/mlc-llmСИЛЬНЕЕ23,100
Compiler/runtime для LLM на GPU/WebGPU/iOS/Android; фокус на компиляции и accelerator backends, а не на CPU-only чтении экспертов с flash сверх RAM.
mlc-ai/web-llmСМЕЖНЫЙ18,600
In-browser LLM через WebGPU; решает приватный локальный inference, но ограничен браузером/GPU и меньшими моделями.
lyogavin/airllmСИЛЬНЕЕ24,300
Тоже про запуск моделей больше VRAM/RAM за счёт layer streaming/offloading. Более известен, но фокус не именно на MoE expert-per-token streaming на Android CPU.
SJTU-IPADS/PowerInferСМЕЖНЫЙ9,500
Использует activation locality и CPU/GPU hybrid inference для consumer GPU; не ориентирован на Android CPU-only и MoE expert streaming с flash.
danveloper/flash-moeНИШЕВЫЙ4,100
Близкий идейно prior art: stream MoE experts с SSD, но заточен под Apple Silicon/Metal и Qwen3.5-397B на MacBook; BigMoeOnEdge делает Android/CPU-only и llama.cpp API.
pytorch/executorchСИЛЬНЕЕ4,900
Production-grade PyTorch edge runtime для mobile/embedded, покрывает LLM/vision/speech и бэкенды Qualcomm/Apple/MediaTek; не решает специально MoE больше RAM через flash.
microsoft/onnxruntime-genaiСМЕЖНЫЙ1,100
Runtime-расширение для генеративных ONNX-моделей в Microsoft ecosystem; не фокусируется на GGUF/llama.cpp/MoE streaming.
Позиционирование

BigMoeOnEdge не лидер общего local LLM inference: там доминируют llama.cpp, MLC LLM, ExecuTorch. Но в узкой нише Android CPU-only MoE expert streaming from flash сверх RAM проект выглядит нишевым early leader / fast follower после flash-moe, потому что сочетает Android, GGUF, llama.cpp API и lossless MoE streaming.

Коммерческие аналоги

OpenAI API / GPT-5B2BПО ПОТРЕБЛЕНИЮ
Облачный API для LLM-инференса; замена локальному запуску больших моделей, если приватность/offline не критичны.
Масштаб публично огромный, но в использованных источниках точные пользователи/выручка для API не подтверждены.
GPT-5 input$1.25 / 1M input tokens
GPT-5 cached input$0.125 / 1M cached input tokens
GPT-5 output$10 / 1M output tokens
ChatGPT BusinessB2BПОДПИСКА
Готовый SaaS-ассистент для компаний; альтернатива локальному AI на устройстве, если допускается облако.
Точные пользователи в источнике не указаны.
Business annual€21/user/month
Business monthly$25/user/month
Enterprisecustom
Anthropic Claude API / ClaudeB2B / B2CПО ПОТРЕБЛЕНИЮ
Облачные Claude-модели через API и подписки; альтернатива self-host/local LLM.
Точные пользователи/выручка в найденном источнике не подтверждены.
Claude Opus 4.7 standard global$5 / 1M input, $25 / 1M output
Claude Opus 4.7 batch$2.50 / 1M input, $12.50 / 1M output
Claude paid plan monthly$20/month
Claude paid plan annual$200 billed upfront
Mistral La Plateforme / Mistral APIB2BПО ПОТРЕБЛЕНИЮ
Европейский LLM API, включая open/enterprise модели.
Точные пользователи/выручка в источнике не подтверждены.
Mistral Large$2 / 1M input tokens, $6 / 1M output tokens
Batch50% discount
Together AI Serverless InferenceB2BПО ПОТРЕБЛЕНИЮ
Хостинг open-weight моделей, включая MoE/frontier open models; близкий коммерческий заменитель для запуска DeepSeek/gpt-oss/Qwen без локального железа.
На pricing page есть баннер про Series C, но сумма не использовалась как подтверждённая ключевая цифра; масштаб токенов из blog snippet не использован как ключевая цифра.
DeepSeek V4 Flash 0731$0.14 / 1M input, $0.03 cached, $0.28 / 1M output
gpt-oss-120B$0.15 / 1M input, $0.60 / 1M output
Qwen3.5-397B-A17B$0.60 / 1M input, $3.60 / 1M output
Dedicated Inference H100$5.49/GPU-hour
Dedicated Inference B200$8.99/GPU-hour
GPU clusters H100$3.99/GPU-hour
GPU clusters H200$5.99/GPU-hour
GPU clusters B200$8.19/GPU-hour
Fireworks AIB2BПО ПОТРЕБЛЕНИЮ
Serverless inference, managed training, on-demand GPU deployments для open models.
Точные пользователи/выручка в источнике не подтверждены.
Serverlesspay-per-token; текущие цены отсылаются в docs
On-demand H100/H200$7/hr до Aug 31, $8/hr from Sep 1
On-demand B200$10/hr → $13/hr
On-demand B300$12/hr → $15/hr
On-demand GB300$18/hr → $20/hr
Training LoRA SFT up to 16B$0.50 / 1M training tokens
Training LoRA SFT 16.1–80B$3 / 1M training tokens
Training LoRA SFT 80–300B$6 / 1M training tokens
Training LoRA SFT >300B$10 / 1M training tokens
GroqCloudB2BПО ПОТРЕБЛЕНИЮ
Высокоскоростной inference-as-a-service на LPU; коммерческий способ получить быстрый inference без локального устройства.
Точные пользователи/выручка в источнике не подтверждены.
Qwen 3.6 27B500 TPS, $0.60 / 1M input tokens, $3.00 / 1M output tokens
Hugging Face Inference EndpointsB2BПО ПОТРЕБЛЕНИЮ
Managed dedicated endpoints для моделей из HF Hub, включая vLLM, TGI, SGLang, llama.cpp/custom containers.
HF Hub — крупная экосистема, но точные пользователи/выручка этого продукта в источнике не указаны.
CPU AWS intel-spr x1$0.033/hr
CPU AWS intel-spr x8$0.268/hr
GPU AWS T4 x1$0.5/hr
GPU AWS L4 x1$0.8/hr
GPU AWS A10G x1$1/hr
GPU AWS L40S x1$1.8/hr
GPU AWS A100 x1$2.5/hr
GPU AWS H200 x1$5/hr
GPU GCP H100 x1$10/hr
Текущая монетизация проекта

Публично подтверждённой монетизации BigMoeOnEdge не найдено. В README и GitHub-странице видны Apache-2.0, demo app, releases, docs, Android example, но нет homepage, cloud offering, paid support, pricing или open-core tier. Текущая оценка: скорее hobby/research/portfolio project, не коммерциализированный продукт.

Коммерческий потенциал

ПОТЕНЦИАЛ · СРЕДНИЙ

Зарабатывать можно, если продавать не библиотеку, а private on-device LLM runtime/SDK for oversized MoE models с поддержкой, сертифицированным model catalog и device-specific оптимизациями.

Спрос и рынок

Спрос высокий: inference и edge AI — крупные и растущие рынки, а платные API/GPU-hour аналоги подтверждают готовность платить за LLM-инференс. В собранном анализе использованы оценки Fortune Business Insights: AI inference market $103.73B в 2025, $117.80B в 2026, $312.64B к 2034, CAGR 12.98%; edge AI market $35.60B в 2025, $46.96B в 2026, $445.75B к 2034, CAGR 32.5%.

Ров / защищённость

Текущий ров слабый, но его можно усилить. Потенциальный ров: device-level benchmarks across hundreds of phones, proprietary tuning database по cache/I/O/dense-weight strategy per device, curated MoE model catalog with tested GGUF shards, Android UX + telemetry + downloader, контракты с privacy-sensitive app vendors и upstream relationship with llama.cpp. Без этого проект рискует остаться оптимизацией, которую другие runtime поглотят.

Модели монетизации
  • B2B SDK для privacy-first mobile AI: Android/iOS SDK, enterprise license/support, certified model catalog, memory/speed tuning per device class.
  • White-label offline AI app: локальный чат/assistant для regulated industries, paid app или enterprise deployment.
  • OEM / device-vendor partnerships: интеграция в смартфоны, rugged devices, automotive head units, tablets.
  • Consulting / paid support вокруг llama.cpp + GGUF + edge MoE: портирование MoE architectures, benchmark/tuning, Android NDK integration, custom quantization and model packaging.
  • Model catalog / managed downloads / curated offline packs: проверенные GGUF-shards, compatibility metadata, resumable downloads, telemetry, safety presets.
Что нужно, чтобы сделать продукт
  • Стабильный SDK/API, не только CLI/demo app.
  • Поддержка iOS/Metal или хотя бы roadmap, иначе mobile-рынок сильно урезан.
  • Device compatibility matrix: Snapdragon/Exynos/MediaTek, UFS versions, thermal behavior.
  • Battery/thermal benchmarks, не только tok/s.
  • Quality benchmarks для lossy knobs: degradation by task, reproducibility, guardrails.
  • Enterprise packaging: signed builds, SBOM, security policy, versioned ABI.
  • Model license compliance layer: какие GGUF weights можно коммерчески использовать.
  • Community expansion: сейчас contributor ≈1 — high bus-factor risk.
  • Clear monetization page: support, consulting, SDK license, sponsor, cloud-free enterprise offering.
⚖ ЛИЦЕНЗИЯ · МОЖНО ЛИ КОММЕРЦИАЛИЗИРОВАТЬ
Apache-2.0 — коммерчески благоприятно. Можно использовать в закрытых коммерческих продуктах, модифицировать, распространять, встраивать в SDK/app при соблюдении условий лицензии и notice. Это не GPL/AGPL, поэтому нет обязанности открывать закрытые деривативы или SaaS-код. Главные ограничения лежат не в лицензии BigMoeOnEdge, а в лицензиях моделей/весов и зависимостей.
Риски и подводные камни
ВЫСОКИЙКОНКУРЕНЦИЯ
llama.cpp, MLC, ExecuTorch, ONNX Runtime или hardware vendors могут встроить MoE streaming нативно.
ВЫСОКИЙЗАВИСИМОСТЬ ОТ АВТОРА
Контрибьютор примерно 1; для B2B это почти блокер без команды, governance и SLA.
ВЫСОКИЙПРОЧЕЕ
0.94–1 tok/s для 284B на телефоне впечатляет технически, но для массового продукта может быть слишком медленно; thermal throttling и battery drain могут ухудшить UX.
ВЫСОКИЙЮР. СЕРАЯ ЗОНА
Apache-2.0 покрывает код BigMoeOnEdge, но коммерческое использование конкретных моделей зависит от лицензий Qwen/Gemma/DeepSeek/gpt-oss и GGUF-паков.
СРЕДНИЙПРОЧЕЕ
Flash throughput, UFS version, Android memory reclaim, OEM kernels сильно различаются.
СРЕДНИЙПРОЧЕЕ
Разработчики платят не за умную загрузку экспертов, а за SDK, поддержку, стабильность, совместимость, документацию и предсказуемую latency.
СРЕДНИЙМАЛЫЙ РЫНОК
Энтузиасты любят OSS, но плохо платят; реальные деньги — B2B, OEM, regulated/private AI.
СРЕДНИЙЮР. СЕРАЯ ЗОНА
Если продавать как privacy/security product, нужны строгие гарантии: no telemetry by default, auditability, supply-chain security.

Достоверность разбора

УВЕРЕННОСТЬ · СРЕДНЯЯgpt-5.5 · 2026-08-15 · ОКНО 1D
Оговорки / что не проверено
  • Коммерческие аналоги не являются прямыми аналогами формата «284B MoE на 12 GB Android phone CPU-only lossless»; это платные заменители пользовательской ценности — облачный или managed inference.
  • Точные пользователи/выручка большинства коммерческих продуктов в собранном анализе не подтверждены; scale описан осторожно.
  • Часть цен коммерческих аналогов взята из одного официального pricing-источника на продукт, а не подтверждена двумя независимыми источниками.
  • Звёзды OSS-аналогов взяты из собранного анализа и могли опираться на indexed GitHub mirror / SourcePulse / Star History; заново не перепроверялись.
  • Оценки Fortune Business Insights по рынкам AI inference и edge AI включены из собранного анализа и не подтверждались вторым независимым источником в этой задаче.
  • Вывод о том, что у Helldez/BigMoeOnEdge нет публичной монетизации, основан на README/GitHub-признаках из собранного анализа; скрытые продажи, consulting или частные контракты не проверялись.
  • Оценки demand/capture/access — аналитическое мнение на базе собранных фактов, а не измеренная метрика.
  • Суждение о том, что технология может быть поглощена llama.cpp/MLC/ExecuTorch/мобильными SDK, является рыночной гипотезой, а не подтверждённым roadmap этих проектов.
  • Юридический вывод по Apache-2.0 не является юридической консультацией; лицензии конкретных моделей/весов и зависимостей нужно проверять отдельно.
  • Performance, battery и thermal выводы для массового UX основаны на README-цифрах и общих предположениях; независимые бенчмарки не приводились.
ИСТОЧНИКИ (30)

Why This Is A Finding

Helldez/BigMoeOnEdge собрал 325 звёзд за окно, тогда как у автора всего 33 подписчиков — эффективная аудитория ≈ 99. Это даёт surprise-индекс 0.0778 (звёзды относительно охвата автора, а не в абсолюте). Удержание форков 63.2% и 0 внешних контрибьюторов отделяют реальный инструмент от разовой вспышки. Акселерация положительная — рост ещё не выдохся.

METRICS IN CONTEXT

MEDIAN ACROSS ALL 9560 FINDINGS · Δ vs MEDIAN · PERCENTILE = SHARE RANKED BELOW
METRICVALUEMEDIANΔ MEDPERCENTILE
SCORE0.000.00-0.00ABOVE 29%
VELOCITY10.833.73+7.10ABOVE 81%
RETENTION15.6%25.5%-9.9 PPABOVE 32%
FORKS52116-64ABOVE 31%
SURPRISE0.080.01+0.07ABOVE 96%