Github Trends®
2379 findingsmedian surprise 0.00071window 180 days
UNIT / TREND-MONITOR · REV 2.6
[ 180 days window ]
SOURCE: gharchive
РЕПО НЕТ В ОКНЕ 30D. ПОКАЗАН FINDING ИЗ ОКНА 180D (180 days) — РАНГ #71.
FINDING #71 · UNIT ID 1141782198
jamiepine/voicebox
The open-source AI voice studio. Clone, dictate, create.
[ TYPESCRIPT ]ЗАРАБОТОК C · 59/100[ GITHUB ↗ ]
SURPRISE SCORE
0.00

Score Breakdown

SURPRISE0.00436
ENGAGEMENT1.98
FRESHNESS1.39
SCORE = SURPRISE × ENGAGEMENT^0.7 × FRESHNESS × VISIBILITY × CONFIDENCE
SURPRISE = WINDOW STARS / DAYS / (AUDIENCE + FLOOR)
12% OF STARS IN ARCHIVE

Growth Telemetry

VELOCITY /D
33.26
ACCEL
-0.57
RETENTION
4.5%
PEAK 2026-02-20 · FORK-RETENTION 73.7% · 5,987 STARS / WINDOW

Author Audience

AUDIENCE
7,597
FOLLOWERS
2,630
OWNER ★
49,669

Engagement Signals

FORKS
6,014
ISSUE AUTH
92
PR AUTH
34
UNIQUE STARGAZERS 5,983 / 5,987 (DIVERSITY 1.00)

Потенциал заработка

C59/100
СПРОС87
Деньги в теме есть: AI voice generators market указан как $7.7B в 2026 → $21.8B к 2030, speech/voice recognition — $9.66B в 2025 → $23.11B к 2030. Пользователи уже платят $15–$99+/mo за dictation и TTS tools.
ЗАХВАТ49
Ниша горячая, но ров слабый: модели открытые или быстро коммодитизируются, incumbents богаче, качество голоса решает, локальность легко копируется. Сильная сторона — all-in-one local-first desktop + MCP.
ДОСТУП72
MIT даёт свободу коммерческого использования, форков, закрытых деривативов и SaaS. Барьеры: молодой проект, user-owner verified=False, GPU/packaging/support, voice-cloning abuse compliance и отдельные лицензии bundled models.
«Потенциал топит capture: рынок платящий, но конкуренция и отсутствие собственного foundation model мешают удерживать ценность.»

Рыночный анализ · Обзор

Voicebox — локальная open-source AI voice studio для клонирования голоса, генерации речи, диктовки и голосового вывода для AI-агентов.
AI voice / speech generation / speech-to-text / local-first creative tool / agent I/OЗРЕЛОСТЬ · РАСТЁТ
ЯЗЫК
TypeScript
ЛИЦЕНЗИЯ
MIT
РЕЕСТР
npm
РЕЛИЗ
v0.5.0
КОНТРИБЬЮТОРЫ
51
УСТАНОВКА: npm install voicebox
Что делает

Voicebox объединяет TTS, voice cloning, Whisper-based STT, глобальную диктовку, audio effects, story/timeline editor, REST API и MCP server в desktop-приложении. Всё работает локально на macOS, Windows, Linux и Docker. Проект позиционируется как open-source альтернатива ElevenLabs и Wispr Flow в одном приложении.

Какую боль решает

Платные voice-AI сервисы дорогие, облачные, требуют загрузки голоса и аудио на сервер и обычно закрывают только половину цикла: либо TTS, либо диктовку.

Сценарии использования
  • Создатель контента генерирует voice-over, подкасты, диалоги и аудиокниги.
  • Разработчик подключает локальный TTS/STT через REST API или MCP к Cursor, Claude Code, Cline.
  • Пользователь диктует текст в любые приложения через hotkey.
  • Команда с приватными аудиоданными держит voice cloning и транскрипцию на локальной машине.
  • Автор делает multi-voice stories с эффектами и версиями генераций.
Целевой пользователь

Creators, indie hackers, AI-agent пользователи, developers, privacy-sensitive prosumers и локальные AI-энтузиасты.

Open-source аналоги

openai/whisperСМЕЖНЫЙ105,000
De facto STT model/toolkit, только распознавание речи, без TTS, studio и voice cloning UI.
coqui-ai/TTSСИЛЬНЕЕ45,600
Research/production TTS toolkit с множеством моделей и training/fine-tuning, но не цельная desktop voice studio.
myshell-ai/OpenVoiceСИЛЬНЕЕ37,000
Instant voice cloning model/code под MIT, без полноценного dictation, story и API desktop-продукта.
SWivid/F5-TTSНИШЕВЫЙ14,000
Современный zero-shot TTS/model repo, не end-user studio.
neonbjb/tortoise-ttsСЛАБЕЕ14,900
Старый качественный multi-voice TTS, тяжелее и менее продуктовый.
rhasspy/piperНИШЕВЫЙ11,200
Быстрый локальный TTS для embedded/Home Assistant; архивирован Oct 6, 2025, нет cloning, STT и studio.
Позиционирование

Voicebox — лидер на application-layer среди локальных open-source voice studios, но не лидер по базовым speech-моделям. Это aggregator/product wrapper поверх TTS/STT движков с сильным positioning: local-first + voice I/O + MCP.

Коммерческие аналоги

ElevenLabsB2B / B2CFREEMIUM
TTS, voice cloning, dubbing, agents и API.
$500M+ ARR в первые 4 месяца 2026; ранее $180M Series C при $3.3B valuation.
Free$0
Starter$6/mo
Creator$22/mo
Pro$99/mo
Scale$299/mo
Business$990/mo
Enterprisecustom
Wispr FlowB2B / B2CFREEMIUM
AI dictation into any app.
$81M total funding stated by Wispr; rumored $260M round in CB Insights, не подтверждено vendor page.
Basicfree
Pro$15/user/mo
Business$30/seat/mo
Enterprisecontact
DescriptB2B / B2CFREEMIUM
Audio/video editor, transcription, AI speech и voice clone.
More than 6 million creators & teams.
Free$0
Hobbyist$16 annual / $24 monthly per person
Creator$24 annual / $35 monthly per person
Business$50 annual / $65 monthly per person
Enterprisecustom
Murf AIB2B / B2CFREEMIUM
AI voiceover studio, TTS, dubbing и voice agents.
10M+ users, 300+ Forbes 2000 companies; $10M Series A.
Free$0
Creator Lite$29/user/mo
Creator Plus$49/user/mo
Business Lite$99/user/mo
Business Plus$199/user/mo
Enterprisecustom
PlayHTB2B / B2CFREEMIUM
AI voice generator, voice cloning и API.
Масштаб не подтверждён vendor page.
Professional$39/mo
Premium$99/mo
Team$198/mo
Enterprisecustom
Resemble AIB2BПО ПОТРЕБЛЕНИЮ
Voice cloning, TTS, voice conversion, watermarking и deepfake detection.
Over 1,000,000 users на cloning page.
Flex$0 start, pay-as-you-go
Team seats$20/user/mo
Audio deepfake detection$0.04/sec
Video detection$0.07/sec
Enterprisecustom
LOVO / GennyB2B / B2CПОДПИСКА
AI voice/video studio, voice generation, subtitles и cloning.
G2 profile claims 1M+ professionals; vendor source not found in crawl.
Basic$29/mo
Pro$48/mo
Enterprisecustom
Hume AIB2BFREEMIUM
Emotional voice AI, TTS, speech-to-speech API и voice cloning.
Масштаб не подтверждён.
Free$0
Starter$3/mo
Creator$14/mo
Pro$70/mo
Scale$200/mo
Business$500/mo
Enterprisecustom
EVI extra$0.04–$0.07/min depending tier
TTS overage$0.05–$0.15/1k chars
SpeechifyB2CFREEMIUM
TTS reader, voice typing, AI podcast и voice assistant.
Масштаб не подтверждён в найденной pricing page.
Free$0
Premium$29/mo
Amazon PollyB2BПО ПОТРЕБЛЕНИЮ
Cloud TTS API.
AWS-scale, но Polly revenue/users не раскрыты.
Standard$4/1M chars
Neural$16/1M chars
Long-form$100/1M chars
Generative$30/1M chars
Google Cloud Text-to-SpeechB2BПО ПОТРЕБЛЕНИЮ
Cloud TTS API и custom voice.
Google Cloud-scale, TTS revenue/users не раскрыты.
Neural2$16/1M chars
Instant Custom Voice$60/1M chars
OpenAI TTSB2BПО ПОТРЕБЛЕНИЮ
API speech generation.
OpenAI-scale, model-level usage не раскрыт.
gpt-4o-mini-tts input$0.60/1M text tokens
gpt-4o-mini-tts output$12/1M audio tokens
Текущая монетизация проекта

Сам Voicebox уже планирует и частично запускает монетизацию вокруг проекта: сайт показывает Local $0 forever, Cloud coming soon $12/year, Studio coming soon $48/year placeholder, Donate/BuyMeACoffee, VIP Sponsor и $VOICEBOX Solana token, который даёт Cloud free holders. Это не чистое хобби, но paid product ещё ранний; Cloud/Studio не финализированы.

Коммерческий потенциал

ПОТЕНЦИАЛ · СРЕДНИЙ

Заработать можно на cloud sync, pro desktop, team/studio, enterprise/on-prem, paid support, API/MCP developer plan и marketplace, но основной шанс лежит в продуктовой упаковке, а не в моделях.

Спрос и рынок

Спрос высокий. Creator TTS, dictation, AI agents и private local AI пересекаются. Прямой рынок AI voice generators указан до $21.8B к 2030; смежный speech recognition — до $23.11B к 2030. Реалистичный obtainable market для open-source local desktop tool меньше: prosumer + developer + privacy teams.

Ров / защищённость

Ров слабый-средний. Ров не в моделях, а в UX, local packaging, multi-engine orchestration, MCP integrations, privacy trust и community. Если Voicebox станет “Docker Desktop для local voice AI”, ров усилится.

Модели монетизации
  • Cloud backup/sync/private library
  • Pro desktop tier: priority updates, advanced effects, batch generation, professional export, project templates
  • Team/Studio: shared encrypted voice libraries, consent workflow, admin controls, audit logs, SSO
  • Enterprise/on-prem для media, games, education, healthcare и call-center prototyping
  • Paid support: GPU setup, model packaging, custom voices, compliance consulting
  • API/MCP developer plan: local gateway + managed fallback cloud inference
  • Marketplace: licensed voices, effect presets, story templates, safe commercial voice packs
Что нужно, чтобы сделать продукт
  • Проверенный consent flow для cloning.
  • Watermarking/provenance и abuse controls.
  • Лицензионный audit всех bundled models/weights.
  • Командные функции: billing, orgs, shared libraries, SSO, audit.
  • Надёжные installers, auto-update, Linux binaries.
  • Benchmarks качества и latency против ElevenLabs/Wispr.
  • Support/SLA/docs для API.
  • Чёткое разделение free OSS и paid value без ощущения token gimmick.
⚖ ЛИЦЕНЗИЯ · МОЖНО ЛИ КОММЕРЦИАЛИЗИРОВАТЬ
MIT — коммерчески безопасная база. Можно использовать, форкать, встраивать в закрытый продукт и продавать, сохраняя license notice. Главная оговорка: проверить лицензии всех моделей, весов, samples и сторонних движков; именно они могут ограничить commercial use, cloning или redistribution.
Риски и подводные камни
ВЫСОКИЙЮР. СЕРАЯ ЗОНА
Voice cloning затрагивает biometric identity, publicity rights, deepfakes и consent. Нужны consent recording, watermarking, policy, takedown и enterprise controls.
ВЫСОКИЙЛИЦЕНЗИЯ
MIT проекта не гарантирует коммерческие права на все bundled TTS/STT weights. Нужен audit Qwen, Chatterbox, Hume TADA, Kokoro, Whisper, LuxTTS и dataset restrictions.
ВЫСОКИЙКОНКУРЕНЦИЯ
ElevenLabs, Wispr, Descript, Murf, Hume, OpenAI, AWS и Google уже имеют distribution, APIs, compliance и capital.
СРЕДНИЙПРОЧЕЕ
$VOICEBOX token может отпугнуть enterprise buyers и создать regulatory/reputation risk.
СРЕДНИЙПРОЧЕЕ
Local GPU stack, CUDA/ROCm/MLX, permissions, model downloads и audio drivers создают высокий support cost.
СРЕДНИЙЗАВИСИМОСТЬ ОТ АВТОРА
Молодой repo, owner user verified=False; 51 contributors снижает риск, но governance ещё не доказан.
СРЕДНИЙСЛАБЫЙ РОВ
Local-first free app снижает usage-metering; cloud sync alone может дать низкий ARPU.

Достоверность разбора

УВЕРЕННОСТЬ · СРЕДНЯЯgpt-5.5 · 2026-07-18 · ОКНО 180D
Оговорки / что не проверено
  • Звёзды open-source аналогов взяты из собранного разбора/GitHub snapshots и не перепроверялись в реальном времени.
  • PlayHT pricing опирается на G2/TrustRadius, а не vendor-confirmed pricing page.
  • LOVO/Genny pricing и масштаб частично опираются на G2; vendor-confirmed источник масштаба не найден в собранном разборе.
  • Wispr Flow rumored $260M round указан как неподтверждённый vendor page.
  • Масштаб Hume AI, Speechify, Amazon Polly, Google Cloud Text-to-Speech и OpenAI TTS на уровне конкретного voice-продукта не раскрыт в собранных данных.
  • Коммерческая пригодность bundled models/weights не подтверждена; нужен отдельный license audit.
  • Оценки capture/access, moat, риски и модели монетизации являются аналитическим выводом из собранных данных, а не числом из внешнего источника.
  • Данные о Voicebox Cloud/Studio и $VOICEBOX token взяты из собранного разбора pricing page; статус paid-продукта описан как ранний и не финализированный.
ИСТОЧНИКИ (36)

Why This Is A Finding

jamiepine/voicebox собрал 5,987 звёзд за окно, тогда как у автора всего 2,630 подписчиков — эффективная аудитория ≈ 7,597. Это даёт surprise-индекс 0.00436 (звёзды относительно охвата автора, а не в абсолюте). Удержание форков 73.7% и 126 внешних контрибьюторов отделяют реальный инструмент от разовой вспышки. Акселерация отрицательная — внимание остывает после пика.

METRICS IN CONTEXT

MEDIAN ACROSS ALL 2379 FINDINGS · Δ vs MEDIAN · PERCENTILE = SHARE RANKED BELOW
METRICVALUEMEDIANΔ MEDPERCENTILE
SCORE0.010.00+0.01ABOVE 97%
VELOCITY33.262.86+30.40ABOVE 98%
RETENTION4.5%5.8%-1.3 PPABOVE 40%
FORKS6,0141,230+4,784ABOVE 85%
SURPRISE0.000.00+0.00ABOVE 88%