После сохранения файла VidBee превращает звук в текст на этом компьютере. Распознавание идёт локальными AI-моделями. Аудио не уходит в облачный API, поэтому интервью и другие чувствительные файлы остаются приватными и работают офлайн после установки моделей.
Транскрипция ищется, размечена по спикерам и синхронизирована с плеером: клик по строке перематывает к этому моменту.
Основные возможности
- Распознавание спикеров — разделить голоса, видеть время речи, перейти к человеку
- Точная транскрипция — выбрать локальную модель, читать текст с таймкодами рядом с плеером
- 100+ языков — Whisper сам определяет речь; другие семейства сильнее в CJK или английском
- Поиск — найти слово, подсветить, скопировать фрагмент, перейти к моменту
- Экспорт — текст, Markdown, субтитры или видео с подписями
- Приватность — речь остаётся на компьютере; модели работают без сети после первой загрузки
- Очередь — можно сбросить много файлов; VidBee обработает их в фоне
Откройте Transcripts в боковой панели или перейдите из завершённой загрузки. Локальный файл можно импортировать кнопкой Add audio or video либо перетащить / вставить на страницу Transcripts.

Страница помечена Experimental и позже может слиться с Downloads. Статусы строк:
- Queued / Processing / Retrying soon — локальный ASR ждёт или работает
- Transcript ready — локальное распознавание готово (искра)
- Video captions — дорожка субтитров из загрузки
- No speech — речи не найдено
- Cancelled или ошибка — Retry со строки или со страницы
Как запустить
- Скачайте видео или аудио, импортируйте файл или перетащите его на Transcripts.
- Дождитесь сохранения.
- Нажмите элемент в Transcripts либо Transcribe / View transcript в строке загрузки.
- По желанию включите Transcribe after download в Settings → Transcription. Следующие успешные загрузки ставят транскрипцию в фон. Файлы без речи пропускаются. Выключение опции не отменяет уже стоящие задачи.
В очередь можно поставить сразу много аудио- и видеофайлов — папку интервью, архив подкастов, пакет импорта. Распознавание ограничено по параллельности (по умолчанию одна задача), чтобы модели не забили RAM. Поднимите Maximum number of active transcripts, если памяти хватает. Длинный файл остаётся в Processing. Можно Stop текущую задачу и Retry сбой.
При первом использовании модели ASR скачиваются на диск. Баннер показывает прогресс. После этого транскрипция не требует сети. В Settings → Transcription модели можно скачать заново, сменить активную или удалить лишние.
Читать транскрипцию
Слева медиа, справа текст. Ручка меняет ширину или сворачивает панель.

Плеер
- Воспроизведение, пауза, перемотка, громкость, mute, скорость, ±15 с, полный экран
- Опциональные субтитры на картинке
- Если встроенный плеер не открылся, текст всё равно читается; файл можно открыть из Downloads
- Полоса now playing остаётся при уходе со страницы; позиция помнится
Поиск и реплики
- У каждой строки таймкод. Клик по строке (или слову) перематывает
- Поиск находит слово или фразу по всей транскрипции (включая имена спикеров). Совпадения подсвечиваются; предыдущее / следующее переключает их
- Выделите фрагмент и скопируйте или поделитесь картинкой
- Режим следования держит текущую строку в кадре; прокрутка ставит паузу, затем Return to the position playing now
Распознавание спикеров
VidBee разделяет пересекающиеся голоса и подписывает каждого спикера. Цветные аватары и полоски времени речи под плеером — клик по полоске переносит к этому человеку.
- Adjust speakers задаёт число (Auto, 1, 2, …) и переразмечает текст без повторного ASR
- Вкладка Info: канал, длительность, файл, модель, язык, число спикеров и сегментов

Источники
VidBee может показать:
- Субтитры видео, в том числе по языкам и автосубтитры
- AI transcript с локального распознавания
Если есть оба, переключатель в шапке. Искра — локальный ASR. Иконка субтитров — captions.
Точность и модели
Выберите локальную модель под этот компьютер: Tiny быстрее, Small или Base — для обычных машин, более тяжёлые — когда нужна точность. Плеер синхронизирован с текстом: клик по строке воспроизводит этот момент.
Not happy with this transcript? открывает выбор модели, при необходимости качает более тяжёлую и перезапускает распознавание. Текущая транскрипция остаётся в истории. Можно уйти со страницы.
Если результат No speech, Transcribe anyway, когда детектор, скорее всего, ошибся (тихий голос, музыка).
Языки
Семейство Whisper покрывает 100+ языков и само определяет речь. Язык заранее указывать не нужно.
Другие семейства сильнее в отдельных языках:
- SenseVoice — CJK + английский, включая кантонский
- Parakeet — в первую очередь английский
- Qwen3-ASR — лучшая точность по китайскому
В Settings → Transcription указаны размер, языки и рекомендация для этого ПК (ОС, GPU, RAM, ядра, язык интерфейса).
Экспорт
Export сначала показывает превью, затем копирует или сохраняет файл.
Стили: Transcript, Subtitles, Segments, Whisper, Video + Subs.
Текст: .txt и .md. Опции: группировка (None, Words, Sentences) и Show timestamp.

Для Video + Subs:
- Soft — дорожка субтитров, в плеере можно выключить, быстро, без потери качества
- Hard — выжигание в картинку, перекодирование, субтитры нельзя отключить
Только аудио экспортируется как текст. Долгий видеоэкспорт можно отменить.
Настройки транскрипции
Settings → Transcription
- Transcribe after download
- Maximum number of active transcripts
- Каталог моделей (размер, языки) и рекомендация для этого ПК (ОС, GPU, RAM, ядра, язык интерфейса)
Модель можно скачать, включить или удалить отдельно. Языки описаны в разделе выше.

Settings → Advanced → Download source переключает GitHub и китайские зеркала (ModelScope), если скачивание моделей медленное.
Приватность
Транскрипция рассчитана на файлы, которые не должны покидать компьютер.
- Распознавание на устройстве — работают локальные модели. VidBee не загружает аудио в облако для речи.
- Офлайн — после установки моделей можно транскрибировать без сети.
- Локальные файлы — медиа и транскрипции остаются в ваших папках.
- AI отдельно — AI-промпты отправляют провайдеру только текст. Ollama и LM Studio оставляют и этот шаг локальным. Ключи API остаются в приложении.
По готовой транскрипции запускайте эти промпты для саммари, FAQ и других видов того же текста.