VidBee 转文本:本地语音识别文稿

把视频和音频转成可搜索文稿。VidBee 在本地完成 100+ 语言识别、说话人标注、搜索和导出,内容留在你的电脑上。

Updated View as Markdown

文件下载完成后,VidBee 在这台电脑上把音轨转成文字。识别用本地 AI 模型,音频不会发到云端语音接口。访谈或其他敏感文件可以留在本机;模型装好之后也能离线转写。

文稿可搜索、带说话人标注,并和播放器对齐,点击一行就能跳到那一时刻。

核心功能

  • 说话人识别 — 分开人声、看发言时长、跳到某个人
  • 准确转写 — 选本地模型,在播放器旁边看带时间戳的文本
  • 100+ 语言 — Whisper 自动检测语种;其他家族更擅长中日韩或英语
  • 搜索 — 找词或短语、高亮命中、复制一段、跳到对应时间
  • 导出 — 正文、Markdown、字幕,或带字幕的视频
  • 隐私 — 语音留在本机;模型下载后可不联网转写
  • 排队 — 一次丢进多个文件,后台按队列处理

在侧边栏打开 Transcripts,或从已完成的下载条目进入。也可以用 Add audio or video 导入本地音视频,或把媒体文件拖到 / 粘贴到文稿页。

文稿列表中的已完成、字幕与处理中项目

文稿页标了 Experimental,以后可能会并进 Downloads。每行状态:

  • Queued / Processing / Retrying soon — 本地 ASR 在等待或运行
  • Transcript ready — 本地识别完成(闪光图标)
  • Video captions — 下载时带来的字幕轨(字幕图标)
  • No speech — 扫描后没有人声
  • Cancelled 或错误行 — 从该行或文稿页 Retry

怎么开始

  1. 下载视频或音频,从磁盘导入,或把文件拖到 Transcripts。
  2. 等媒体保存完成。
  3. Transcripts 点击条目,或在下载行用 Transcribe / View transcript
  4. 可选:在 Settings → Transcription 打开 Transcribe after download。之后成功的下载会在后台排队转写;没有人声的文件会跳过。关掉该选项不会取消已经入队的任务。

可以一次排队很多音频或视频——一文件夹访谈、积压的播客、或批量导入。识别有并发上限(默认 1),避免模型占满内存。这台电脑内存够用时,可提高 Maximum number of active transcripts。较长的文件会一直显示 Processing 直到完成。运行中可以 Stop,失败了可以 Retry

第一次使用会把所选 ASR 模型下载到磁盘,横幅显示进度。之后转写不必联网。Settings → Transcription 可以重新下载模型、切换当前模型,或删除不用的模型。

阅读文稿

文稿页左侧是媒体,右侧是文本。拖动分隔条可改宽度或收起文本面板。

带说话人标注和时间轴的文稿页

播放器

  • 播放、暂停、进度、音量、静音、倍速、±15 秒、全屏
  • 可选在画面上显示字幕
  • 页内播放失败时仍可读文稿;需要其他播放器时从 Downloads 打开文件
  • 离开页面后仍有 now playing 条,并记住进度

搜索和字幕列表

  • 每行有时间戳。点击一行(或一个词)即可跳转
  • 搜索会在整篇文稿里找词或短语(含说话人名字)。命中会高亮,可用上一条 / 下一条跳转
  • 拖选一段后可 复制,或把摘录 分享为图片
  • 跟随模式会把当前行滚进视野;手动滚动会暂停,再用 Return to the position playing now 回去

说话人识别

VidBee 会把重叠的人声分开并标注。播放器下方有彩色头像和发言时长条,点击即可跳到该说话人。

  • Adjust speakers 可固定人数(Auto、1、2…),只重新标注、不再跑识别
  • Info 显示频道、时长、文件、模型、语言、说话人数和片段数

调整说话人对话框,固定为 2 人

来源

VidBee 可以显示:

  • 视频字幕:下载时保存的各语言或自动字幕轨
  • AI transcript:本地语音识别结果

两者都在时,用标题栏的来源切换。闪光图标是本地 ASR,字幕图标是字幕轨。

准确度和模型

按这台电脑选本地模型:Tiny 更快,Small / Base 适合一般机器,需要更高准确率再用更大的。播放与文本对齐,点击一行就能听到那一段。

Not happy with this transcript? 会打开模型选择,必要时下载更大模型并重新识别。当前文稿作为历史保留。任务在后台跑,可以离开页面。

结果是 No speech 时,如果觉得是误判(声音很轻、人声混在音乐里),用 Transcribe anyway

语言

Whisper 家族覆盖 100+ 语言,并自动检测语种,不必先指定语言。

其他家族更偏专项:

  • SenseVoice — 中日韩 + 英语,含粤语
  • Parakeet — 偏英语
  • Qwen3-ASR — 中文准确率最高

Settings → Transcription 会列出体积、语言说明,以及按这台电脑(系统、GPU、内存、核心数、界面语言)给出的推荐。

导出

Export 先预览当前文本,再复制或存成文件。

样式:

  • Transcript — 可读正文
  • Subtitles — 带 SRT 风格时间的字幕
  • Segments — 按时间片分段
  • Whisper — 带说话人的转写
  • Video + Subs — 把字幕封装或烧进新视频

文本格式为 .txt.md。可设分组(NoneWordsSentences)以及是否 Show timestamp

导出预览:Transcript 样式、.txt 和带时间戳

Video + Subs

  • Soft — 封装字幕轨,播放器可开关字幕,速度快、不损画质
  • Hard — 烧进画面,会重编码,字幕无法关掉

纯音频只能导出文本。较长的视频导出可以取消。

转写设置

Settings → Transcription

  • Transcribe after download
  • Maximum number of active transcripts
  • 模型目录(体积、语言特点),以及按这台电脑(系统、GPU、内存、核心数、界面语言)给出的推荐

可单独下载、启用或删除某个模型。语言覆盖见上文「语言」。

转写设置:下载后自动转写和已安装的 ASR 模型

Settings → Advanced → Download source 可在 GitHub 与中国(ModelScope)镜像之间切换,模型下载慢或被拦时用。

隐私

转写适合不该离开这台电脑的文件。

  • 本地识别 — 用本机模型,不会把音频上传去做语音识别
  • 离线 — 模型装到磁盘后,可以不联网转写
  • 本地文件 — 媒体和文稿留在你指定的文件夹
  • AI 是另一步AI Prompt 只把文稿文本发给你启用的服务商。Ollama、LM Studio 可以把这一步也留在本机。API 密钥只存在应用里

文稿完成后,可以用这些 Prompt 做摘要、FAQ 或同一段文字的其他整理。

文档

Type to search…

↑↓ navigate↵ selectEsc close