文件下载完成后,VidBee 在这台电脑上把音轨转成文字。识别用本地 AI 模型,音频不会发到云端语音接口。访谈或其他敏感文件可以留在本机;模型装好之后也能离线转写。
文稿可搜索、带说话人标注,并和播放器对齐,点击一行就能跳到那一时刻。
核心功能
- 说话人识别 — 分开人声、看发言时长、跳到某个人
- 准确转写 — 选本地模型,在播放器旁边看带时间戳的文本
- 100+ 语言 — Whisper 自动检测语种;其他家族更擅长中日韩或英语
- 搜索 — 找词或短语、高亮命中、复制一段、跳到对应时间
- 导出 — 正文、Markdown、字幕,或带字幕的视频
- 隐私 — 语音留在本机;模型下载后可不联网转写
- 排队 — 一次丢进多个文件,后台按队列处理
在侧边栏打开 Transcripts,或从已完成的下载条目进入。也可以用 Add audio or video 导入本地音视频,或把媒体文件拖到 / 粘贴到文稿页。

文稿页标了 Experimental,以后可能会并进 Downloads。每行状态:
- Queued / Processing / Retrying soon — 本地 ASR 在等待或运行
- Transcript ready — 本地识别完成(闪光图标)
- Video captions — 下载时带来的字幕轨(字幕图标)
- No speech — 扫描后没有人声
- Cancelled 或错误行 — 从该行或文稿页 Retry
怎么开始
- 下载视频或音频,从磁盘导入,或把文件拖到 Transcripts。
- 等媒体保存完成。
- 在 Transcripts 点击条目,或在下载行用 Transcribe / View transcript。
- 可选:在 Settings → Transcription 打开 Transcribe after download。之后成功的下载会在后台排队转写;没有人声的文件会跳过。关掉该选项不会取消已经入队的任务。
可以一次排队很多音频或视频——一文件夹访谈、积压的播客、或批量导入。识别有并发上限(默认 1),避免模型占满内存。这台电脑内存够用时,可提高 Maximum number of active transcripts。较长的文件会一直显示 Processing 直到完成。运行中可以 Stop,失败了可以 Retry。
第一次使用会把所选 ASR 模型下载到磁盘,横幅显示进度。之后转写不必联网。Settings → Transcription 可以重新下载模型、切换当前模型,或删除不用的模型。
阅读文稿
文稿页左侧是媒体,右侧是文本。拖动分隔条可改宽度或收起文本面板。

播放器
- 播放、暂停、进度、音量、静音、倍速、±15 秒、全屏
- 可选在画面上显示字幕
- 页内播放失败时仍可读文稿;需要其他播放器时从 Downloads 打开文件
- 离开页面后仍有 now playing 条,并记住进度
搜索和字幕列表
- 每行有时间戳。点击一行(或一个词)即可跳转
- 搜索会在整篇文稿里找词或短语(含说话人名字)。命中会高亮,可用上一条 / 下一条跳转
- 拖选一段后可 复制,或把摘录 分享为图片
- 跟随模式会把当前行滚进视野;手动滚动会暂停,再用 Return to the position playing now 回去
说话人识别
VidBee 会把重叠的人声分开并标注。播放器下方有彩色头像和发言时长条,点击即可跳到该说话人。
- Adjust speakers 可固定人数(Auto、1、2…),只重新标注、不再跑识别
- Info 显示频道、时长、文件、模型、语言、说话人数和片段数

来源
VidBee 可以显示:
- 视频字幕:下载时保存的各语言或自动字幕轨
- AI transcript:本地语音识别结果
两者都在时,用标题栏的来源切换。闪光图标是本地 ASR,字幕图标是字幕轨。
准确度和模型
按这台电脑选本地模型:Tiny 更快,Small / Base 适合一般机器,需要更高准确率再用更大的。播放与文本对齐,点击一行就能听到那一段。
Not happy with this transcript? 会打开模型选择,必要时下载更大模型并重新识别。当前文稿作为历史保留。任务在后台跑,可以离开页面。
结果是 No speech 时,如果觉得是误判(声音很轻、人声混在音乐里),用 Transcribe anyway。
语言
Whisper 家族覆盖 100+ 语言,并自动检测语种,不必先指定语言。
其他家族更偏专项:
- SenseVoice — 中日韩 + 英语,含粤语
- Parakeet — 偏英语
- Qwen3-ASR — 中文准确率最高
Settings → Transcription 会列出体积、语言说明,以及按这台电脑(系统、GPU、内存、核心数、界面语言)给出的推荐。
导出
Export 先预览当前文本,再复制或存成文件。
样式:
- Transcript — 可读正文
- Subtitles — 带 SRT 风格时间的字幕
- Segments — 按时间片分段
- Whisper — 带说话人的转写
- Video + Subs — 把字幕封装或烧进新视频
文本格式为 .txt 和 .md。可设分组(None、Words、Sentences)以及是否 Show timestamp。

Video + Subs:
- Soft — 封装字幕轨,播放器可开关字幕,速度快、不损画质
- Hard — 烧进画面,会重编码,字幕无法关掉
纯音频只能导出文本。较长的视频导出可以取消。
转写设置
Settings → Transcription
- Transcribe after download
- Maximum number of active transcripts
- 模型目录(体积、语言特点),以及按这台电脑(系统、GPU、内存、核心数、界面语言)给出的推荐
可单独下载、启用或删除某个模型。语言覆盖见上文「语言」。

Settings → Advanced → Download source 可在 GitHub 与中国(ModelScope)镜像之间切换,模型下载慢或被拦时用。
隐私
转写适合不该离开这台电脑的文件。
- 本地识别 — 用本机模型,不会把音频上传去做语音识别
- 离线 — 模型装到磁盘后,可以不联网转写
- 本地文件 — 媒体和文稿留在你指定的文件夹
- AI 是另一步 — AI Prompt 只把文稿文本发给你启用的服务商。Ollama、LM Studio 可以把这一步也留在本机。API 密钥只存在应用里
文稿完成后,可以用这些 Prompt 做摘要、FAQ 或同一段文字的其他整理。