字幕与转录
OpenScreen 完全在本机转录录制内容的音频:你的音频绝不会被上传,模型下载到磁盘后即可离线工作。这一份转录文本随后是两样东西的来源:烧录进视频的字幕,以及一个可以用来编辑录制内容的文本视图。
转录
每个片段都有自己的转录文本。可以通过以下任一方式运行转录:
- 在媒体工作区:选中一张素材卡片,然后点击重新生成。你也可以在这里用重新生成为强制指定 Whisper 支持的 100 种语言之一,而不是保持自动检测;每个素材的状态也显示在这里(等待转录、正在转录、转录已就绪、转录失败,以及媒体库中列出的其他状态)。
- 在编辑器检查器的转录文本面板中:立即转录会对当前媒体运行同一套处理流程。
whisper.cpp 引擎内置在应用中,模型则没有。首次运行时会从 huggingface.co 下载模型(约 264 MB,经过 SHA-256 校验,并以原子方式写入,所以绝不会用到只下载了一半的文件),这是转录唯一需要联网的时候。此后便完全离线运行,后端在运行时自动选择:Apple Silicon 上用 Metal,Windows 和 Linux 上用 Vulkan 并可回退到 CPU,Intel Mac 上用 CPU。
词语的时间点来自 Whisper 自身的 DTW token 时间戳,随后再根据音频本身重新对齐:每个边界都会被拉回到它之前最安静的那一刻。正因如此,通过转录文本进行的剪切才会落在词语真正开始的位置,而不是晚一个音节。
字幕
字幕是转录文本的实时视图,而不是生成之后还要由你来维护的文字。无论你修改转录文本、修改字幕设置,还是在时间轴上移动片段,字幕条目都会在下一帧随之更新:没有重新生成的步骤,也没有需要核对的过时副本。
在检查器的转录文本面板中,点击字幕:
| 部分 | 控件 |
|---|---|
| 显示字幕 | 预览和导出共用的总开关。 |
| 语言 | 原文(转录),或你已经生成的任一翻译层。 |
| 文本 | 字体、字号、粗体、文字颜色。 |
| 背景 | 文字后方底板的开关、颜色和不透明度。 |
| 位置 | 底部或顶部,以及与该边缘的距离(画面的 0–50%);左对齐、居中或右对齐,以及与该侧的距离(0–25%,居中时没有此项)。 |
| 行长 | 每行的最少和最多词数(1–12)。每行都会在这个范围内排布。 |
位置中的所有数值都是相对于导出的画面来计算的,而不是相对于画面中的视频。修改内边距时,字幕会停留在你放置的位置,而且可以位于内边距区域中:把垂直距离设为 0,文字就会紧贴画面的顶边或底边。较长的字幕会朝远离所固定边缘的方向延伸,所以底部字幕向上延伸,顶部字幕向下延伸。
字号以 1080 像素高的画面为基准、以像素为单位表示,并随实际输出等比缩放,因此在 720p、1080p 或 Source 下,字幕看起来都一样。预览和导出共用同一套排版代码:所见即所烧录。烧录是字幕唯一的输出形式:OpenScreen 不会另外写出 .srt 或 .vtt 文件,所以观看文件的人无法关闭字幕。本地字幕方案对比列出了确实会写出字幕文件的录屏软件。
翻译
选择目标语言,然后点击翻译。下拉菜单中提供 15 种目标语言:英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、波兰语、土耳其语、俄语、阿拉伯语、印地语、日语、韩语和中文。
翻译通过你已连接的 LLM 提供方进行(参见 AI 编辑),这是唯一需要联网的字幕功能。译文与转录文本分开保存,绝不会写进转录文本:原文及其时间点保持不变,你随时可以切换回原文,删除某个译文后,录制内容也和之前完全一样。添加素材后重新运行,只会为新增的素材产生开销;模型没有返回的内容会回退为原文,而不会凭空编造。
用旧版“生成字幕”流程创建的项目,会把字幕文字存为真正的标注,这些标注会绘制在实时字幕层之上。字幕面板会检测到它们并提供移除选项;由于这会删除数据,它会先征求你的同意。
编辑转录文本
转录文本面板汇总显示时间轴上所有片段的转录文本。它是录制内容的实时文本视图:
- 选中一个词或一段词语,按
Backspace/Delete,即可把这一段标记为跳过:它会从播放和导出中剪掉,效果与时间轴上的剪辑区间完全相同,只是改由文字来操作。 - 被跳过的部分会以红色删除线显示。将鼠标悬停在上面即可恢复。
- 静音会直接在文本中标出,也可以用同样的方式剪掉或恢复。
无需上传,不经过云端:这些操作都基于已经保存在你项目中的转录文本。