整个流程都在浏览器里完成,不用装任何东西,也不需要你先把音频抽出来。
第一步 —— 上传视频文件把文件拖进上传区,或者从硬盘选一个。文件从浏览器直接传到存储,所以大体积录制不会卡在中间的大小限制上,上传过程中也有进度条可看。
支持的格式MP4、MOV、AVI、MKV 和 WebM,基本覆盖了相机、手机和录屏软件的所有输出。不需要先导出 MP3 再转写这种两道工序 —— 音轨会自动提取。
大小与时长限制每个文件最长 120 分钟,付费版单个视频最大 2GB。作个参照,2GB 大约是半小时 1080p 素材,或者完整两小时的 480p。免费账号支持 10 分钟以内的文件。
第二步 —— 交给 AI 转写上传一完成就开始处理。十分钟的视频通常一分钟内返回;长录制会在内部切分处理再拼回来,所以两小时的文件和两分钟的文件用起来没有区别。
关于语言选择说话的语言会在 100 多种语言里自动识别,基本不需要你去设置。中途换语言的录制,也会按每一段实际说的语言分别转写。
怎样拿到更准的转写稿识别质量取决于录音本身,而不是转写工具。能直接发布的稿子和必须重写的稿子,差别基本可以用下面四点解释。
录人声,不要录房间贴近说话人的领夹麦或头戴麦,胜过摆在桌子对面的贵麦克风。距离正是让房间混响和环境噪音混进来的原因,而一旦录进去,再好的模型也不如「一开始就没录进去」干净。
尽量别抢话两个人同时说话,是结果糊掉最常见的原因。录访谈或圆桌时,每次回答前停顿一下,不花任何成本,效果提升却是肉眼可见的。
先去掉背景音乐垫在对话下面的音乐,对识别的干扰远大于空调这类稳定噪音。素材里有配乐的话,请在转写之前去掉,而不是之后。
专有名词和术语要预留修改产品名、公司名和专业术语,是即便 97% 准确率的稿子也会露馅的地方。在导出的文本上做一遍查找替换,一分钟不到就能处理完,而且值得赶在做成字幕之前处理掉。
第三步 —— 检查并导出转写结果会按时间戳切成段落呈现,可以直接读和改。所有导出格式都基于同一份结果,所以一次转写可以拿走不止一种格式。
导出 TXT 做文档纯文本,可带可不带时间码。用来做纪要、检索、引用,或者把内容倒进初稿,选它就对了。
导出 SRT / VTT 做字幕带时间轴的字幕文件,可直接导入 YouTube、Premiere、Final Cut 或任意播放器。把 SRT 和视频一起上传,字幕无需再编辑就能显示。