
上传 MP3、WAV、M4A 或 FLAC,把口播写成带起止时间的 SRT。没有视频容器也可以。单个不超过 300 MB。
01上传音频
MP3、WAV、M4A、AAC、FLAC 或 OGG,不超过 300 MB。播客、讲座、访谈不用先套进视频。
02按时间切开
语音识别把对白分成字幕行,并标上开始和结束时间。
03下载 SRT 或 TXT
要挂到播放器或剪辑软件时用 SRT。只要稿子时用 TXT。

只有录音、没有画面,也要一条能进剪辑的 SRT。
播客、采访笔、会议录音,源就是音频。先套进一条空视频再提取,多一步还容易把采样率搞乱。直接上传音频来转写。
稿子可以阅读,但不能拖进时间线。SRT 带每句的起止。专有名词和口音重的句子会错,预览里改完再下。
先有原文 SRT,才能用字幕翻译保持时间轴。这一步解决的是「还没有字幕文件」。
音乐压过人声、几个人同时说,听写会糊。能先做过人声分离的,准度更好。做不到也仍会出一版,你要校对。
浏览器里上传,300 MB 以内。处理时留在页面。
预览免费。确认时间轴大致能用,再登录下载 SRT 或页面提供的文本。
带序号、起止时间和文本的字幕,可以挂到视频上,或再拿去翻译。
转写和预览免费。下载时登录。
可以。直接上传 MP3、WAV、M4A 等音频。
MP3、WAV、M4A、AAC、FLAC、OGG,单个不超过 300 MB。
公开的 YouTube 或 TikTok 可以。会先取出声音,再走同一条转写。
上传 SRT 或 VTT。每一条字幕的时间码保留,只换文字,译完可以直接再上传到各平台。