每条字幕都带有时间戳
查看识别文本对应的起止时间。
将录音和视频中的语音转换为带时间戳的字幕,可下载 SRT 或 JSON。
最长 3 小时;媒体文件最大 2 GB
MP4 / FLV / TS / AVI / MOV / WMV / MKV / MP3 / M4A / WAV
文件受账户权限保护,在云端处理。原文件:24 小时 · 结果:7 天
为访谈、会议和视频生成字幕初稿,通过时间戳快速定位每段语音。
查看识别文本对应的起止时间。
可选择简体中文、美国英语、西班牙语或印度尼西亚语。
提交任务后可继续使用其他页面,任务会在云端处理。
SRT 可用于字幕编辑器和播放器;JSON 保留结构化文本、时间及可用的说话人标签。
按检查后的输入时长报价,开始处理前显示总积分。
原文件可在账户内访问 24 小时,转写结果可访问 7 天。
上传文件、选择语音语言,然后下载转写结果。
选择支持的音频或视频,最大 2 GB、最长 3 小时。
选择语音语言,并决定是否请求说话人标签。
检查带时间戳的文本,然后下载 SRT 或 JSON。
为访谈、录音和视频工作流准备字幕文件。
从录制对话生成带时间戳的文本,方便检查和编辑。

将支持的录音转换为可查看和导出的字幕文本。

从支持的视频文件生成 SRT 或 JSON 转写结果。

上传后会检查文件是否符合要求,请保留原始文件。
单个音频或视频最大 2 GB、最长 3 小时,更长录音需先拆分再上传。
根据录音中的语音选择简体中文、美国英语、西班牙语(西班牙)或印度尼西亚语。
可下载供播放器或编辑器使用的 SRT 字幕,或包含结构化文本和时间戳的 JSON。结果是独立文件,不会烧录到视频画面中;可在常用字幕编辑器中校对和修改。
开启后会尝试区分不同声音,并在可用时返回 speaker_0 等标签。标签不代表真实身份,也可能缺失或识别错误。
背景噪声、多人同时说话、口音和含糊语音可能造成漏字或错字。请对照录音检查人名、数字与时间,再用字幕或文本编辑器修改下载的文件。
了解语言选择、转写准确度与下载结果的用途。