上传一个本地媒体文件
直接从设备添加一个视频或音频文件。每个任务只接受一个来源,共享上传器会限制该文件不超过 50 MB。
上传一个不超过 50 MB 的 MP4 或受支持音频文件,把其中的语音转成可搜索文字、词级时间和可复用逐字稿或字幕文件。
把 MP4 文件转成带时间戳的文字
这个页面适合处理已经保存在本地设备上的 MP4 或音频文件。文件会先进入受项目权限保护的附件流程,再使用和其他转写工具相同的 runtime 生成可复用项目产物,而不是只在浏览器里显示一段临时文字。
直接从设备添加一个视频或音频文件。每个任务只接受一个来源,共享上传器会限制该文件不超过 50 MB。
流程会识别媒体中的语音,因此 MP4 不必内嵌字幕,也不需要额外上传字幕文件。
标准转写模式自动识别口语语言并返回词级时间,方便搜索、引用、剪辑定位和制作字幕。
完成后可复用为 TXT、结构化 JSON、SRT 和 WebVTT,无需重新上传并转写同一个文件。

上传演示或录课文件,把口头讲解保留为带时间戳的可搜索文字,便于后续复查。
转写这个 MP4 演示录像,自动识别语言并保留词级时间。
生成项目内逐字稿,以及与录像时间线对应的字幕文件。
本地访谈、圆桌或对话需要标记发言人时,选择支持说话人的模式。
转写这个上传的访谈文件,区分说话人并保留词级时间。
生成适合编辑审核、引用和节目笔记的说话人段落。
积分按实际转写时长结算。只需要带时间文字时选择标准转写,需要区分发言人时选择说话人识别模式。
自动识别语言并生成词级时间戳;此模式不添加说话人标签。
支持说话人和音频事件标签;启用关键词引导时每小时 540 积分。
结果会保存在项目中并记录所选模式和实际时长;下载 TXT、JSON、SRT、VTT 不会再次扣除转写积分。
一个公开链接或上传文件,会被处理成带时间信息的结构化文字,并可重复下载为多种格式。

粘贴公开视频 URL,或上传一个音频/视频文件。沙箱会先下载并标准化媒体,再开始转写。

语音会统一为可搜索全文、带时间的词和可读段落;精准模式还可保留说话人和音频事件。

完成后的结果可以直接复用为纯文本、结构化 JSON、SRT 字幕或 WebVTT,不会再次执行转写。
把导出样片或拍摄文件转成可搜索脚本,再筛选引用、字幕和章节。
在总结或提取决策前,先保留上传录像中的带时间戳原始证据。
从录课生成笔记和字幕,用于复习、无障碍和本地化交接。
从设备选择一个 MP4 或受支持音频文件。更大的来源需要先压缩或拆分。
标准转写每分钟 10 积分,适合词级时间文字;确实需要说话人或音频事件标签时选择说话人识别模式。
在项目中打开完成的逐字稿,再下载 TXT、JSON、SRT 或 VTT,用于剪辑、笔记或字幕。
粘贴 YouTube、抖音、Bilibili 等公开视频链接,或上传一个音视频文件,获得可搜索文字、词级时间戳、可选说话人标签和字幕。
支持公开 YouTube 视频、Shorts 和直播回放。系统处理视频中的语音,生成可搜索文字、时间戳和可复用字幕文件。
粘贴包含可访问口播音频的公开 Reel 或视频帖子 URL,生成可搜索文字、时间戳和字幕文件,无需重新上传媒体。
粘贴一个公开 TikTok 视频链接,提取可搜索口播文字与时间信息,并直接导出字幕,无需上传视频。
每个转写任务可以上传一个不超过 50 MB 的视频或音频文件。更大的录像需要先压缩或拆分。
不需要。流程会转写文件中的语音,不要求 MP4 内嵌字幕或已有单独字幕轨。
标准转写每分钟 10 积分。说话人识别模式每小时 440 积分,启用关键词引导时每小时 540 积分。
完成后的逐字稿可以导出 SRT、VTT、TXT 和 JSON。需要说话人和音频事件标签时,请选择说话人识别模式。
添加一个文件,把逐字稿、时间戳和字幕下载保存在同一个项目内。