上傳一個本機媒體檔案
直接從裝置新增一個影片或音訊檔案。每個任務僅接受一個來源,共用上傳器會將檔案限制在 50 MB 以內。
上傳一個不超過 50 MB 的 MP4 或支援的音訊檔案,將其中的語音轉成可搜尋文字、逐字時間資訊,以及可重複使用的逐字稿或字幕檔案。
MP4 轉文字,產生附時間戳的逐字稿
這個頁面適合處理已儲存在本機裝置上的 MP4 或音訊檔案。檔案會先進入受專案權限保護的附件流程,再使用與其他轉錄工具相同的執行環境,產生可重複使用的專案成果,而不只是在瀏覽器中顯示一段暫存文字。
直接從裝置新增一個影片或音訊檔案。每個任務僅接受一個來源,共用上傳器會將檔案限制在 50 MB 以內。
流程會辨識媒體中的語音,因此 MP4 不必內嵌字幕,也不需要另外上傳字幕檔案。
標準轉錄模式會自動辨識口語語言並傳回逐字時間,方便搜尋、引用、定位剪輯片段和製作字幕。
完成後可重複使用為 TXT、結構化 JSON、SRT 和 WebVTT,不必重新上傳及轉錄同一個檔案。

上傳示範或課程錄影檔案,將口頭講解保留為附時間戳的可搜尋文字,方便後續檢視。
轉錄這個 MP4 示範錄影,自動辨識語言並保留逐字時間。
產生專案內的逐字稿,以及與錄影時間軸對應的字幕檔案。
本機訪談、圓桌討論或對話需要標示發言者時,請選擇支援講者辨識的模式。
轉錄這個已上傳的訪談檔案,區分講者並保留逐字時間。
產生適合編輯審核、引用和節目筆記的講者段落。
點數依實際轉錄時長計算。只需要附時間文字時選擇標準轉錄;需要區分發言者時,則選擇講者辨識模式。
自動辨識語言並產生逐字時間戳;此模式不會加入講者標籤。
支援講者和音訊事件標籤;啟用關鍵字引導時,每小時 540 點。
結果會儲存在專案中,並記錄所選模式和實際時長;下載 TXT、JSON、SRT、VTT 不會再次扣除轉錄點數。
一個公開連結或上傳檔案會被處理成含時間資訊的結構化文字,並可重複下載為多種格式。

貼上公開影片 URL,或上傳一個音訊/影片檔案。沙箱會先下載並標準化媒體,再開始轉錄。

語音會統整為可搜尋全文、附時間的字詞和易讀段落;精準模式也可保留講者和音訊事件。

完成後的結果可以直接重複使用為純文字、結構化 JSON、SRT 字幕或 WebVTT,不會再次執行轉錄。
將匯出的毛片或拍攝檔案轉成可搜尋腳本,再篩選引用內容、字幕和章節。
在摘要或擷取決策前,先保留上傳錄影中的時間戳原始證據。
從課程錄影產生筆記和字幕,用於複習、無障礙需求和在地化交接。
從裝置選擇一個 MP4 或支援的音訊檔案。較大的來源需要先壓縮或分割。
標準轉錄每分鐘 10 點,適合需要逐字時間的文字;確實需要講者或音訊事件標籤時,請選擇講者辨識模式。
在專案中開啟完成的逐字稿,再下載 TXT、JSON、SRT 或 VTT,用於剪輯、筆記或字幕。
貼上 YouTube、抖音、Bilibili 等公開影片連結,或上傳一個影音檔案,即可取得可搜尋的文字、逐字時間戳、選用講者標籤和字幕。
支援公開的 YouTube 影片、Shorts 和直播重播。系統會處理影片中的語音,產生可搜尋的文字、時間戳與可重複使用的字幕檔案。
貼上含有可取得語音內容的公開 Reel 或影片貼文網址,即可產生可搜尋文字、時間戳與字幕檔案,無須重新上傳媒體。
貼上一個公開的 TikTok 影片連結,擷取可搜尋的口播文字與時間資訊,並直接匯出字幕,無須上傳影片。
每個轉錄任務可以上傳一個不超過 50 MB 的影片或音訊檔案。較大的錄影需要先壓縮或分割。
不需要。流程會轉錄檔案中的語音,不要求 MP4 內嵌字幕或已有獨立字幕軌。
標準轉錄每分鐘 10 點。講者辨識模式每小時 440 點,啟用關鍵字引導時每小時 540 點。
完成後的逐字稿可以匯出 SRT、VTT、TXT 和 JSON。需要講者和音訊事件標籤時,請選擇講者辨識模式。
新增一個檔案,將逐字稿、時間戳和字幕下載項目儲存在同一個專案中。