Ideart
開啟選單

AI 影片轉文字:產生影片逐字稿、時間戳與字幕

貼上 YouTube、抖音、Bilibili 等公開影片連結,或上傳一個影音檔案,即可取得可搜尋的文字、逐字時間戳、選用講者標籤和字幕。

AI 影片轉文字:產生影片逐字稿、時間戳與字幕

新增媒體 URL、上傳檔案,或說明你的轉錄需求……
  • 支援 YouTube 等 10 個主流平台
  • 精準模式支援講者標籤
  • 可匯出 JSON/TXT/SRT/VTT

轉錄流程支援公開影片平台頁面、公開媒體直連網址和專案上傳檔案,並沿用現有的任務、用量計費和專案結果流程。所有處理都在受保護的伺服器端環境中完成。

支援的來源與轉錄功能

01

支援 YouTube 等主流平台

支援 YouTube、Vimeo、TikTok、抖音、Bilibili、X、Instagram、Facebook、Twitch 和 Dailymotion 的公開頁面。

02

標準轉錄模式保留逐字時間

標準模式會自動辨識語言並回傳逐字時間戳,但不會加入無法可靠辨識的講者標籤。

03

可選用講者辨識

訪談需要區分發言者、保留音訊事件或使用關鍵字引導時,可以選擇講者辨識模式。

04

統一內容結構並直接匯出字幕

結果統一包含全文、語言、時長、字詞、段落、講者和來源資訊,並可匯出 JSON、TXT、SRT、VTT。

常見轉錄任務

AI 生成的轉錄工作區插圖,呈現音訊波形、講者段落與多格式文件匯出
01

附講者標示的訪談逐字稿

為雙人訪談保留逐字時間和講者段落,方便剪輯與引用審核。

使用精準模式轉錄這段訪談,並保留講者標籤。

在專案內產生可搜尋的逐字稿,並提供 SRT 與 VTT。

02

使用標準模式轉錄課程

單人課程不需要區分講者時,可使用標準模式產生附時間戳的逐字稿。

使用標準轉錄模式處理這堂課程,並自動辨識語言。

產生可搜尋、附逐字時間且不臆測講者的逐字稿。

比較轉錄模式、功能與點數

點數按實際轉錄時長計算。只需依輸出需求選擇模式,無須了解底層服務。

01

標準轉錄:每分鐘 10 點

自動辨識語言並產生逐字時間戳;此模式不會加入講者標籤。

02

講者辨識:每小時 440 點

支援講者和音訊事件標籤;啟用關鍵字引導時,每小時 540 點。

03

用量可供審核,產出歸屬專案

結果會記錄所選模式、實際時長和不支援的選項,逐字稿與匯出連結受原專案權限保護。

從媒體來源到可重複使用的逐字稿

一個公開連結或上傳檔案,會被處理成附時間資訊的結構化文字,並可重複下載為多種格式。

筆記型電腦、手機和錄音設備,代表影片連結與檔案轉錄輸入
01

從連結或媒體檔案開始

貼上公開影片 URL,或上傳一個音訊/影片檔案。沙箱會先下載並標準化媒體,再開始轉錄。

錄音室麥克風與音訊波形,代表附時間戳的語音轉錄
02

保留時間與文字結構

語音會統一整理成可搜尋的全文、附時間的字詞和易讀段落;精準模式還可保留講者和音訊事件。

膠卷、音訊波形和分層文件,代表逐字稿與字幕匯出
03

無須重複轉錄即可匯出

完成後的結果可直接重複用於純文字、結構化 JSON、SRT 字幕或 WebVTT,不會再次執行轉錄。

適用情境

01

Podcast 與訪談

為節目筆記、精華引言、章節和編輯交接產生可審核的講者逐字稿。

02

課程與直播回放

將錄製課程轉成可搜尋的筆記和字幕檔,用於無障礙與在地化。

03

研究與使用者訪談

在歸納主題或擷取決策前,先保留附時間戳的原始證據。

使用流程

  1. 01

    新增一個來源

    貼上公開 URL 或上傳一個影音檔案;私人網路和本機位址會遭拒絕。

  2. 02

    選擇品質與成本

    標準模式用於產生附時間戳的文字;需要講者或音訊事件標籤時,請選擇講者辨識模式。

  3. 03

    使用轉錄產出

    在專案中查看逐字稿,並下載 JSON、TXT、SRT 或 VTT。

常見問題

支援哪些影片平台?

支援 YouTube、Vimeo、TikTok、抖音、Bilibili、X/Twitter、Instagram、Facebook、Twitch、Dailymotion 的公開頁面,以及公開媒體直連網址和上傳檔案。

不同轉錄模式需要多少點數?

標準轉錄每分鐘 10 點。講者辨識模式每小時 440 點;啟用關鍵字引導時,每小時 540 點。

最長支援多長的影片?私人 URL 可以使用嗎?

公開 URL 預處理最長支援 24 小時、最大下載 4 GB,並以 30 分鐘分段處理。私人和區域網路 URL 會遭拒絕;實際處理限制可能更低。

可以下載字幕並區分講者嗎?

所有結果都可匯出為 JSON、TXT、SRT 和 VTT。需要講者和音訊事件標籤時,請選擇講者辨識模式。

讓每段錄音都能被搜尋

從一個 URL 或檔案開始,再將逐字稿用於字幕、筆記、研究和後續內容。

產生逐字稿