Ideart
メニューを開く

AI動画文字起こし:タイムスタンプと字幕を生成

YouTube、TikTok、Bilibiliなどの公開URLを貼るか、動画・音声ファイルをアップロード。検索本文、単語時刻、任意の話者ラベル、字幕を取得できます。

AI動画文字起こし:タイムスタンプと字幕を生成

メディアURL、ファイル、または希望条件を入力…
  • YouTubeなど主要10プラットフォーム
  • 高精度モードの話者ラベル
  • JSON/TXT/SRT/VTT出力

公開動画ページ、公開メディアURL、プロジェクトへのアップロードに対応し、既存のタスク、従量課金、プロジェクト結果の仕組みで安全に処理します。

対応ソースと文字起こし機能

01

YouTubeなど主要サイトに対応

YouTube、Vimeo、TikTok、Douyin、Bilibili、X、Instagram、Facebook、Twitch、Dailymotionの公開ページを利用できます。

02

標準モードは単語時刻付き

標準モードは言語を自動判定し、単語タイムスタンプを返します。未対応の話者は推測しません。

03

話者識別を選択可能

インタビューで話者ラベル、音声イベント、キーターム指定が必要な場合は話者識別モードを選択できます。

04

共通形式から字幕を出力

本文、言語、長さ、単語、区間、話者、来歴を共通形式へ正規化し、JSON、TXT、SRT、VTTを出力します。

利用例

音声波形、話者セグメント、複数形式の書き出しを表すAI生成の文字起こしワークスペース図
01

話者付きインタビュー

編集と引用確認のため、二人の会話を話者区間と単語時刻付きで保存します。

高精度モードで話者ラベルを保ったまま文字起こし。

検索可能な結果とSRT/VTTを生成。

02

標準モードで講義を文字起こし

話者分離が不要な講義は標準モードでタイムスタンプ付きテキストにできます。

言語を自動判定し、標準モードで講義を文字起こし。

話者を推測しない、検索可能な単語時刻付きテキスト。

文字起こしモード、機能、クレジットを比較

実際の文字起こし時間で精算します。必要な出力に合わせてモードを選択できます。

01

標準文字起こし:1分10クレジット

言語を自動判定し、単語タイムスタンプを生成します。話者ラベルは追加しません。

02

話者識別モード:1時間440クレジット

話者ラベルと音声イベントに対応します。キーターム指定時は1時間540クレジットです。

03

利用量を確認でき、成果物はプロジェクト管理

選択したモード、実時間、未対応項目を記録し、結果と出力リンクは元のプロジェクト権限で保護します。

メディアから再利用できる文字起こしへ

公開リンクまたはアップロードしたファイルを、時刻情報付きの構造化テキストと複数の出力形式へ変換します。

動画URLとファイル入力を表すノートパソコン、スマートフォン、録音機器
01

リンクまたはメディアファイルから開始

公開動画URLを貼るか、音声・動画ファイルを1つアップロードします。サンドボックスで取得と正規化を行ってから文字起こしします。

タイムスタンプ付き音声文字起こしを表すマイクと音声波形
02

時刻と文字起こし構造を保持

音声を検索可能な本文、時刻付き単語、読みやすい区間へ正規化します。高精度モードでは話者と音声イベントも保持できます。

文字起こしと字幕出力を表すフィルム、音声波形、重なった文書
03

再実行せずに複数形式へ出力

完了した結果をTXT、JSON、SRT、WebVTTとして再利用でき、追加の文字起こしは発生しません。

用途

01

ポッドキャストと取材

番組ノート、引用、章分け、編集引き継ぎ用の原稿を作成します。

02

講座とウェビナー

録画授業を検索ノートと字幕へ変換し、アクセシビリティを高めます。

03

調査とユーザー面談

要約前に、タイムスタンプ付きの一次記録を保存します。

使い方

  1. 01

    ソースを1つ追加

    公開URLを貼るか、動画・音声ファイルを1つアップロードします。

  2. 02

    精度とコストを選択

    時刻付きテキストには標準モード、話者識別や音声イベントが必要な場合は話者識別モードを選びます。

  3. 03

    結果を活用

    プロジェクトで確認し、JSON、TXT、SRT、VTTをダウンロードします。

よくある質問

対応している動画サイトは?

YouTube、Vimeo、TikTok、Douyin、Bilibili、X/Twitter、Instagram、Facebook、Twitch、Dailymotionの公開ページ、公開メディアURL、アップロードに対応します。

文字起こしモードごとの必要クレジットは?

標準文字起こしは1分10クレジットです。話者識別モードは1時間440クレジット、キーターム指定時は540クレジットです。

動画の最大時間と非公開URLへの対応は?

公開URLは最大24時間、ダウンロード最大4 GBまで準備し、30分ごとに分割します。非公開・ローカルURLは不可で、実際の処理上限はこれより低い場合があります。

字幕出力と話者識別はできますか?

すべての結果をJSON、TXT、SRT、VTTで出力できます。話者ラベルと音声イベントが必要な場合は話者識別モードを選びます。

録音を検索可能な資料へ

URLまたはファイルから始め、字幕、ノート、調査、二次コンテンツへ再利用できます。

文字起こしを生成