ローカルのメディアファイルを1つアップロード
端末から動画または音声ファイルを直接添付できます。1つのタスクで扱えるソースは1つで、共通アップローダーの上限は50 MBです。
50 MB以下のMP4または対応音声ファイルを1つアップロード。話し声を検索可能な文章、単語タイムスタンプ、再利用できる文字起こし・字幕ファイルへ変換します。
MP4ファイルをタイムスタンプ付きテキストへ変換
端末に保存されているMP4や音声ファイル向けのアップロード型ツールです。ファイルはプロジェクトのアクセス権で保護され、他の文字起こしツールと同じランタイムで処理されます。結果はブラウザーに一時表示するだけでなく、再利用できるプロジェクト成果物として保存されます。
端末から動画または音声ファイルを直接添付できます。1つのタスクで扱えるソースは1つで、共通アップローダーの上限は50 MBです。
メディア内の音声を音声認識するため、MP4に字幕が埋め込まれていなくても、別の字幕ファイルがなくても文字起こしできます。
標準モードが話し言葉を自動判定し、単語単位の時刻を返します。検索、引用、編集位置の確認、字幕作成に利用できます。
完成した成果物をTXT、構造化JSON、SubRip SRT、WebVTTでダウンロードできます。同じファイルを再度文字起こしする必要はありません。

プレゼンや講義の録画をアップロードし、説明内容をタイムスタンプ付きテキストとして残して後から確認できます。
このMP4プレゼンを、言語の自動判定と単語タイムスタンプ付きで文字起こししてください。
録画の時間位置と対応するプロジェクト内の文字起こしと字幕ファイル。
端末に保存したインタビュー、座談会、会話で発言者を分けたい場合は、話者対応モードを選べます。
このインタビューファイルを、話者ラベルと単語タイムスタンプ付きで文字起こししてください。
編集確認、引用、番組ノートに使える話者別の区間。
クレジットは実際の文字起こし時間で精算されます。時刻付きテキストには標準モード、発言者の区別には話者識別モードを選びます。
言語を自動判定し、単語単位のタイムスタンプを生成します。話者ラベルは追加しません。
話者ラベルと音声イベントに対応します。キーターム指定時は1時間540クレジットです。
完了結果には選択したモード、実時間、出力情報が残ります。TXT、JSON、SRT、VTTの再ダウンロードで追加の文字起こし料金は発生しません。
公開リンクまたはアップロードしたファイルを、時刻情報付きの構造化テキストと複数の出力形式へ変換します。

公開動画URLを貼るか、音声・動画ファイルを1つアップロードします。サンドボックスで取得と正規化を行ってから文字起こしします。

音声を検索可能な本文、時刻付き単語、読みやすい区間へ正規化します。高精度モードでは話者と音声イベントも保持できます。

完了した結果をTXT、JSON、SRT、WebVTTとして再利用でき、追加の文字起こしは発生しません。
書き出した映像や撮影ファイルを検索可能な台本にし、引用、字幕、チャプター候補を探せます。
要約や意思決定の抽出を行う前に、アップロードした録画からタイムスタンプ付きの一次記録を残せます。
録画した授業から復習用ノートと字幕を作成し、アクセシビリティや翻訳の引き継ぎに利用できます。
端末からMP4または対応音声ファイルを1つ選びます。上限を超える場合は、アップロード前に圧縮または分割してください。
単語タイムスタンプ付きテキストは1分10クレジットの標準モードを使います。話者ラベルや音声イベントが必要な場合は話者識別モードを指定します。
プロジェクトで完成した文字起こしを確認し、編集、ノート、字幕向けにTXT、JSON、SRT、VTTをダウンロードします。
YouTube、TikTok、Bilibiliなどの公開URLを貼るか、動画・音声ファイルをアップロード。検索本文、単語時刻、任意の話者ラベル、字幕を取得できます。
公開YouTube動画、ショート、ライブ配信アーカイブのリンクを貼り付けます。動画内の音声を処理し、検索可能な文章、タイムスタンプ、再利用できる字幕ファイルを生成します。
音声にアクセスできる公開Reelまたは動画投稿のURLを貼り付け、検索可能な本文、タイムスタンプ、字幕ファイルを作成します。
公開TikTok動画URLを1件貼り付け、発話を検索本文とタイムスタンプへ変換し、字幕ファイルを出力します。
1回の文字起こしで、50 MB以下の動画または音声ファイルを1つアップロードできます。大きな録画は事前に圧縮または分割してください。
必要ありません。ファイル内の音声を文字起こしするため、埋め込み字幕や既存の字幕トラックがなくても利用できます。
標準文字起こしは1分につき10クレジットです。話者識別モードは1時間440クレジット、キーターム指定時は1時間540クレジットです。
完成した文字起こしはSRT、VTT、TXT、JSONで出力できます。話者ラベルと音声イベントが必要な場合は話者識別モードを選びます。
ファイルを1つ添付し、文字起こし、タイムスタンプ、字幕ダウンロードを同じプロジェクトにまとめて保存できます。