Converta a URL pública de um vídeo em texto
Cole uma página pública do YouTube, Vimeo, TikTok, Douyin, Bilibili, X, Instagram, Facebook, Twitch ou Dailymotion, ou anexe um arquivo de vídeo ou áudio.
Cole a URL pública de um vídeo compatível ou envie um arquivo de mídia. Este conversor de vídeo para texto cria uma transcrição pesquisável, com marcação de tempo por palavra, identificação opcional de falantes e arquivos prontos para legendas.
Converta vídeo para texto com marcações de tempo
Use este conversor de vídeo para texto quando tiver uma URL pública de vídeo compatível ou um arquivo de mídia enviado e precisar de uma transcrição pesquisável com marcações de tempo. Ele aceita páginas de vídeos hospedados, URLs públicas diretas de mídia e uploads de vídeo e áudio, gerando arquivos TXT, JSON, SRT e VTT reutilizáveis por meio do fluxo protegido do projeto.
Cole uma página pública do YouTube, Vimeo, TikTok, Douyin, Bilibili, X, Instagram, Facebook, Twitch ou Dailymotion, ou anexe um arquivo de vídeo ou áudio.
URLs públicas compatíveis permitem preparar mídias de até 24 horas e 4 GB em partes de 30 minutos. Uploads diretos mantêm o limite compartilhado de 50 MB para um único arquivo.
A transcrição padrão detecta o idioma e retorna a marcação de tempo das palavras. Escolha o modo com reconhecimento de falantes apenas quando uma entrevista exigir identificação de falantes, marcadores de eventos sonoros ou orientação por termos-chave.
Todos os resultados usam uma estrutura única de texto, idioma, duração, palavras, segmentos, falantes e procedência, com exportação em JSON, TXT, SRT e VTT.

Transcreva uma entrevista entre duas pessoas com marcação de tempo por palavra e segmentos com reconhecimento de falantes para edição e revisão de citações.
Transcreva esta entrevista no modo com reconhecimento de falantes e mantenha a identificação dos falantes.
Uma transcrição pesquisável no projeto, além de arquivos de legenda SRT e VTT.
Use a transcrição padrão para uma palestra, webinar ou monólogo quando o texto pesquisável e as marcações de tempo forem importantes, mas a identificação dos falantes não for necessária.
Transcreva este vídeo longo para texto no modo padrão, detecte o idioma e preserve as marcações de tempo.
Texto pesquisável com marcação de tempo por palavra, sem falantes inferidos.
Os créditos são calculados com base na duração real da transcrição. Escolha o modo de acordo com o resultado de que você precisa, e não com os detalhes de implementação.
Inclui detecção automática de idioma e marcações de tempo no nível das palavras. Este modo não adiciona identificação de falantes.
Adiciona identificação de falantes e marcadores de eventos sonoros. Ativar a orientação por termos-chave custa 540 créditos por hora.
O resultado registra o modo selecionado, a duração real e as opções não compatíveis. Os arquivos de transcrição permanecem protegidos pelo projeto de origem.
Veja como um link público ou arquivo enviado se transforma em texto estruturado com dados de tempo e formatos reutilizáveis para download.

Cole uma URL pública de vídeo ou envie um arquivo de áudio ou vídeo. O ambiente isolado baixa e normaliza a fonte antes da transcrição.

A fala é normalizada em texto pesquisável, palavras com marcações de tempo e segmentos legíveis. O modo com reconhecimento de falantes também pode manter a identificação dos falantes e os eventos sonoros.

Reutilize o resultado concluído como texto simples, JSON estruturado, legendas SRT ou WebVTT sem iniciar outro trabalho de transcrição.
Crie transcrições revisáveis com reconhecimento de falantes para notas do programa, citações, capítulos e entrega à equipe editorial.
Transforme aulas gravadas em anotações pesquisáveis e arquivos de legenda para acessibilidade e localização.
Preserve evidências com marcações de tempo das chamadas antes de resumir temas ou extrair decisões.
Cole uma URL pública ou envie um arquivo de áudio ou vídeo. URLs privadas e de redes locais são rejeitadas.
Escolha a transcrição padrão para obter texto com marcações de tempo ou o modo com reconhecimento de falantes quando a identificação dos falantes ou os eventos sonoros forem importantes.
Abra a transcrição no projeto e baixe JSON, TXT, SRT ou VTT sem pagar por outro trabalho de transcrição.
Cole o link de um vídeo público, Short ou replay de transmissão ao vivo do YouTube. Gere a transcrição do vídeo com marcações de tempo por palavra, texto pesquisável e arquivos de legenda reutilizáveis.
Envie um arquivo MP4 ou de áudio compatível de até 50 MB. Converta o conteúdo falado em texto pesquisável, marcações de tempo por palavra e arquivos de transcrição ou legenda para download e reutilização.
Cole a URL de um Reel ou de uma publicação de vídeo pública do Instagram com áudio falado acessível. Gere a transcrição do Reel com marcações de tempo e arquivos de legenda sem precisar enviar a mídia novamente.
Cole o link de um vídeo público do TikTok. Transcreva o áudio falado em texto pesquisável, preserve marcações de tempo úteis e exporte legendas sem precisar enviar o clipe.
Cole uma página pública compatível ou uma URL direta de mídia no executor. Há suporte para páginas públicas do YouTube, Vimeo, TikTok, Douyin, Bilibili, X ou Twitter, Instagram, Facebook, Twitch e Dailymotion, além de arquivos enviados.
URLs públicas compatíveis permitem preparar mídias de até 24 horas e 4 GB em partes de 30 minutos. Uploads diretos aceitam um arquivo de vídeo ou áudio de até 50 MB. Os limites de processamento podem ser menores.
A transcrição padrão custa 10 créditos por minuto. A transcrição com reconhecimento de falantes custa 440 créditos por hora ou 540 créditos por hora com a orientação por termos-chave ativada.
Toda transcrição concluída pode ser exportada em JSON, TXT, SRT e VTT. Escolha o modo com reconhecimento de falantes quando também precisar identificar os falantes ou marcar eventos sonoros.
Comece com uma URL ou um arquivo e reutilize a transcrição em legendas, anotações, pesquisas e conteúdos derivados.