Convertir una URL pública de video a texto
Pega una página pública de YouTube, Vimeo, TikTok, Douyin, Bilibili, X, Instagram, Facebook, Twitch o Dailymotion, o adjunta un archivo de video o audio.
Pega una URL pública de video compatible o sube un archivo multimedia. Este convertidor de video a texto crea una transcripción consultable, marcas de tiempo por palabra, etiquetas de hablantes opcionales y archivos listos para subtítulos.
Convertir video a texto con marcas de tiempo
Usa este convertidor de video a texto cuando tengas una URL pública de video compatible o un archivo multimedia subido y necesites una transcripción consultable con marcas de tiempo. Admite páginas de videos alojados, URL públicas directas de archivos multimedia y archivos de video o audio subidos; luego devuelve archivos TXT, JSON, SRT y VTT reutilizables mediante el flujo de trabajo protegido del proyecto.
Pega una página pública de YouTube, Vimeo, TikTok, Douyin, Bilibili, X, Instagram, Facebook, Twitch o Dailymotion, o adjunta un archivo de video o audio.
Las URL públicas compatibles permiten preparar contenido multimedia de hasta 24 horas y 4 GB en segmentos de 30 minutos. Las cargas directas mantienen el límite compartido de 50 MB por archivo.
La transcripción estándar detecta el idioma y devuelve marcas de tiempo por palabra. Elige el modo con reconocimiento de hablantes solo cuando una entrevista requiera etiquetas de hablantes, etiquetas de eventos de audio u orientación mediante términos clave.
Cada resultado usa una estructura unificada de texto, idioma, duración, palabras, segmentos, hablantes y procedencia, con exportaciones en JSON, TXT, SRT y VTT.

Transcribe una entrevista entre dos personas con marcas de tiempo por palabra y segmentos con reconocimiento de hablantes para editar y revisar citas.
Transcribe esta entrevista en modo con reconocimiento de hablantes y conserva las etiquetas de hablantes.
Una transcripción consultable en el proyecto, además de archivos de subtítulos SRT y VTT.
Usa la transcripción estándar para una clase, un webinar o un monólogo cuando necesites texto consultable y marcas de tiempo, pero no etiquetas de hablantes.
Transcribe este video largo a texto en modo estándar, detecta el idioma y conserva las marcas de tiempo.
Texto consultable con marcas de tiempo por palabra, sin hablantes inferidos.
Los créditos se calculan según la duración real de la transcripción. Elige el modo según el resultado que necesites y no por detalles de implementación.
Incluye detección automática del idioma y marcas de tiempo por palabra. Este modo no agrega etiquetas de hablantes.
Agrega etiquetas de hablantes y de eventos de audio. Activar la orientación mediante términos clave cuesta 540 créditos por hora.
El resultado registra el modo seleccionado, la duración real y las opciones no compatibles. Los archivos de transcripción permanecen protegidos por el proyecto de origen.
Descubre cómo un enlace público o un archivo subido se convierte en texto estructurado con datos de tiempo y formatos de descarga reutilizables.

Pega una URL pública de video o sube un archivo de audio o video. El entorno aislado descarga y normaliza la fuente antes de transcribirla.

El habla se normaliza como texto consultable, palabras con marcas de tiempo y segmentos legibles. El modo con reconocimiento de hablantes también puede conservar las etiquetas de hablantes y los eventos de audio.

Reutiliza el resultado terminado como texto sin formato, JSON estructurado, subtítulos SRT o WebVTT sin iniciar otra tarea de transcripción.
Crea transcripciones revisables con reconocimiento de hablantes para notas del programa, citas, capítulos y entrega al equipo editorial.
Convierte lecciones grabadas en notas consultables y archivos de subtítulos para accesibilidad y localización.
Conserva evidencia con marcas de tiempo de las llamadas antes de resumir temas o extraer decisiones.
Pega una URL pública o sube un archivo de audio o video. Se rechazan las URL privadas y de redes locales.
Elige la transcripción estándar para obtener texto con marcas de tiempo, o el modo con reconocimiento de hablantes cuando sean importantes las etiquetas de hablantes o los eventos de audio.
Abre la transcripción en el proyecto y descarga archivos JSON, TXT, SRT o VTT sin pagar otra tarea de transcripción.
Pega el enlace de un video público, Short o repetición en vivo de YouTube. Genera la transcripción del video con tiempos por palabra, texto consultable y archivos de subtítulos reutilizables.
Sube un archivo MP4 o de audio compatible de hasta 50 MB. Convierte el contenido hablado en texto consultable, marcas de tiempo por palabra y archivos descargables de transcripción o subtítulos que puedes reutilizar.
Pega la URL de un Reel o una publicación de video pública de Instagram con audio hablado accesible. Genera una transcripción del Reel con marcas de tiempo y archivos de subtítulos sin volver a subir el contenido.
Pega el enlace de un video público de TikTok. Transcribe el audio hablado a texto consultable, conserva marcas de tiempo útiles y exporta subtítulos sin subir el clip.
Pega una página pública compatible o una URL directa de un archivo multimedia en el ejecutor. Se admiten páginas públicas de YouTube, Vimeo, TikTok, Douyin, Bilibili, X o Twitter, Instagram, Facebook, Twitch y Dailymotion, además de archivos subidos.
Las URL públicas compatibles permiten preparar contenido multimedia de hasta 24 horas y 4 GB en segmentos de 30 minutos. Las cargas directas admiten un archivo de video o audio de hasta 50 MB. Los límites de procesamiento pueden ser menores.
La transcripción estándar cuesta 10 créditos por minuto. La transcripción con reconocimiento de hablantes cuesta 440 créditos por hora, o 540 créditos por hora si se activa la orientación mediante términos clave.
Cada transcripción terminada se puede exportar en JSON, TXT, SRT y VTT. Elige el modo con reconocimiento de hablantes si también necesitas etiquetas de hablantes o de eventos de audio.
Comienza con una URL o un archivo y reutiliza la transcripción para subtítulos, notas, investigación y contenido posterior.