Convertir la URL pública de un vídeo a texto
Pega una página pública de YouTube, Vimeo, TikTok, Douyin, Bilibili, X, Instagram, Facebook, Twitch o Dailymotion, o adjunta un archivo de vídeo o audio.
Pega la URL pública de un vídeo compatible o sube un archivo multimedia. Este conversor de vídeo a texto crea una transcripción consultable, marcas de tiempo por palabra, etiquetas de hablante opcionales y archivos listos para subtítulos.
Convertir vídeo a texto con marcas de tiempo
Utiliza este conversor de vídeo a texto cuando tengas la URL pública de un vídeo compatible o un archivo multimedia subido y necesites una transcripción consultable con marcas de tiempo. Admite páginas de vídeos alojados, URL públicas directas de archivos multimedia y archivos de vídeo o audio subidos, y devuelve archivos TXT, JSON, SRT y VTT reutilizables mediante el flujo de trabajo protegido del proyecto.
Pega una página pública de YouTube, Vimeo, TikTok, Douyin, Bilibili, X, Instagram, Facebook, Twitch o Dailymotion, o adjunta un archivo de vídeo o audio.
Las URL públicas compatibles permiten preparar archivos multimedia de hasta 24 horas y 4 GB en fragmentos de 30 minutos. Las subidas directas mantienen el límite compartido de 50 MB por archivo.
La transcripción estándar detecta el idioma y devuelve marcas de tiempo por palabra. Elige el modo con reconocimiento de hablantes solo cuando una entrevista requiera etiquetas de hablante, etiquetas de eventos de audio u orientación mediante términos clave.
Cada resultado utiliza una estructura común de texto, idioma, duración, palabras, segmentos, hablantes y procedencia, con exportación a JSON, TXT, SRT y VTT.

Transcribe una entrevista entre dos personas con marcas de tiempo por palabra y segmentos con reconocimiento de hablantes para editarla y revisar citas.
Transcribe esta entrevista en modo con reconocimiento de hablantes y conserva las etiquetas de hablante.
Una transcripción consultable en el proyecto, además de archivos de subtítulos SRT y VTT.
Utiliza la transcripción estándar para una clase, un seminario web o un monólogo cuando sean importantes el texto consultable y las marcas de tiempo, pero no las etiquetas de hablante.
Transcribe este vídeo largo a texto en modo estándar, detecta el idioma y conserva las marcas de tiempo.
Texto consultable con marcas de tiempo por palabra, sin hablantes inferidos.
Los créditos se calculan según la duración real de la transcripción. Elige el modo por el resultado que necesites, no por los detalles de implementación.
Incluye detección automática del idioma y marcas de tiempo por palabra. Este modo no añade etiquetas de hablante.
Añade etiquetas de hablante y etiquetas de eventos de audio. Activar la orientación mediante términos clave cuesta 540 créditos por hora.
El resultado registra el modo seleccionado, la duración real y las opciones no compatibles. Los archivos de transcripción permanecen protegidos por el proyecto de origen.
Descubre cómo un enlace público o un archivo subido se convierte en texto estructurado con datos temporales y formatos de descarga reutilizables.

Pega la URL pública de un vídeo o sube un archivo de audio o vídeo. El entorno aislado descarga y normaliza la fuente antes de transcribirla.

El habla se normaliza como texto consultable, palabras con marcas de tiempo y segmentos legibles. El modo con reconocimiento de hablantes también puede conservar las etiquetas de hablante y los eventos de audio.

Reutiliza el resultado completado como texto sin formato, JSON estructurado, subtítulos SRT o WebVTT sin iniciar otro trabajo de transcripción.
Crea transcripciones revisables con reconocimiento de hablantes para notas del programa, citas, capítulos y entrega editorial.
Convierte clases grabadas en notas consultables y archivos de subtítulos para mejorar la accesibilidad y facilitar la localización.
Conserva pruebas con marcas de tiempo de las llamadas antes de resumir temas o extraer decisiones.
Pega una URL pública o sube un archivo de audio o vídeo. Se rechazan las URL privadas y de redes locales.
Elige la transcripción estándar para obtener texto con marcas de tiempo, o el modo con reconocimiento de hablantes cuando sean importantes las etiquetas de hablante o los eventos de audio.
Abre la transcripción en el proyecto y descarga JSON, TXT, SRT o VTT sin pagar por otro trabajo de transcripción.
Pega el enlace de un vídeo público, Short o repetición de una emisión en directo de YouTube. Genera la transcripción del vídeo con marcas de tiempo por palabra, texto consultable y archivos de subtítulos reutilizables.
Sube un archivo MP4 o de audio compatible de hasta 50 MB. Convierte el contenido hablado en texto consultable, marcas de tiempo por palabra y archivos descargables de transcripción o subtítulos que podrás reutilizar.
Pega la URL de un Reel o una publicación de vídeo pública de Instagram con audio hablado accesible. Genera la transcripción del Reel con marcas de tiempo y archivos de subtítulos sin volver a subir el contenido.
Pega un enlace a un vídeo público de TikTok. Transcribe el audio hablado a texto consultable, conserva marcas de tiempo útiles y exporta subtítulos sin subir el vídeo.
Pega en el ejecutor una página pública compatible o la URL directa de un archivo multimedia. Se admiten páginas públicas de YouTube, Vimeo, TikTok, Douyin, Bilibili, X o Twitter, Instagram, Facebook, Twitch y Dailymotion, además de archivos subidos.
Las URL públicas compatibles permiten preparar archivos multimedia de hasta 24 horas y 4 GB en fragmentos de 30 minutos. Las subidas directas admiten un archivo de vídeo o audio de hasta 50 MB. Los límites de procesamiento pueden ser inferiores.
La transcripción estándar cuesta 10 créditos por minuto. La transcripción con reconocimiento de hablantes cuesta 440 créditos por hora, o 540 créditos por hora si se activa la orientación mediante términos clave.
Cada transcripción completada se puede exportar a JSON, TXT, SRT y VTT. Elige el modo con reconocimiento de hablantes si también necesitas etiquetas de hablante o etiquetas de eventos de audio.
Empieza con una URL o un archivo y reutiliza después la transcripción para subtítulos, notas, investigación y contenidos derivados.