Ideart
Abrir menú

Convertir vídeo a texto con marcas de tiempo

Pega la URL pública de un vídeo compatible o sube un archivo multimedia. Este conversor de vídeo a texto crea una transcripción consultable, marcas de tiempo por palabra, etiquetas de hablante opcionales y archivos listos para subtítulos.

Convertir vídeo a texto con marcas de tiempo

Añade una URL multimedia, sube un archivo o describe la transcripción que necesitas...
  • YouTube y otras 9 plataformas de alojamiento
  • Etiquetas de hablante en el modo con reconocimiento de hablantes
  • Exportación a JSON, TXT, SRT y VTT

Utiliza este conversor de vídeo a texto cuando tengas la URL pública de un vídeo compatible o un archivo multimedia subido y necesites una transcripción consultable con marcas de tiempo. Admite páginas de vídeos alojados, URL públicas directas de archivos multimedia y archivos de vídeo o audio subidos, y devuelve archivos TXT, JSON, SRT y VTT reutilizables mediante el flujo de trabajo protegido del proyecto.

Entradas compatibles y funciones de transcripción

01

Convertir la URL pública de un vídeo a texto

Pega una página pública de YouTube, Vimeo, TikTok, Douyin, Bilibili, X, Instagram, Facebook, Twitch o Dailymotion, o adjunta un archivo de vídeo o audio.

02

Transcribir vídeos largos alojados por fragmentos

Las URL públicas compatibles permiten preparar archivos multimedia de hasta 24 horas y 4 GB en fragmentos de 30 minutos. Las subidas directas mantienen el límite compartido de 50 MB por archivo.

03

Añadir marcas de tiempo o etiquetas de hablante reales

La transcripción estándar detecta el idioma y devuelve marcas de tiempo por palabra. Elige el modo con reconocimiento de hablantes solo cuando una entrevista requiera etiquetas de hablante, etiquetas de eventos de audio u orientación mediante términos clave.

04

Descargar la transcripción del vídeo o los subtítulos

Cada resultado utiliza una estructura común de texto, idioma, duración, palabras, segmentos, hablantes y procedencia, con exportación a JSON, TXT, SRT y VTT.

Trabajos de transcripción habituales

Ilustración generada por IA de un espacio de transcripción con forma de onda, segmentos de hablantes y exportación a varios formatos
01

Entrevista con etiquetas de hablante

Transcribe una entrevista entre dos personas con marcas de tiempo por palabra y segmentos con reconocimiento de hablantes para editarla y revisar citas.

Transcribe esta entrevista en modo con reconocimiento de hablantes y conserva las etiquetas de hablante.

Una transcripción consultable en el proyecto, además de archivos de subtítulos SRT y VTT.

02

Vídeo largo a texto con marcas de tiempo

Utiliza la transcripción estándar para una clase, un seminario web o un monólogo cuando sean importantes el texto consultable y las marcas de tiempo, pero no las etiquetas de hablante.

Transcribe este vídeo largo a texto en modo estándar, detecta el idioma y conserva las marcas de tiempo.

Texto consultable con marcas de tiempo por palabra, sin hablantes inferidos.

Compara modos de transcripción, funciones y créditos

Los créditos se calculan según la duración real de la transcripción. Elige el modo por el resultado que necesites, no por los detalles de implementación.

01

Transcripción estándar — 10 créditos por minuto

Incluye detección automática del idioma y marcas de tiempo por palabra. Este modo no añade etiquetas de hablante.

02

Transcripción con reconocimiento de hablantes — 440 créditos por hora

Añade etiquetas de hablante y etiquetas de eventos de audio. Activar la orientación mediante términos clave cuesta 540 créditos por hora.

03

Uso auditable y propiedad del proyecto

El resultado registra el modo seleccionado, la duración real y las opciones no compatibles. Los archivos de transcripción permanecen protegidos por el proyecto de origen.

De la fuente multimedia a una transcripción reutilizable

Descubre cómo un enlace público o un archivo subido se convierte en texto estructurado con datos temporales y formatos de descarga reutilizables.

Portátil, teléfono y grabadora de audio que representan las entradas mediante URL de vídeo y archivos para la transcripción
01

Empieza con un enlace o archivo multimedia

Pega la URL pública de un vídeo o sube un archivo de audio o vídeo. El entorno aislado descarga y normaliza la fuente antes de transcribirla.

Micrófono de estudio con una forma de onda de audio que representa la transcripción de voz con marcas de tiempo
02

Conserva las marcas de tiempo y la estructura de la transcripción

El habla se normaliza como texto consultable, palabras con marcas de tiempo y segmentos legibles. El modo con reconocimiento de hablantes también puede conservar las etiquetas de hablante y los eventos de audio.

Tira de película, forma de onda de audio y documentos superpuestos que representan la exportación de transcripciones y subtítulos
03

Exporta sin volver a transcribir

Reutiliza el resultado completado como texto sin formato, JSON estructurado, subtítulos SRT o WebVTT sin iniciar otro trabajo de transcripción.

Casos de uso

01

Pódcast y entrevistas

Crea transcripciones revisables con reconocimiento de hablantes para notas del programa, citas, capítulos y entrega editorial.

02

Cursos y seminarios web

Convierte clases grabadas en notas consultables y archivos de subtítulos para mejorar la accesibilidad y facilitar la localización.

03

Investigación y llamadas con usuarios

Conserva pruebas con marcas de tiempo de las llamadas antes de resumir temas o extraer decisiones.

Cómo funciona

  1. 01

    Pega la URL de un vídeo o sube un archivo multimedia

    Pega una URL pública o sube un archivo de audio o vídeo. Se rechazan las URL privadas y de redes locales.

  2. 02

    Elige marcas de tiempo o etiquetas de hablante

    Elige la transcripción estándar para obtener texto con marcas de tiempo, o el modo con reconocimiento de hablantes cuando sean importantes las etiquetas de hablante o los eventos de audio.

  3. 03

    Descarga archivos de texto o subtítulos

    Abre la transcripción en el proyecto y descarga JSON, TXT, SRT o VTT sin pagar por otro trabajo de transcripción.

Preguntas frecuentes

¿Cómo puedo convertir la URL de un vídeo a texto?

Pega en el ejecutor una página pública compatible o la URL directa de un archivo multimedia. Se admiten páginas públicas de YouTube, Vimeo, TikTok, Douyin, Bilibili, X o Twitter, Instagram, Facebook, Twitch y Dailymotion, además de archivos subidos.

¿Puede este generador de transcripciones procesar vídeos largos?

Las URL públicas compatibles permiten preparar archivos multimedia de hasta 24 horas y 4 GB en fragmentos de 30 minutos. Las subidas directas admiten un archivo de vídeo o audio de hasta 50 MB. Los límites de procesamiento pueden ser inferiores.

¿Cuánto cuesta transcribir un vídeo a texto?

La transcripción estándar cuesta 10 créditos por minuto. La transcripción con reconocimiento de hablantes cuesta 440 créditos por hora, o 540 créditos por hora si se activa la orientación mediante términos clave.

¿Puedo crear una transcripción de vídeo con etiquetas de hablante y subtítulos?

Cada transcripción completada se puede exportar a JSON, TXT, SRT y VTT. Elige el modo con reconocimiento de hablantes si también necesitas etiquetas de hablante o etiquetas de eventos de audio.

Haz que cada grabación sea consultable

Empieza con una URL o un archivo y reutiliza después la transcripción para subtítulos, notas, investigación y contenidos derivados.

Generar una transcripción