Sube un MP4 para transcribirlo
Adjunta un archivo de vídeo o audio directamente desde tu dispositivo. Cada tarea admite una fuente y el cargador compartido aplica un límite máximo de 50 MB al archivo.
Sube un archivo MP4 o de audio compatible de hasta 50 MB. Convierte el contenido hablado en texto consultable, marcas de tiempo por palabra y archivos descargables de transcripción o subtítulos que podrás reutilizar.
Convertir MP4 a texto con marcas de tiempo
Utiliza este conversor de MP4 a texto cuando ya tengas la grabación guardada en tu dispositivo. Sube un archivo MP4 o de audio compatible, transcribe el contenido hablado sin necesidad de una pista de subtítulos existente y conserva el texto consultable, las marcas de tiempo y las descargas de subtítulos como resultado protegido del proyecto.
Adjunta un archivo de vídeo o audio directamente desde tu dispositivo. Cada tarea admite una fuente y el cargador compartido aplica un límite máximo de 50 MB al archivo.
El reconocimiento de voz funciona a partir del audio del archivo, por lo que el MP4 no necesita subtítulos incrustados ni un archivo de subtítulos independiente.
La transcripción estándar detecta automáticamente el idioma hablado y devuelve marcas de tiempo por palabra para revisar, extraer citas, editar y generar subtítulos.
Reutiliza el resultado completado como TXT, JSON estructurado, SubRip SRT o WebVTT sin volver a subir y transcribir el mismo archivo.

Sube la grabación de una presentación y conserva la explicación hablada como texto consultable con marcas de tiempo para revisarla más adelante.
Transcribe esta presentación en MP4 con detección automática del idioma y marcas de tiempo por palabra.
Una transcripción del proyecto y archivos de subtítulos vinculados a la línea temporal de la grabación.
Elige el modo con identificación de hablantes para una entrevista, mesa redonda o conversación grabada localmente que necesite turnos etiquetados.
Transcribe esta entrevista subida con etiquetas de hablante y marcas de tiempo por palabra.
Segmentos con identificación de hablantes para revisión editorial, citas y notas del programa.
Los créditos se calculan a partir de la duración real de la transcripción. Elige la transcripción estándar para obtener texto con marcas de tiempo o la transcripción con identificación de hablantes cuando necesites atribuir los diálogos.
Incluye detección automática del idioma y marcas de tiempo por palabra. Este modo no añade etiquetas de hablante.
Añade etiquetas de hablante y de eventos de audio. Si activas las indicaciones de términos clave, el coste es de 540 créditos por hora.
El resultado completado registra el modo seleccionado, la duración real y las exportaciones. Las descargas en TXT, JSON, SRT y VTT no inician otro trabajo de transcripción.
Descubre cómo un enlace público o un archivo subido se convierte en texto estructurado con datos de tiempo y formatos de descarga reutilizables.

Pega la URL pública de un vídeo o sube un archivo de audio o vídeo. El entorno aislado descarga y normaliza la fuente antes de transcribirla.

El habla se normaliza en texto consultable, palabras con marcas de tiempo y segmentos legibles. El modo con identificación de hablantes también puede conservar las etiquetas de hablante y los eventos de audio.

Reutiliza el resultado completado como texto sin formato, JSON estructurado, subtítulos SRT o WebVTT sin iniciar otro trabajo de transcripción.
Convierte un montaje exportado o un archivo de cámara en un guion consultable antes de seleccionar citas, subtítulos y capítulos.
Conserva las pruebas con marcas de tiempo de una grabación subida antes de crear resúmenes o extraer decisiones.
Crea notas y archivos de subtítulos a partir de lecciones grabadas para su revisión, accesibilidad y posterior localización.
Elige un archivo MP4 o de audio compatible de tu dispositivo. Divide o comprime los archivos más grandes antes de subirlos.
Elige la transcripción estándar por 10 créditos por minuto para obtener texto con marcas de tiempo por palabra, o el modo con identificación de hablantes cuando necesites etiquetas de hablante reales o etiquetas de eventos de audio.
Abre la transcripción completada en el proyecto y descarga los archivos TXT, JSON, SRT o VTT para editar, tomar notas o crear subtítulos.
Pega la URL pública de un vídeo compatible o sube un archivo multimedia. Este conversor de vídeo a texto crea una transcripción consultable, marcas de tiempo por palabra, etiquetas de hablante opcionales y archivos listos para subtítulos.
Pega el enlace de un vídeo público, Short o repetición de una emisión en directo de YouTube. Genera la transcripción del vídeo con marcas de tiempo por palabra, texto consultable y archivos de subtítulos reutilizables.
Pega la URL de un Reel o una publicación de vídeo pública de Instagram con audio hablado accesible. Genera la transcripción del Reel con marcas de tiempo y archivos de subtítulos sin volver a subir el contenido.
Pega un enlace a un vídeo público de TikTok. Transcribe el audio hablado a texto consultable, conserva marcas de tiempo útiles y exporta subtítulos sin subir el vídeo.
Adjunta un archivo MP4 o de audio compatible, elige el modo de transcripción e inicia la tarea del proyecto. El resultado incluye texto consultable y puede incluir marcas de tiempo por palabra, subtítulos o etiquetas de hablante.
Cada tarea de transcripción admite un archivo de vídeo o audio de hasta 50 MB. Las grabaciones más grandes deben comprimirse o dividirse antes de subirlas.
Sí. El flujo de trabajo transcribe el audio hablado y no requiere que el archivo contenga una pista de subtítulos incrustada.
Sí. Todas las transcripciones completadas pueden exportarse en SRT y VTT, además de TXT y JSON. La transcripción con identificación de hablantes cuesta 440 créditos por hora, o 540 créditos por hora con indicaciones de términos clave; la transcripción estándar cuesta 10 créditos por minuto.
Adjunta un archivo y conserva su transcripción, sus marcas de tiempo y sus subtítulos descargables en el mismo proyecto.