Pega un enlace de YouTube y obtén el texto. Da igual que sea un video suelto, una lista de reproducción o un canal entero: la aplicación expande el enlace, arma una cola y transcribe uno por uno.

No depende de que el video tenga subtítulos. El audio se reconoce con Whisper en tu equipo: no hay API detrás, ni clave que configurar, ni texto que salga de tu máquina.

Tres formas de usarlo, un solo motor

Lo que encolas en el escritorio lo ves en el panel del navegador, y al revés: comparten la misma cola de trabajos.

🖥️ Aplicación de escritorio

Doble clic en Windows 10 u 11. Sin instalar Python, sin tocar el PATH.

VideoTranscriptStudio.exe

🌐 Panel local

La misma aplicación en el navegador, escuchando solo en tu propia máquina.

http://127.0.0.1:8760

⌨️ Línea de comandos

Para lotes, scripts y servidores sin pantalla. Con códigos de salida útiles.

vts run <URL> --limit 20

Un asistente de cuatro etapas

La etapa 0 explica qué hace el programa —y qué no hace— antes de pedirte nada. Las tres siguientes son una decisión cada una.

Etapa 0 del panel local: título, tres tarjetas con los pasos, tres avisos sobre privacidad, primera ejecución y alcance, y el botón Empezar
Etapa 0 · Lo primero que ves explica el alcance, no te pide un enlace.

Analiza antes de comprometerte

Pega la URL de un canal y pulsa Analizar: te dice cuántos videos hay y cuáles, sin descargar ni transcribir nada.

Etapa 1 de la aplicación de escritorio tras analizar: se muestra el tipo de origen, su título y cuántos videos se detectaron
Etapa 1 · La consulta barata que evita comprometer horas de procesador.

Elige, o no elijas nada

Todo tiene un valor por defecto que funciona. Cada campo lleva su ayuda debajo, y los formatos están agrupados en texto y audio.

Etapa 2: carpeta de salida, modelo, idioma, procesamiento y tope de videos, con los formatos agrupados y dos interruptores de comportamiento
Etapa 2 · Puedes pulsar Transcribir sin tocar nada.

Y al terminar, los archivos

Una tarjeta por video, con su estado y lo que produjo. Si el video 12 de 80 es privado, se marca y el 13 sigue adelante.

Etapa 3 del panel local con el trabajo terminado: píldora verde, barra al cien por cien y enlaces de descarga a cada archivo producido
Etapa 3 · En el navegador, cada archivo es un enlace de descarga directa.

Ves el texto mientras lo escribe

Nada de una barra que promete. La fase tiene nombre, la barra se mueve mientras descarga, y el texto reconocido va apareciendo.

La aplicación de escritorio transcribiendo: la fase TRANSCRIBIENDO con un punto latiendo, la barra de avance y un recuadro con las últimas frases reconocidas
Y al terminar, un botón abre la transcripción completa sin salir de la aplicación.

Claro u oscuro

La etapa de ajustes en modo oscuro: los mismos controles sobre fondo azul muy oscuro
Un botón en la barra superior, y recuerda tu elección.

Qué produce

.md

Markdown con marcas de tiempo, para repositorios y cursos

.pdf

Documento portable para leer o imprimir

.txt

Texto continuo, sin marcas

.srt

Subtítulos SubRip, para cualquier editor de video

.vtt

WebVTT, para reproductores HTML5

.json

Segmentos y metadatos: la fuente de verdad

.mp3

El audio extraído

.ogg

El audio en formato abierto

Cómo está construido

Ningún módulo del dominio importa la interfaz. Añadir un formato de salida toca exactamente un archivo.

Diagrama de arquitectura: escritorio, panel local y línea de comandos alimentan una única cola de trabajos, que coordina el resolutor de enlaces y el pipeline de un video, apoyado en descarga, FFmpeg, transcripción y exportadores

Empezar

Con el ejecutable

  1. Descarga el .zip de la última publicación.
  2. Descomprime.
  3. Ejecuta VideoTranscriptStudio.exe.

Lleva FFmpeg dentro: no depende del PATH.

Desde el código

git clone https://github.com/vladimiracunadev-create/video-transcript-studio.git
cd video-transcript-studio
pip install -e .

video-transcript-studio web

Python 3.11 o superior. Windows, macOS o Linux.

Todo se queda en tu equipo

Reconocimiento local

Whisper corre en tu procesador con faster-whisper. La transcripción no se envía a ningún LLM ni a ninguna API.

Solo 127.0.0.1

El panel escucha en la dirección de bucle local. No es accesible desde la red salvo que lo pidas explícitamente, y avisa cuando lo haces.

Telemetría cero

Sin analítica, sin cuenta, sin clave. Lo único que sale es lo que yt-dlp necesita para obtener el medio.

Lo que no es

No es un descargador de videos. Extrae el audio para transcribirlo.

No evade DRM ni controles de acceso. Un video privado, de miembros o con restricción de edad falla, y el mensaje lo dice con esas palabras.

No hace diarización. Dice qué se dijo y cuándo, no quién lo dijo.

No resume ni genera capítulos. Está en el roadmap, no en el producto.

No garantiza precisión. Con música fuerte, voces superpuestas o audio malo, la transcripción se degrada. Revísala antes de publicar.

Los límites exactos, medidos y sin adornos →

Documentación