Recurso TRES

Tres herramientas para analizar y editar tus videos

¿Le pasaste un video a tu IA y no pudo responder sobre su contenido? Esta guía reúne herramientas para analizarlo, editarlo o crear gráficos. Lo que le falta es la entrada: no tiene por dónde entrarle un video ni un audio. Lo que sí puedes hacer es ponérsela.

Que VEAQue EDITEQue CONSTRUYA

Están en escalera, y cada una hace algo que la anterior no puede. El primer escalón ya sirve solo. El software se puede obtener sin pagar por él; el uso del agente y de servicios de transcripción puede tener costo.

Guía completa en esta página · Versión 1.3 · Repos y licencias verificados en vivo el 26 de agosto de 2026.

Las tres, de un vistazo

Para que la IA VEA el video — watch

Licencia MIT

El software se puede obtener sin pagar por él. Si el video no trae subtítulos, necesita además una llave gratuita de Groq para transcribirlo.

Para que la IA EDITE el video — video-use

Licencia MIT

El software se puede obtener sin pagar por él, pero sin una llave de ElevenLabs no hace nada. El plan gratuito de ElevenLabs es solo para uso no comercial: si vas a cobrar por el trabajo, es plan de pago.

Para que la IA CONSTRUYA los gráficos — HyperFrames

Licencia Apache 2.0

El software se puede obtener sin pagar por él, pero puede descargar su propio Chrome: varios cientos de megas en tu disco.

Antes de instalar nada

Así se instalan las tres, y es un solo método: le pegas el link del repo a tu Claude Code o Codex, y le pides en tus palabras que la instale y la use. Así lo hago yo — no abro una terminal, no escribo comandos. Tu IA resuelve sola los detalles técnicos y tu sistema operativo. Abajo de cada skill te dejo el link y el prompt exacto que le puedes copiar.

  • Tu IA nunca necesita las credenciales de tus redes ni de tu correo para ninguna de las tres. Si en algún momento te las pide, detente ahí: eso ya no es instalar la skill.
  • Si un instalador pide permisos de administrador, que se detenga y te avise. Los prompts de abajo ya se lo piden. Pasa de verdad: hay instaladores oficiales que se elevan solos aunque tu IA pida el modo de usuario, y entonces lo que quieres es enterarte, no que le busque la vuelta sin decirte. Si pasa, no es una emergencia — decides tú si lo dejas o lo quitas después.
  • Sobre claude.ai sin terminal: watch sí publica un archivo .skill que puedes subir en Ajustes → Capacidades → Skills, y pide que actives antes «ejecución de código y creación de archivos». Yo no lo he probado ahí, así que no te lo vendo como que funciona. Donde lo uso a diario es en Claude Code.
  • Si algo no te sale a la primera, revisa «Si algo se rompe» al final antes de escribirme.

1 · Para que la IA VEA — watch

github.com/bradautomates/claude-video · MIT · Python

Le pasas un link —o un archivo de tu disco— y una pregunta. La skill baja el video, saca cuadros de imagen y consigue la transcripción con minutos. Analiza imágenes extraídas del video y su transcripción para responder tus preguntas.

Sirve para: «hazme un resumen», «¿cuáles son las ideas?», «¿qué se dijo en el minuto cuatro?», «¿qué sale en pantalla cuando dice X?».

Así lo instalas

Copia esto y pégaselo a tu Claude Code o Codex, tal cual:

Instala y prepara la skill de este repo: github.com/bradautomates/claude-video

Lee tú primero su documentación e instálala adaptando los pasos a mi sistema operativo. Antes de ejecutar nada, enséñame qué vas a correr y espera mi visto bueno. Trabaja sin permisos de administrador y no apagues el antivirus; si un instalador se eleva solo o te pide elevación, detente y avísame antes de continuar. No me pidas contraseñas de redes ni de correo — esta skill no las necesita. Si para transcribir un video sin subtítulos hace falta mandar el audio a un servicio externo, avísame antes de hacerlo.

Cuando esté lista, dime nada más cómo pedirte que veas un video.

Después ya le pasas un link de YouTube (o un archivo tuyo) y tu pregunta.

Sus límites — sabérselos te ahorra la decepción

  • Funciona mejor con videos de menos de 10 minutos. Con un podcast de 45 no falla, pero te da un barrido delgado que se siente pobre. Pídele el tramo, no todo el video: dile el minuto de inicio y de fin.
  • No entra a nada privado. Solo links públicos y archivos de tu disco: su documentación dice textual que la skill no inicia sesión en ningún servicio.

El detalle de privacidad que sí importa. watch busca primero los subtítulos que el video ya trae. Si los tiene, el audio no sale de tu computadora.

Si no los tiene, no puede oírlo solo: necesita una llave de Groq —gratis, en console.groq.com/keys— y con ella manda el audio a transcribir afuera. Ahí ya hay un tercero oyendo. Se la das igual que la de ElevenLabs: en un archivo, no en el chat.

Y esto pasa siempre, traiga subtítulos o no: los cuadros de imagen y la transcripción se los pasa a tu IA para que los lea. O sea que van a Claude o a Codex, según cuál uses. No es un defecto — sin eso no podría contestarte.

Con un video público de YouTube nada de esto suele importar. Con una grabación tuya —una junta, una llamada, material de un cliente— sí. Ahí revisa antes si trae subtítulos, y si el material es de alguien más, si tienes permiso de pasarlo por estas herramientas.

2 · Para que la IA EDITE — video-use

github.com/browser-use/video-use · MIT

Le hablas normal y edita: corta, quita silencios, pone subtítulos quemados, ajusta el color. Sin menús, sin línea de tiempo. Le dices qué quieres en español y lo hace.

Ésta pide una llave de ElevenLabs, y sin ella no hace nada. No es opinión mía — su propio instalador lo dice textual: «Scribe (ElevenLabs) does all transcription. Without a key, nothing transcribes.» Sacarla es gratis, y así la tengo yo: con el plan gratuito, sin haber pagado nada. Es el único trámite de las tres, y abajo van los tres pasos.

Y para transcribir manda el audio de tu video a ElevenLabs. Antes de enviar audio a un servicio externo, revisa si contiene información que quieras mantener reservada, aunque el material sea tuyo. Con material de un cliente, pregúntate además si tienes permiso.

Un detalle si vas a cobrar por lo que hagas: sus términos dicen que el plan gratuito es solo para uso no comercial — y no dicen «solo para voces», dicen los Servicios, y esto es uno de ellos. Para trabajo de cliente es plan de pago. Te lo digo para que no te enteres después.

Paso 1 · Saca tu llave de ElevenLabs

  1. Crea tu cuenta en elevenlabs.io.
  2. En el menú de la izquierda entra a Developers (Desarrolladores) y ahí a la pestaña API Keys (Claves API). Atajo directo: elevenlabs.io/app/settings/api-keys.
  3. Botón Create Key. Ponle el nombre que quieras.
  4. Al crearla te pide elegir a qué le das acceso. Marca «Speech to Text» — es lo que usa esta skill para transcribir. Casi todos los tutoriales dicen «Text to Speech», que es lo contrario: eso es para generar voces. Si más adelante te sale un error de permisos, ahí es donde hay que mirar.

La llave solo se ve completa UNA vez. Al crearla te la muestra entera; después ya solo vas a ver los últimos cuatro caracteres y no hay forma de recuperarla. Cópiala en ese momento. Si la pierdes no pasa nada grave: borras esa y creas otra.

Paso 2 · Guárdala, sin pegarla en el chat

Esta es la parte que importa y casi nadie te dice. El instalador de la skill, tal como está escrito, te va a pedir que pegues la llave en el chat para él guardarla. No hace falta y es mejor no hacerlo: lo que escribes en un chat queda en su historial, y ese historial se comparte, se respalda y a veces se enseña en pantalla.

La vuelta es sencilla: el archivo lo creas tú, con la llave adentro, y a tu IA solo le dices dónde está. El propio instalador revisa si ese archivo ya existe y, si lo encuentra con la llave puesta, se salta solo el paso de pedírtela.

La ruta depende de dónde vaya a quedar el repo, así que ella te la tiene que decir. Éste es el primer mensaje que le mandas — antes de éste tu IA no sabe nada de lo que vas a hacer, por eso arranca diciéndoselo:

Voy a instalar la herramienta de este repo: github.com/browser-use/video-use

No la instales todavía. Necesita una llave de API de ElevenLabs, ya la tengo, y no te la voy a pegar aquí en el chat: la voy a poner yo directamente en un archivo.

Dime nada más tres cosas para que yo lo prepare: en qué carpeta va a quedar el repo, la ruta y el nombre exacto del archivo donde va la llave, y el formato exacto de la línea que va adentro.

Cuando yo te avise que ya está, no abras la llave ni la traigas a esta conversación. Comprueba solo que el archivo existe, que esa línea no está vacía y que está excluido de Git. Si quieres confirmar que sirve, haz una llamada de prueba y dime nada más si pasó o falló.

Te va a contestar con una ruta terminada en .env y una línea con el formato ELEVENLABS_API_KEY= seguida de tu llave. Creas el archivo, pegas la llave ahí, y le avisas.

Paso 3 · Ya con eso, que la instale

Ya está: puse mi llave en el archivo que me dijiste. Ahora sí instala y configura la herramienta.

Lee tú primero su documentación e instálala adaptando los pasos a mi sistema operativo. Antes de ejecutar nada, enséñame qué vas a correr y espera mi visto bueno. Trabaja sin permisos de administrador y no apagues el antivirus; si un instalador se eleva solo o te pide elevación, detente y avísame antes de continuar. No me vuelvas a pedir la llave por el chat ni la escribas en tus respuestas.

Cuando esté lista, dime cómo pedirte una edición en mis palabras.

Y no lo clones dentro de una carpeta que ya sincronices a OneDrive, iCloud o Drive: ahí el archivo de la llave se sube a la nube aunque Git lo esté ignorando.

De las tres, en Windows ésta es la que más trabajo le da a tu IA — el instalador original está pensado para Mac/Linux, así que va a tener que traducir algunos pasos. No es algo que tengas que resolver tú.

3 · Para que la IA CONSTRUYA los gráficos — HyperFrames

github.com/heygen-com/hyperframes · Apache 2.0

Convierte HTML y CSS en animaciones de video con fondo transparente, listas para montar encima de tu grabación. Es literalmente lo que uso para los gráficos de mis videos, éste incluido.

De las tres es la que más tranquilo te deja para trabajo de cliente: Apache 2.0 permite uso comercial de forma expresa y además te da licencia de patente.

No te cuesta dinero, pero puede costarte espacio: primero busca un navegador compatible en tu computadora y, si no lo encuentra, se baja el suyo — varios cientos de megas que se quedan guardados en tu disco.

Así lo instalas

Copia esto y pégaselo a tu IA:

Instala y prepara la herramienta de este repo: github.com/heygen-com/hyperframes

Lee tú primero su documentación e instálala adaptando los pasos a mi sistema operativo. Antes de ejecutar nada, enséñame qué vas a correr y espera mi visto bueno. Avísame antes si vas a descargar algo pesado — sé que esta herramienta puede bajar su propio navegador Chrome.

Trabaja sin permisos de administrador y no apagues el antivirus. Si un instalador se eleva solo o te pide elevación, detente y avísame antes de continuar, en vez de buscarle la vuelta.

Sus skills para agentes ya vienen dentro del propio paquete, en node_modules/hyperframes/dist/skills/. Si el comando que las instala te pide Git u otra herramienta que no tengo, no la instales: copia esas carpetas a mano a la carpeta de skills de mi agente y dime cuáles copiaste.

Después haz una prueba mínima: un gráfico simple con fondo transparente, para confirmar que quedó funcionando. Cuando esté lista, dime qué información necesitas de mí, en mis palabras, para construir un gráfico real.

Le describes el gráfico que quieres —qué dice, de qué color, cómo se mueve— y ella escribe el código, te lo enseña antes de nada, y cuando te guste lo entrega en video con fondo transparente. Lo que sale lo arrastras a tu editor.

No es la más fácil de las tres. Las otras dos las usas hablando y ya; ésta va y viene un poco más porque lo que sale es código. La ventaja es que el resultado no se parece a una plantilla.

El orden que te recomiendo

Empieza por watch, sola. Es gratis, un solo prompt la instala, y resuelve exactamente lo que preguntabas. Úsala una semana con videos que ya ibas a ver de todos modos.

video-use cuando de verdad vayas a editar, con tu llave de ElevenLabs ya sacada.

HyperFrames al final, cuando ya tengas algo que valga la pena vestir.

Las tres juntas no son un paquete: son tres escalones, y el primero ya sirve solo.

Si algo se rompe

Esto son detalles técnicos que solo importan si algo falla. No hace falta leerlos antes — tu IA debería resolver la mayoría sin que te enteres. Si se traba, pégale el error y dile que revise esto. Un cuidado al pegar un error: a veces trae dentro tu nombre de usuario, rutas de tu computadora o nombres de archivos de un cliente. Bórralos antes.

  • Dice que no encuentra python3. En Windows el comando se llama python a secas — python3 es un atajo de la Microsoft Store que no corre nada. Dile a tu IA que use python.
  • yt-dlp falla con un error de certificado. Casi siempre es tu antivirus, que se mete en medio de las conexiones seguras. Me pasó con AVG. No se arregla apagando la verificación: se resuelve haciendo que Python use el almacén de certificados de Windows.
  • El video baja pero no se puede recortar por tramos. Algunos videos de YouTube vienen en un formato nuevo (AV1) que rompe ese recorte. Se resuelve pidiéndole a yt-dlp el formato clásico.
  • Le pasas una nota de voz y falla. watch espera un video. Un audio suelto —una nota de WhatsApp, por ejemplo— no lo procesa: para eso va directo a un transcriptor.
  • Te dice que necesita instalar Git para las skills de HyperFrames. No está inventando: el comando que instala esas skills clona el repositorio por dentro, y eso pide Git. Pero no hace falta instalarlo — las skills ya vienen dentro del paquete que acabas de bajar, en node_modules/hyperframes/dist/skills/. Dile que copie esas carpetas a la carpeta de skills de tu agente y listo. Si aun así prefieres instalar Git, en Windows se instala en C:\Program Files\Git\ y eso es lo normal, no un problema.
  • video-use no se deja instalar en Windows. Su instalador original está escrito para Mac/Linux (brew, apt-get, enlaces simbólicos). Tu IA tiene que traducir esos pasos — dile explícitamente que estás en Windows y que resuelva el equivalente.