Recurso TEXTO · Guía de instalación

Transcribe cualquier audio o video, palabra por palabra, en tu computadora

Whisper es el modelo de OpenAI que transcribe, y es de código abierto: lo puedes instalar en tu propia computadora. Así transcribes sin límites y sin que tu audio salga a terceros: el texto con el minuto de cada frase, los subtítulos con el segundo exacto de cada palabra, y si el video está en inglés, tu IA te lo pasa al español.

1. Abre Claude Code2. Que instale Whisper3. Transcribe

Lo que cuesta: nada. Todo corre en tu computadora. La primera vez descarga el modelo y lo necesario para correrlo: unos cuantos GB. Medido en mi laptop, con tarjeta NVIDIA RTX 4060: una hora de audio real, transcrita en 3 minutos y medio, con el tiempo de cada palabra.

Guía completa en esta página · Versión 2.0 · Actualizada el 26 de septiembre de 2026.

Lo que necesitas

  • Un agente de IA con acceso a tu computadora, como Claude Code o Codex. Él instala todo y hace la parte técnica.
  • Espacio libre: deja unos 6 GB para ir con calma.
  • De preferencia, una tarjeta de video NVIDIA. Con ella transcribe en minutos. Sin ella también funciona, pero puede tardar más que el audio mismo: para ese caso está la opción B.
  • El archivo que quieres transcribir: video, audio o nota de voz.

1 · Abre Claude Code en tu computadora

En la carpeta donde trabajas, o en cualquiera. Si usas Codex, funciona igual.

2 · Pídele que instale Whisper y lo deje como skill

Copia este prompt y pégaselo tal cual. Revisa tu computadora, te dice qué va a instalar antes de hacerlo y deja una skill: unas instrucciones guardadas que tu IA usa sola cada vez que le pides transcribir.

Quiero transcribir audios y videos palabra por palabra en mi propia computadora con Whisper de OpenAI (código abierto: github.com/openai/whisper), sin subir mi audio a ningún servidor.

1. Revisa mi computadora: sistema, si tengo tarjeta de video NVIDIA y cuánto espacio libre hay. Dime qué vas a instalar y cuánto pesa, y espera mi visto bueno.
2. Instálalo en un entorno aparte, que no toque el resto de mi sistema: Whisper, PyTorch con soporte para mi tarjeta si la tengo, y ffmpeg si falta. Si algo pide permisos de administrador, detente y avísame.
3. Usa el modelo "turbo". Si mi computadora no lo aguanta, dime cuál conviene.
4. Déjalo como una skill llamada "transcribir", para que la uses cada vez que te pida transcribir algo. De cada archivo me dejas, junto al original:
   - un .txt con el minuto de cada frase, así: [12:38] texto
   - un .srt de subtítulos en frases cortas de 3 a 6 palabras, con el tiempo exacto de sus palabras
5. Haz una prueba con un audio corto y dime cuánto tardó.

Cuando esté lista la skill, dime cómo te pido una transcripción.

Si tu computadora no tiene tarjeta de video y la prueba sale lenta, pásate a la opción B.

3 · Transcribe

Cada vez que lo necesites, le dices a tu IA lo que quieres. Estos son los cuatro usos, listos para copiar:

El texto completo, con sus minutos

Transcribe palabra por palabra el archivo [RUTA DE TU ARCHIVO] y guarda el texto con los minutos junto al archivo.

Los subtítulos, con el segundo exacto de cada palabra

Hazme los subtítulos de [RUTA DE TU ARCHIVO]: el .srt con el tiempo exacto de cada palabra, en frases cortas, listo para importarlo a mi editor de video.

El .srt lo importan Premiere, CapCut, DaVinci y casi cualquier editor.

Un video en inglés, pasado al español

Transcribe [RUTA DE TU ARCHIVO]; está en inglés. Después pásamelo al español: el texto completo con sus minutos, y también los subtítulos en español con el tiempo de cada frase.

Whisper transcribe el inglés tal cual y tu IA lo traduce. Revisa los términos técnicos: a veces conviene dejarlos en inglés.

Lo importante, guardado en la memoria de tu IA

Saca lo importante de esta transcripción (ideas, datos, pasos y ejemplos, con el minuto donde se dicen) y guárdalo en tu memoria para usarlo en lo que trabajemos después. Dime dónde lo guardaste.

Así lo uso yo con contenido de otros creadores: lo que me sirve queda en la memoria de mi IA y no tengo que volver a ver el video. En Claude Code, su memoria es el archivo CLAUDE.md de tu proyecto o su memoria automática.

Lo que conviene saber

Tu audio no sale de tu computadora

Por eso sirve para juntas, llamadas y material de clientes. Solo se conecta a internet la primera vez, para descargar el modelo.

La velocidad depende de tu equipo

Con tarjeta NVIDIA, minutos. Sin ella, puede tardar más que el propio audio. No hay límites de horas ni de tamaño: el único límite es tu computadora.

Revisa los nombres propios

Transcribe muy bien, pero a veces escribe mal nombres de personas, marcas o palabras en otro idioma. Puedes darle a tu IA la lista de cómo se escriben, y de todos modos dale una leída al texto antes de usarlo.

Opción B · Si tu computadora no es tan potente: Whisper en Groq

Groq tiene Whisper corriendo en sus servidores: transcribe en segundos sin forzar tu equipo, gratis hasta 8 horas de audio al día. La diferencia importante: tu audio se sube a sus servidores. Con un video público no importa; con una junta, una llamada o material de un cliente, pide permiso antes o usa la opción de tu computadora.

  1. Entra a console.groq.com y crea tu cuenta gratis.
  2. Ve a console.groq.com/keys y crea una llave (API key). Es una clave larga que empieza con gsk_. Cópiala y no la pegues en el chat de tu IA.
  3. Pégale a tu Claude Code o Codex este prompt:
Quiero transcribir audios y videos palabra por palabra usando Whisper en Groq (plan gratuito). Ya tengo mi llave de Groq.

1. Dime en qué archivo y con qué nombre de variable guardo mi llave (GROQ_API_KEY). No me la pidas por el chat: yo la pego en ese archivo.
2. Instálalo como una skill llamada "transcribir", para que la uses cada vez que te pida transcribir algo: sacas el audio del archivo en MP3 comprimido y lo mandas a Whisper de Groq (modelo whisper-large-v3-turbo) pidiendo las marcas de tiempo por palabra y por frase (response_format verbose_json, timestamp_granularities word y segment). Si el audio pesa más de 25 MB, pártelo en pedazos y junta el resultado.
3. De cada transcripción me dejas, junto al archivo:
   - un .txt con el minuto de cada frase, así: [12:38] texto
   - un .srt de subtítulos en frases cortas de 3 a 6 palabras, con el tiempo exacto de sus palabras
4. Antes de instalar algo, dime qué es y espera mi visto bueno. Si algo pide permisos de administrador, detente y avísame.

Cuando esté lista la skill, dime cómo te pido una transcripción.

Los cuatro usos del paso 3 funcionan igual. Sus límites gratis: 8 horas de audio al día y 2 por cada hora, hasta 20 archivos por minuto y 25 MB por archivo (tu IA parte lo largo en pedazos). Groq puede cambiarlos.

Si algo se rompe

  • Error de certificado (CERTIFICATE_VERIFY_FAILED) al instalar o al transcribir. Casi siempre es tu antivirus, que se mete en las conexiones seguras. Pídele a tu IA que use el almacén de certificados de tu sistema; no que apague la verificación.
  • Falla al descargar el modelo (error de certificado u OPENSSL_Applink). Pídele a tu IA que descargue el archivo del modelo con curl y lo ponga en la carpeta de modelos de Whisper. Después ya no necesita internet.
  • Tienes tarjeta NVIDIA y va lento. Pídele a tu IA que revise si PyTorch está usando tu tarjeta; si no, que instale la versión con soporte para ella.
  • El archivo tiene emojis o acentos en el nombre y falla. Cámbiale el nombre a uno simple, sin símbolos, y vuelve a intentar.