Tu audio no sale de tu computadora
Por eso sirve para juntas, llamadas y material de clientes. Solo se conecta a internet la primera vez, para descargar el modelo.
Whisper es el modelo de OpenAI que transcribe, y es de código abierto: lo puedes instalar en tu propia computadora. Así transcribes sin límites y sin que tu audio salga a terceros: el texto con el minuto de cada frase, los subtítulos con el segundo exacto de cada palabra, y si el video está en inglés, tu IA te lo pasa al español.
Lo que cuesta: nada. Todo corre en tu computadora. La primera vez descarga el modelo y lo necesario para correrlo: unos cuantos GB. Medido en mi laptop, con tarjeta NVIDIA RTX 4060: una hora de audio real, transcrita en 3 minutos y medio, con el tiempo de cada palabra.
Guía completa en esta página · Versión 2.0 · Actualizada el 26 de septiembre de 2026.
En la carpeta donde trabajas, o en cualquiera. Si usas Codex, funciona igual.
Copia este prompt y pégaselo tal cual. Revisa tu computadora, te dice qué va a instalar antes de hacerlo y deja una skill: unas instrucciones guardadas que tu IA usa sola cada vez que le pides transcribir.
Quiero transcribir audios y videos palabra por palabra en mi propia computadora con Whisper de OpenAI (código abierto: github.com/openai/whisper), sin subir mi audio a ningún servidor.
1. Revisa mi computadora: sistema, si tengo tarjeta de video NVIDIA y cuánto espacio libre hay. Dime qué vas a instalar y cuánto pesa, y espera mi visto bueno.
2. Instálalo en un entorno aparte, que no toque el resto de mi sistema: Whisper, PyTorch con soporte para mi tarjeta si la tengo, y ffmpeg si falta. Si algo pide permisos de administrador, detente y avísame.
3. Usa el modelo "turbo". Si mi computadora no lo aguanta, dime cuál conviene.
4. Déjalo como una skill llamada "transcribir", para que la uses cada vez que te pida transcribir algo. De cada archivo me dejas, junto al original:
- un .txt con el minuto de cada frase, así: [12:38] texto
- un .srt de subtítulos en frases cortas de 3 a 6 palabras, con el tiempo exacto de sus palabras
5. Haz una prueba con un audio corto y dime cuánto tardó.
Cuando esté lista la skill, dime cómo te pido una transcripción.Si tu computadora no tiene tarjeta de video y la prueba sale lenta, pásate a la opción B.
Cada vez que lo necesites, le dices a tu IA lo que quieres. Estos son los cuatro usos, listos para copiar:
Transcribe palabra por palabra el archivo [RUTA DE TU ARCHIVO] y guarda el texto con los minutos junto al archivo.Hazme los subtítulos de [RUTA DE TU ARCHIVO]: el .srt con el tiempo exacto de cada palabra, en frases cortas, listo para importarlo a mi editor de video.El .srt lo importan Premiere, CapCut, DaVinci y casi cualquier editor.
Transcribe [RUTA DE TU ARCHIVO]; está en inglés. Después pásamelo al español: el texto completo con sus minutos, y también los subtítulos en español con el tiempo de cada frase.Whisper transcribe el inglés tal cual y tu IA lo traduce. Revisa los términos técnicos: a veces conviene dejarlos en inglés.
Saca lo importante de esta transcripción (ideas, datos, pasos y ejemplos, con el minuto donde se dicen) y guárdalo en tu memoria para usarlo en lo que trabajemos después. Dime dónde lo guardaste.Así lo uso yo con contenido de otros creadores: lo que me sirve queda en la memoria de mi IA y no tengo que volver a ver el video. En Claude Code, su memoria es el archivo CLAUDE.md de tu proyecto o su memoria automática.
Por eso sirve para juntas, llamadas y material de clientes. Solo se conecta a internet la primera vez, para descargar el modelo.
Con tarjeta NVIDIA, minutos. Sin ella, puede tardar más que el propio audio. No hay límites de horas ni de tamaño: el único límite es tu computadora.
Transcribe muy bien, pero a veces escribe mal nombres de personas, marcas o palabras en otro idioma. Puedes darle a tu IA la lista de cómo se escriben, y de todos modos dale una leída al texto antes de usarlo.
Groq tiene Whisper corriendo en sus servidores: transcribe en segundos sin forzar tu equipo, gratis hasta 8 horas de audio al día. La diferencia importante: tu audio se sube a sus servidores. Con un video público no importa; con una junta, una llamada o material de un cliente, pide permiso antes o usa la opción de tu computadora.
gsk_. Cópiala y no la pegues en el chat de tu IA.Quiero transcribir audios y videos palabra por palabra usando Whisper en Groq (plan gratuito). Ya tengo mi llave de Groq.
1. Dime en qué archivo y con qué nombre de variable guardo mi llave (GROQ_API_KEY). No me la pidas por el chat: yo la pego en ese archivo.
2. Instálalo como una skill llamada "transcribir", para que la uses cada vez que te pida transcribir algo: sacas el audio del archivo en MP3 comprimido y lo mandas a Whisper de Groq (modelo whisper-large-v3-turbo) pidiendo las marcas de tiempo por palabra y por frase (response_format verbose_json, timestamp_granularities word y segment). Si el audio pesa más de 25 MB, pártelo en pedazos y junta el resultado.
3. De cada transcripción me dejas, junto al archivo:
- un .txt con el minuto de cada frase, así: [12:38] texto
- un .srt de subtítulos en frases cortas de 3 a 6 palabras, con el tiempo exacto de sus palabras
4. Antes de instalar algo, dime qué es y espera mi visto bueno. Si algo pide permisos de administrador, detente y avísame.
Cuando esté lista la skill, dime cómo te pido una transcripción.Los cuatro usos del paso 3 funcionan igual. Sus límites gratis: 8 horas de audio al día y 2 por cada hora, hasta 20 archivos por minuto y 25 MB por archivo (tu IA parte lo largo en pedazos). Groq puede cambiarlos.
CERTIFICATE_VERIFY_FAILED) al instalar o al transcribir. Casi siempre es tu antivirus, que se mete en las conexiones seguras. Pídele a tu IA que use el almacén de certificados de tu sistema; no que apague la verificación.OPENSSL_Applink). Pídele a tu IA que descargue el archivo del modelo con curl y lo ponga en la carpeta de modelos de Whisper. Después ya no necesita internet.