Whisper es un modelo abierto de reconocimiento automático del habla publicado por OpenAI con licencia MIT, código y pesos incluidos. Admite archivos de audio y de vídeo en prácticamente cualquier formato y devuelve la transcripción en texto plano, en JSON y en formatos de subtítulo con marcas de tiempo, además de traducción al inglés e identificación automática del idioma.
Se distribuye en varios tamaños —tiny, base, small, medium, large y turbo—, que van de los 39 a los 1.550 millones de parámetros y exigen entre uno y diez gigabytes de memoria de vídeo: la elección es un compromiso entre precisión, velocidad y equipo disponible. Turbo es una versión optimizada del modelo grande, mucho más rápida, pero solo transcribe, no traduce.
Es una herramienta de línea de comandos, de modo que su uso sin conocimientos técnicos pasa por envoltorios de terceros: aplicaciones de escritorio con interfaz gráfica como MacWhisper, Buzz o Whisper Desktop, la implementación en C++ whisper.cpp, que funciona en equipos modestos, o los cuadernos de Google Colab y los espacios de Hugging Face, que se ejecutan en el navegador sin instalar nada. También está disponible a través de la API de OpenAI.
Es gratuito. El español está entre los idiomas con menor tasa de error del modelo, y al ejecutarse en local el audio no sale del ordenador.