Whisper es el sistema de reconocimiento del habla de OpenAI, publicado como software libre en 2022 con licencia MIT. Transcribe audio a texto en noventa y nueve idiomas, detecta automáticamente cuál se está hablando, genera marcas de tiempo —lo que permite producir subtítulos— y puede traducir al inglés lo dicho en cualquier otro idioma. El español es uno de los idiomas donde comete menos errores.
Conviene saber cómo se usa realmente, porque no es una página web al uso: no existe ningún sitio oficial donde subir un audio y recibir la transcripción. La vía oficial es descargarlo y ejecutarlo en el propio ordenador desde la línea de comandos o desde Python. En la práctica, la mayoría de los usuarios llegan a él a través de aplicaciones y servicios de terceros que lo incorporan.
Es gratuito y sin límites al ejecutarlo en local. Para quien se maneje con ello, resuelve la transcripción de grabaciones de aula, entrevistas o producciones orales de los estudiantes sin enviar el audio a ningún servicio externo, lo que además simplifica la protección de datos.