Antes de empezar
- Un archivo de audio de prueba
- Permiso para tratar la grabación
- Python y FFmpeg si sigues la instalación técnica
AI Supercomputers es el portal de IA local del grupo ietres.La compra se realiza en nuestras tiendas oficiales. Si una referencia no aparece con stock, consulta la posibilidad de reserva y la siguiente entrada prevista.
Aprende a convertir audio en texto dentro de tu propia infraestructura: instalación, elección de modelo, marcas temporales, separación de hablantes, revisión, automatización, seguridad y dimensionamiento de GPU.
Al terminar tendrás un archivo de texto con marcas de tiempo y sabrás conservar solo los audios que realmente necesites.
No necesitas entender toda la parte técnica para comenzar. Sigue el recorrido básico y abre los apartados avanzados únicamente cuando la primera prueba funcione.
Prueba varias reuniones reales, corrige nombres y términos del negocio y decide cuánto tiempo conservarás audio y texto. La automatización por lotes llega cuando el formato y la calidad sean estables.
Un formato de audio, una carpeta, una plantilla de acta y revisión.
Más GPU si el volumen de horas o el plazo de entrega lo exige.
Diarización avanzada, colas, integración con reuniones y procesamiento automático.
La explicación avanzada continúa debajo. Puedes consultarla cuando el uso, los datos o el número de personas lo justifiquen.
Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.
Audio autorizado, finalidad definida, FFmpeg y espacio de trabajo protegido.
Transcribir en local, revisar marcas de tiempo y diseñar retención y control de acceso.
Continúa con la etapa relacionada y conserva comandos, versiones, métricas y responsables.
Abrir el siguiente paso →Whisper convierte voz en texto dentro de tu propio equipo: entra la grabación de la reunión, sale el texto — y el audio jamás viaja a internet. Ejemplo real: una reunión de una hora se transcribe en minutos y, a continuación, el modelo de lenguaje la convierte en un acta con acuerdos y tareas asignadas.
Whisper es una familia de modelos de reconocimiento automático del habla. Recibe audio y produce texto, puede detectar idioma y traducir determinados flujos al inglés. La ejecución puede hacerse localmente después de descargar pesos y dependencias.
El modelo no identifica con certeza jurídica quién habla, no garantiza nombres propios ni convierte automáticamente una conversación en un acta aprobada. Ruido, solapamiento, acentos, micrófono, vocabulario y compresión afectan al resultado. Una canalización profesional conserva el audio o los segmentos necesarios para revisar las partes dudosas.
La implementación oficial utiliza Python y necesita FFmpeg para leer formatos de audio. Crea un entorno virtual por proyecto. Instala primero PyTorch con la variante adecuada para tu sistema y acelerador, y después Whisper. Las instrucciones de PyTorch cambian según plataforma; no copies un comando CUDA de otro equipo sin comprobarlo.
python -m venv .venv # Linux o macOS source .venv/bin/activate # Windows PowerShell .venv\Scripts\Activate.ps1 python -m pip install --upgrade pip pip install -U openai-whisper
Instala FFmpeg mediante el gestor de paquetes de tu sistema y comprueba ambos componentes:
ffmpeg -version python -c "import whisper; print(whisper.available_models())"
No ejecutes archivos de audio no confiables con privilegios elevados. El flujo incluye decodificadores y dependencias. Utiliza un usuario limitado, actualizaciones y aislamiento para cargas externas.
La línea de comandos permite obtener varios formatos. Para una primera prueba en castellano, indica idioma cuando lo conoces y solicita una salida que conserve segmentos.
whisper reunion.m4a \ --model small \ --language Spanish \ --task transcribe \ --output_format all \ --output_dir salida
La orden descarga el modelo si no existe, procesa el audio y crea archivos de texto y subtítulos. La etiqueta del modelo es un ejemplo de punto de partida; compara tamaños con tu audio, idioma y hardware.
import whisper
model = whisper.load_model("small")
result = model.transcribe(
"reunion.m4a",
language="es",
task="transcribe",
verbose=False,
)
for segment in result["segments"]:
print(segment["start"], segment["end"], segment["text"])
Valida rutas, tamaño y tipo de archivo antes de procesar. En un servicio, no aceptes una ruta proporcionada directamente por el usuario; utiliza identificadores internos y una carpeta aislada.
La familia ofrece varios tamaños con un compromiso entre memoria, velocidad y exactitud. Los modelos pequeños permiten iterar y procesar en CPU con más facilidad; los mayores suelen mejorar en audio difícil a cambio de recursos. La variante turbo prioriza inferencia, pero debe compararse con la opción de mayor calidad sobre tu muestra.
| Necesidad | Punto de partida | Prueba decisiva |
|---|---|---|
| Notas personales con audio claro | Modelo pequeño | Nombres y tiempo total |
| Reuniones en castellano | Small o medium como comparación | WER, cifras y turnos |
| Audio con ruido o vocabulario técnico | Comparar medium, large y turbo | Errores críticos por hora |
| Grandes lotes | Modelo que cumple con mejor factor de tiempo real | Throughput sostenido y cola |
| Varios idiomas | Variante multilingüe | Prueba separada por idioma y acento |
No elijas únicamente por WER promedio. Clasifica errores: nombres de clientes, referencias, cantidades, negaciones, términos técnicos y cambios de hablante. Un modelo más rápido que altera una cifra puede ser inaceptable.
La calidad del micrófono y la separación entre voz y ruido pueden aportar más que cambiar de modelo. Conserva el original y crea una copia normalizada para el proceso.
ffmpeg -i reunion.m4a \ -ac 1 -ar 16000 \ -c:a pcm_s16le \ reunion-normalizada.wav
La normalización no repara una señal ausente. Para reuniones importantes, mejora la captación: micrófonos cercanos, menos reverberación y canales separados.
Whisper produce texto y segmentos; la diarización suele requerir un componente adicional. El resultado habitual es «Hablante A», «Hablante B» y turnos temporales. Asociar esos turnos a nombres requiere una fuente fiable o revisión humana.
Audio → VAD → diarización → segmentos por hablante
→ Whisper → texto con tiempo → alineación → revisión
| Fallo | Causa | Tratamiento |
|---|---|---|
| Un hablante aparece como dos | Ruido, distancia o cambio de canal | Fusionar tras revisión y conservar tiempo |
| Dos personas aparecen juntas | Voces similares o solapadas | Revisar audio y utilizar canales cuando existan |
| Texto asignado al turno incorrecto | Desalineación temporal | Alinear segmentos y no ocultar incertidumbre |
| Nombre incorrecto | Inferencia a partir de la conversación | No asignar identidad sin confirmación |
Genera decisiones, tareas y preguntas como una segunda fase. Cada elemento debe enlazar a uno o más segmentos. El revisor confirma responsable, compromiso y cualquier cifra. La IA local puede redactar; no convierte automáticamente la conversación en un acuerdo formal.
Separa trabajos interactivos de lotes largos. Limita número de audios simultáneos y memoria. Un proceso que falla debe reanudarse desde un estado conocido, no comenzar indefinidamente desde cero.
| Métrica | Utilidad |
|---|---|
| Factor de tiempo real | Capacidad de procesamiento por hora |
| WER y errores críticos | Calidad frente a referencia |
| Pico de VRAM | Número de trabajadores posibles |
| Tiempo de cola | Experiencia del usuario |
| Fallos por formato | Calidad de la entrada |
| Correcciones humanas | Valor real del sistema |
El audio puede contener datos personales, información confidencial y voces de terceros. Ejecutarlo en local reduce transferencias, pero no elimina obligaciones. Informa de la grabación, limita usuarios, cifra almacenamiento cuando corresponda y define cuándo se borran audio, transcripción, resumen y copias.
No utilices la diarización para identificar personas por voz sin un análisis específico. Separar turnos y reconocer una identidad son finalidades y riesgos diferentes.
Amplía los controles en IA local y RGPD.
Los modelos de voz caben en GPUs más pequeñas que muchos LLM, por lo que DGX Spark no es el punto de partida automático. Una GPU NVIDIA discreta suele ofrecer el mejor rendimiento cuando el modelo cabe. Spark aporta valor cuando comparte infraestructura con modelos grandes, RAG o varias cargas que necesitan memoria amplia.
CPU o GPU disponible permite validar calidad y flujo antes de comprar.
Prioriza throughput, varios trabajadores y finalización dentro del plazo.
Tiene sentido si, además de transcribir, mantienes LLM grandes, RAG y agentes en el mismo sistema.
Entrega para dimensionar: horas de audio al día, pico, idiomas, modelo aprobado, factor de tiempo real objetivo, diarización, resumen, retención y número de trabajos simultáneos.
Convierte segmentos revisados en actas, tareas o borradores sin perder el enlace al audio.
Integrar en la oficina →Define consentimiento, finalidad, acceso, borrado y tratamiento de voces antes de ampliar el servicio.
Revisar RGPD →Relaciona horas de audio, plazo, modelo y cola con la GPU o memoria que necesita el sistema.
Dimensionar la plataforma →Compara dos tamaños de Whisper, mide errores críticos y tiempo, y diseña revisión y retención. El hardware se elige después de conocer el volumen y la calidad requerida.
Consultar compra y disponibilidadLas especificaciones, funciones y límites descritos se contrastan con documentación primaria de Whisper. Las recomendaciones de compra, el orden de los pasos y los márgenes de planificación son criterios editoriales de AI Supercomputers: deben confirmarse con la versión instalada y una prueba real.
Sí. Después de instalar dependencias y descargar los pesos, la transcripción puede ejecutarse en el equipo. Debes bloquear o revisar otros componentes del flujo si necesitas aislamiento completo.
No es obligatoria, pero CUDA acelera de forma importante los modelos. Para poco volumen puedes probar en CPU; para lotes y plazos cortos conviene una GPU compatible.
Depende de idioma, ruido, vocabulario, memoria y plazo. Compara al menos dos tamaños con audios reales y mide errores críticos, no solo una impresión general.
La implementación base transcribe y segmenta. La diarización suele añadirse con otro componente y debe revisarse; «Hablante A» no identifica por sí mismo a una persona.
Puedes preparar un borrador con decisiones y tareas enlazadas a segmentos, pero una persona debe revisar nombres, cifras, responsables y compromisos antes de publicarlo.
No. Una GPU discreta suele ser más adecuada si el modelo cabe. Spark tiene sentido cuando la estación también debe alojar LLM grandes, RAG, agentes u otras cargas con mayor memoria.