AI Supercomputers es el portal de IA local del grupo ietres.La compra se realiza en nuestras tiendas oficiales. Si una referencia no aparece con stock, consulta la posibilidad de reserva y la siguiente entrada prevista.

Tutorial para pymes · voz y agenda

Cómo probar un asistente de voz para citas, agenda y WhatsApp

Monta un piloto que entienda una llamada, consulte huecos reales, pida confirmación, cree la cita y envíe un resumen por WhatsApp. Cada acción queda limitada y comprobable.

Whisper para transcribirAgenda como fuente de verdadConfirmación antes de escribir
Resultado

Una llamada termina en una cita confirmada, no en una decisión autónoma del modelo

El LLM interpreta y estructura la petición. La disponibilidad procede del calendario, la persona confirma y una regla determinista crea el evento.

Seis componentes

Qué hace cada pieza del asistente

1. Telefonía o audio

Recibe la llamada o el mensaje de voz. Para la primera prueba basta con archivos grabados y autorizados.

2. Whisper

Convierte el audio en texto y puede detectar el idioma. No consulta agenda ni decide la cita.

3. Modelo de lenguaje

Extrae nombre, teléfono, servicio, fecha preferida y observaciones en un JSON validable.

4. Calendario

Microsoft Graph o Google Calendar devuelve disponibilidad real y crea el evento con los permisos mínimos necesarios.

5. WhatsApp

WhatsApp Cloud API envía la confirmación y recibe respuestas mediante webhooks. Usa plantillas y reglas aprobadas cuando correspondan.

6. Voz de salida

Piper puede convertir la respuesta en audio local. Revisa la licencia de la voz concreta antes de usarla.

Flujo controlado

La secuencia que evita citas inventadas

  1. Recibir. Captura el audio y conserva el identificador de la conversación.
  2. Transcribir. Whisper devuelve texto y, cuando sea útil, marcas de tiempo.
  3. Extraer. El LLM devuelve únicamente campos permitidos: nombre, teléfono, servicio, fecha, franja y notas.
  4. Consultar. La aplicación pregunta al calendario por intervalos libres; el modelo no genera horarios por su cuenta.
  5. Ofrecer. Presenta dos o tres huecos reales.
  6. Confirmar. La persona elige una opción de forma inequívoca.
  7. Crear. La aplicación crea el evento con un identificador idempotente para evitar duplicados.
  8. Notificar. Envía por WhatsApp fecha, hora, lugar, instrucciones y vía de cancelación.
Primera prueba

Monta un piloto pequeño antes de conectarlo a llamadas reales

Alcance

Un servicio, una agenda de pruebas, un horario y diez conversaciones simuladas.

Datos de salida

Nombre, teléfono, servicio, duración, fecha, franja horaria y confirmación.

Éxito

Nombres y fechas correctos, cero citas duplicadas y transferencia a una persona cuando faltan datos.

Plantilla de salida del LLM

{
  "intencion": "reservar_cita",
  "nombre": "",
  "telefono": "",
  "servicio": "",
  "fecha_preferida": "",
  "franja": "",
  "confirmado": false,
  "faltan_datos": []
}

Valida este objeto con un esquema. Si falta un campo obligatorio, el sistema pregunta; si hay ambigüedad, transfiere o solicita aclaración.

Modelos

Qué modelo usar en cada etapa

EtapaModeloCriterio
TranscripciónWhisper small, medium o turboCompara nombres propios, ruido, acento y latencia con audios reales.
Extracción y diálogoQwen, Gemma o Llama pequeño/intermedioDebe seguir el esquema y pedir datos ausentes; no necesita ser el modelo más grande.
Razonamiento adicionalDeepSeek-R1 o gpt-ossSolo cuando la tarea realmente requiere varios pasos; para reservar una cita suele ser innecesario.
Respuesta habladaPiperElige una voz clara y comprueba su licencia.
Conectores

Agenda y WhatsApp son sistemas externos, no capacidades del LLM

Microsoft Graph permite consultar disponibilidad y crear eventos con permisos de calendario. Google Calendar ofrece operaciones equivalentes. WhatsApp Cloud API gestiona mensajes y webhooks. Las credenciales se guardan en el servidor, nunca dentro del prompt ni del navegador.

Datos personales

Informa, minimiza y limita la conservación

La voz, el número de teléfono y el contenido de la llamada pueden ser datos personales. Define finalidad, información a la persona, acceso, conservación, proveedores y procedimiento para corregir errores. No reutilices las llamadas para entrenar modelos sin una finalidad y base jurídica adecuadas.

Abrir la guía práctica de IA local y RGPD

Hardware

Compra cuando la latencia o la concurrencia lo justifiquen

Una primera prueba puede funcionar con un equipo existente. Mide por separado transcripción, respuesta del LLM y síntesis. Cuando varias llamadas simultáneas o un modelo mayor superen la capacidad, utiliza el recomendador con esos datos.

Fuentes técnicas y criterio editorial

Whisper oficial · Microsoft Graph: disponibilidad · Microsoft Graph: crear eventos · WhatsApp Cloud API · Piper oficial · AEPD: transcripción de voz con IA · Google Calendar: disponibilidad · Google Calendar: crear eventos

La secuencia de pilotaje, los criterios de hardware y la obligación de confirmación son recomendaciones editoriales de seguridad y operación. Deben adaptarse al sector, proveedor de telefonía y obligaciones aplicables.

Preguntas frecuentes

Antes de conectar llamadas reales

¿Un único modelo puede atender, consultar agenda y enviar WhatsApp?

No. Necesitas transcripción, un LLM para estructurar la petición, APIs de calendario y mensajería, y reglas que controlen cada acción.

¿Puede el modelo elegir una hora libre?

Debe elegir únicamente entre huecos devueltos por la API del calendario. La fuente de verdad es la agenda, no la respuesta generativa.

¿Necesito un superordenador para empezar?

No necesariamente. Prueba pocas llamadas y un modelo pequeño. Compra cuando la latencia, el volumen o la concurrencia hayan sido medidos.

¿Puedo guardar todas las llamadas?

No debe asumirse. Define finalidad, información, acceso y conservación, y revisa las obligaciones aplicables a la voz y al contenido.