Un piloto es la única manera de saber qué resolverá un agente de IA en una empresa concreta, porque las medias de los proveedores salen de los tickets de otras compañías. Un piloto útil dura unas cuatro semanas, cubre una porción definida del tráfico real y tiene criterios de éxito puestos por escrito antes de empezar.
Antes de empezar
- Establecer una referencia. Registrar durante cuatro semanas el volumen por tema, el tiempo de primera respuesta, el tiempo de resolución, la satisfacción y el coste por ticket.
- Poner al día el contenido de ayuda. El agente solo puede responder lo que está escrito. Hay que actualizar los veinte artículos que cubren las preguntas más frecuentes.
- Elegir la porción de tráfico. Empezar por un solo canal y por los temas frecuentes, bien documentados y de bajo riesgo. Dejar fuera las reclamaciones, las bajas y todo lo que implique dinero hasta que el agente merezca confianza.
- Acordar las definiciones. Poner por escrito qué cuenta como resuelto, con ayuda de esta guía, y aplicar la misma definición a todos los proveedores que participen en el piloto.
Qué medir
| Métrica | Por qué importa |
|---|---|
| Tasa de resolución, según la definición propia | La cifra en la que se apoya el caso de negocio. |
| Satisfacción en las conversaciones gestionadas por la IA | Una tasa de resolución alta con una satisfacción a la baja es una señal de alarma. |
| Contactos repetidos en un plazo de siete días | Muestra si a los clientes «resueltos» se les ayudó de verdad. |
| Respuestas erróneas detectadas en una muestra manual | Revisar a mano al menos 100 conversaciones cada semana. |
| Calidad del traspaso a un agente humano | ¿Recibe la persona el contexto, o el cliente tiene que empezar de nuevo? |
| Coste real | Cargos por consumo, más los puestos de agente, más el tiempo que el equipo ha dedicado a los ajustes. |
Un plan de cuatro semanas
- Semana 1: conectar la base de conocimiento, hacer pruebas internas y redactar las reglas de traspaso a un agente humano.
- Semana 2: puesta en producción con entre el 10 y el 20 % del tráfico de la porción elegida. Revisar todas las conversaciones.
- Semana 3: cubrir las lagunas de contenido, ampliar al 50 % y empezar a revisar por muestreo en lugar de revisarlo todo.
- Semana 4: mantener fija la configuración y medir. De esta semana salen las cifras.
Decidir de antemano los criterios para seguir adelante o no
Los umbrales deben quedar por escrito antes del piloto. Por ejemplo: una tasa de resolución de al menos el 40 % en los temas elegidos, una satisfacción a pocos puntos de la referencia con agentes humanos, menos de dos respuestas erróneas dadas con seguridad por cada cien y un coste por conversación resuelta inferior al coste con agentes humanos. Decidir después es la manera de acabar justificando unos resultados flojos.
Preguntas frecuentes
¿Cuánto tráfico hace falta para que un piloto sea significativo?
Conviene aspirar a unos cuantos cientos de conversaciones gestionadas por la IA, como mínimo, en la semana de medición. Por debajo de esa cifra, un puñado de tickets atípicos puede mover la tasa de resolución varios puntos.
¿Conviene pilotar dos proveedores a la vez?
Si es posible, sí: se reparte entre ambos la misma porción de tráfico y se aplica la misma definición de «resuelto». Es la única comparación en igualdad de condiciones que se va a conseguir.
Seguir leyendo
- ¿Qué cuenta como una resolución?guía
- Tasa de resolución frente a tasa de desvíoguía
- Precio por resolución frente a precio por puestoguía
- La atención al cliente agéntica, explicadaguía
- Los mejores agentes de IA para atención al cliente en 2026los mejores
Esta página se ha investigado y redactado con ayuda de IA a partir de las fuentes que figuran en ella. No hemos realizado pruebas prácticas de estos productos. Método: Cómo evaluamos