Qué modelo de lenguaje usa la plataforma es la pregunta que todo el mundo hace y la que menos importa: va a cambiar dos veces antes de que se acabe el contrato, y cualquier plataforma seria soportará el nuevo en semanas. Los criterios que sobreviven al modelo del mes tienen que ver con tus datos, tus permisos y tu capacidad de medir y de irte. Seis, cada uno con su pregunta.
Aquí no se nombra ningún producto, tampoco el nuestro. La advertencia va al final.
1. Dónde va tu contenido y dónde corre el modelo
Dentro de esta pregunta se esconden tres. ¿A qué proveedores puede enrutar la plataforma, y se puede restringir el enrutado por proyecto? ¿Hay opción de ejecutar un modelo en tu propia infraestructura para los casos que lo necesiten? ¿Y cuáles son las condiciones de retención y de entrenamiento de cada proveedor de la cadena, por escrito, incluido el propio fabricante de la plataforma? Lo que suele darse por respuesta es una tranquilización. Lo que hace falta es una cláusula de contrato y un plazo de retención en días.
Pregunta: para cada proveedor de la cadena de enrutado, si se retiene mi contenido, cuánto tiempo y si se usa para entrenar.
2. Calidad de recuperación, medida aparte
La mayoría de las respuestas decepcionantes de un asistente documental son fallos de recuperación y no de generación: el pasaje correcto nunca llegó al modelo, que respondió con sus propios parámetros y sonó exactamente igual de seguro. Eso hace que la calidad del RAG dependa de la fragmentación, del índice y de los filtros más que del modelo, y obliga a medir la recuperación por separado antes de juzgar la redacción.
Pregunta: si puedo medir la recuperación con mi propio conjunto de preguntas, aparte de la generación, y ver qué pasajes se recuperaron en cada respuesta.
3. Identidad y permisos
Si la plataforma indexa un repositorio documental donde cada persona ve cosas distintas, el asistente tiene que respetarlo en el momento de recuperar, no filtrando la respuesta después. Comprueba el inicio de sesión único contra tu propio proveedor de identidad, el control de acceso por rol, si los permisos se pueden acotar por proyecto o por base de conocimiento y qué registra la traza de auditoría. Este es el criterio que con más frecuencia convierte un piloto exitoso en un despliegue bloqueado.
Pregunta: si los permisos de los documentos se aplican durante la recuperación, y qué muestra la traza de auditoría de una sola pregunta.
4. Evaluación y observabilidad
Sin una forma de medir la calidad, cada cambio es una cuestión de opiniones y cada regresión la descubre un usuario. Busca un conjunto de preguntas con respuesta conocida, ejecuciones de evaluación repetibles y visibilidad de coste y latencia por proyecto y por caso de uso. Pregunta qué pasa cuando un proveedor cambia por debajo la versión de un modelo: ¿puedes detectar la regresión o te enteras en una reunión?
Pregunta: cómo lanzo una evaluación repetible contra un conjunto de respuestas conocidas y dónde veo el coste y la latencia desglosados.
5. Si puedes irte
La portabilidad es barata de pactar en la firma y cara de conseguir después. ¿Qué puedes exportar: documentos, el índice procesado, prompts, conjuntos de evaluación, histórico de conversaciones, en qué formatos? ¿Las integraciones que construyas quedan atadas a construcciones propietarias o a algo estándar? Una plataforma segura de su valor no se incomoda con esta pregunta.
Pregunta: el día que me vaya, qué me llevo exactamente, en qué formato y qué se queda dentro.
6. El modelo de coste que vas a pagar de verdad
Por usuario, por token, por documento, por refresco del índice, o una mezcla. Lo que pilla a la gente es el reproceso: si un manual de mil páginas se revisa cada mes, quién paga volver a indexarlo, y si esa línea está en la oferta. Modela un año completo con tus volúmenes reales y tu frecuencia real de actualización, y pregunta después qué pasa si el uso se duplica, porque un despliegue exitoso es justamente el caso en el que la factura sorprende a alguien.
Pregunta: con mis volúmenes, cuál es el coste a doce meses y qué partida crece si la adopción se duplica.
Cómo montar la comparación
Escribe veinte preguntas reales de las personas que van a usar el sistema, con las respuestas acordadas de antemano por alguien que las conoce. Añade cinco preguntas que el sistema debería rechazar o escalar, porque cómo trata una plataforma lo que no sabe importa más que cómo trata lo que sí. Pasa el mismo conjunto a todos los candidatos, con los mismos documentos, y lee los pasajes recuperados y no solo las respuestas.
Advertencia
Nosotros construimos una de estas plataformas, AI Portal. Los criterios de arriba son los que querríamos que un comprador nos aplicara, portabilidad y modelo de coste incluidos.