Diario

¿Qué modelo vamos a usar? Primero el conjunto de evaluación

La pregunta aparece en la primera llamada, siempre. La respuesta honesta es que nadie lo sabe todavía, y que averiguarlo cuesta menos de una semana.

Publicado 3 min de lecturaCardon Studio

La pregunta detrás de la pregunta

Cuando alguien pregunta qué modelo vamos a usar, en realidad pregunta dos cosas. Si va a ser suficientemente bueno y si va a ser caro. Las dos se responden con el mismo objeto, y no es un benchmark de la página de un proveedor. Es un conjunto de casos de tu propio trabajo, con la respuesta que tu equipo aceptaría escrita junto a cada uno.

Los benchmarks públicos miden cómo le va a un modelo con el problema de otro. Tus clientes no hacen esas preguntas. Preguntan por tus condiciones de contrato, tus códigos de producto, tus reglas de devolución, en tu idioma y con sus errores de tecleo. Un modelo que encabeza una tabla puede fallar en eso, y uno más pequeño puede pasarlo.

Qué es un conjunto de evaluación

Una lista de entradas y salidas esperadas. Una entrada es lo que el sistema va a recibir: un mensaje de un cliente, una factura escaneada, un párrafo de un reporte. La salida esperada es lo que produciría una persona cuidadosa de tu equipo, o la regla que decide si una respuesta es aceptable. A veces es un valor exacto. Muchas veces es una lista corta: menciona la cláusula correcta, no promete una fecha, cita el documento fuente.

El conjunto no necesita ser grande para ser útil. Unas cuantas decenas de casos que cubran la variedad real de tu trabajo dicen más que mil que se parecen entre sí. Lo que importa es que incluya los incómodos: la solicitud ambigua, el documento con dos versiones, la pregunta que debe rechazarse.

Quién lo escribe

Tu equipo, con nosotros en la sala. Las personas que hoy responden esas preguntas saben qué errores son vergonzosos y cuáles son caros. Nosotros ponemos la estructura y las herramientas. Ellos ponen el criterio. Escribir el conjunto suele tomar dos o tres sesiones de trabajo durante la fase de evaluación, y es el documento más valioso que produce el proyecto, porque todo lo que viene después se mide contra él.

También resuelve discusiones a tiempo. Cuando dos personas no están de acuerdo en cómo se ve una buena respuesta, lo descubren mientras escriben un caso, no después del lanzamiento.

Entonces el modelo es una medición

Con el conjunto listo, elegir modelo deja de ser una opinión. Corremos los candidatos, alojados y abiertos, contra los mismos casos, con la misma recuperación de documentos y las mismas reglas alrededor. Cada uno obtiene una tasa de aprobación, un costo por solicitud y una latencia. El modelo más pequeño que pasa es el que recomendamos, porque cuesta menos operarlo, responde más rápido y es más fácil de reemplazar.

Con frecuencia el resultado sorprende al equipo. Un modelo de una fracción del tamaño del famoso pasa, una vez que la recuperación le entrega el párrafo correcto y las verificaciones detienen las respuestas que no debe dar. El modelo es una parte del sistema, y rara vez la parte que decide si funciona.

Por escrito, para que pueda cambiar

La decisión entra en el documento de evaluación con las tasas de aprobación al lado. Seis meses después, cuando un proveedor publica un modelo nuevo o sube sus precios, el mismo conjunto se corre otra vez y la decisión se revisa con evidencia. Nada tiene que recordarse y nadie tiene que defender una preferencia.

Por eso el conjunto también es tuyo. Es lo único que te permite cambiar de proveedor, cambiar de estudio o traer el trabajo a tu equipo sin empezar de cero.