AI Quality Testing Essentials (ATE)
Configura tu primer eval funcionando en 4 horas. Descubre, haciendo, por qué AI Quality Testing es una disciplina en sí misma.
Edición completada o ya iniciada.
¿De qué trata?
Este es un workshop hands-on para profesionales de producto y de testing que quieren tocar, por primera vez, la práctica de evaluar productos de IA. En 4 horas vas a trabajar sobre un caso real, vas a configurar evaluaciones reales en una plataforma real, y vas a ver con tus propios ojos cómo el modelo mental de testing tradicional se transforma cuando lo aplicas a un sistema probabilístico. Trabajamos sobre un caso simple y acotado, donde conviven criterios verificables con criterios subjetivos en el mismo problema.
Vas a salir habiendo hecho tus primeros evals, con una idea concreta de cuánto más hay para aprender, y con criterio para empezar a tener conversaciones más informadas en tu equipo.
Trabajamos con OpenAI Evals, la plataforma de referencia en el mercado de AI Quality hoy. No necesitas saber programar: la mayor parte del trabajo se hace desde la interfaz.
Importante: Es necesario contar con una cuenta activa de OpenAI y USD 10 en créditos disponibles para realizar las prácticas.
Herramientas
Utilizaremos la siguiente herramienta
Para quién es
Profesionales de Producto
(Product Manager, Product Owner, Product Lead) que trabajan o van a trabajar con productos basados en IA y quieren empezar a incorporar criterio cuantitativo para validar calidad.
Profesionales de Testing
(QA Engineer, Tester, Quality Lead) que ven cómo la IA está cambiando la disciplina y quieren empezar a explorar, con las manos, qué cambia y qué se mantiene.
Asumimos experiencia previa en producto o en testing. No asumimos formación previa en IA ni en evaluación.
Qué vas a hacer en estas 4 horas
Construir tu propio dataset sintético: pensar las dimensiones del problema, escribir el prompt de generación, y producir 15-20 tickets sintéticos listos para correr la primera evaluación.
Leer outputs de un LLM de forma sistemática y construir una primera taxonomía de modos de falla.
Configurar y correr una evaluación determinística sobre criterios verificables como formato o estructura.
Construir un LLM-as-a-judge de cero: escribir la rúbrica para tu caso, traducirla a un prompt de juez, configurarlo en la plataforma y correrlo sobre los outputs del clasificador.
Comparar los veredictos de tu juez con tu lectura humana y descubrir, en vivo, por qué un juez consistente puede equivocarse sistemáticamente, y por qué eso abre la pregunta de la alineación.
Salir con un eval funcionando que puedes llevarte y adaptar a tu propio caso.
Tu instructor
Martin Alaimo
Desde 2009 ha acompañado a más de 200 organizaciones y ha apoyado a más de 8.000 personas en procesos de evolución profesional. Su enfoque es situacional y práctico, ofreciendo una enseñanza inmersiva con experiencias innovadoras que facilitan el aprendizaje aplicable, especialmente en áreas que no suele abordar la academia clásica.
Ha participado como orador en más de 30 conferencias en Estados Unidos y 14 países de Latinoamérica y Europa, además de ser autor de 6 libros sobre producto e innovación digital.
Su libro más reciente, IA Strategy Workshop, brinda herramientas para salir de la lógica de la “feature factory” e integrar inteligencia artificial con criterio estratégico.
Es el creador de Verica, la plataforma para hacer evaluaciones (Evals) de productos basados en LLMs para organizaciones que necesitan medir la calidad de los resultados generados por sus productos de IA.
Como parte de su compromiso con la innovación, es miembro organizador de Product Tank, la comunidad más grande de Product Management.
Es uno de los pocos expertos que reúne las certificaciones más altas de la industria en prácticas ágiles: Certified Scrum Trainer (CST), Certified Enterprise Coach (CEC), Certified Team Coach (CTC), Certified Agile Leadership Educator (CAL Educator), y Path to CSP Educator.
Conoce su perfil profesional completo y sus actividades de divulgación en LinkedIn.
Edición completada o ya iniciada.
¿Te animas a dar este paso?
No estás empezando de cero. Estás eligiendo avanzar con criterio.
Aprender mejor también es una decisión.