AgentOps : détecter la contamination d’un jeu d’évaluation avant de promouvoir un agent
Un runbook de production pour prouver qu’un score AgentOps ne vient pas d’une fuite entre évaluations, prompts, retrieval ou données de réglage avant de promouvoir un agent IA.
Lire l’article