AgentOps: detect evaluation set contamination before promoting an agent
A production runbook for proving that an AgentOps score is not inflated by leakage across evaluations, prompts, retrieval or tuning data before promoting an AI agent.
Read article