Tagged articles

contamination control

1 articles · Page 1 of 1
Data Bricklaying Diary
Data Bricklaying Diary
Aug 26, 2026 · Artificial Intelligence

AI Evaluation Sets ≠ Training Holdouts: Golden Data, Hard Cases, Contamination & Regression

This article explains why enterprise AI evaluation requires purpose-built datasets — golden baselines, challenge cases, red-team tests, regression suites, and online replays — designed from capability questions, risk lists, and real failures, with structured answers, contamination governance, tiered LLM judging, and version-locked regression pipelines gated by risk-based release thresholds.

AI evaluationLLM-as-a-Judgechallenge set
0 likes · 24 min read
AI Evaluation Sets ≠ Training Holdouts: Golden Data, Hard Cases, Contamination & Regression