# Evaluation framework ModelForge persists generic `EvaluationSuite`, immutable `EvaluationSuiteRevision`, bounded `EvaluationCase`, `EvaluationRun`, per-case result and `EvaluationComparison` records. A typed project adapter executes retrieval; ModelForge never executes user-supplied code. A revision digest covers cases, labels, critical flags, metrics, top-K, retrieval settings and thresholds. Editing any of these requires a new revision. Runs pin suite/dataset and corpus revisions, target index/space, retrieval-config digest and full local environment identity. Comparability is `comparable` only when project, suite revision, corpus revision and retrieval configuration match. Eligibility remains distinct from promotion and is blocked by incompatible runs, excess errors, a configured Recall@10 regression or critical regressions.