# Model Evaluation

Record: `arch:model-evaluation`
Kind: activity
Layer: [Correctness Core](https://banes-lab.com/records/layer/correctness-core.md)
Severity: mandatory
Scope: model, model-backed feature, pipeline
Canonical: https://banes-lab.com/ontology#arch-model-evaluation

## Repair

- Refactored by: Add Eval Suite, Add Regression Dataset
- Detected by: missing eval report/gate
- Violated by: model change without evaluation
- Measured by: task metrics, safety metrics, regression rate
- Enforced by: model CI gates

## requires

- [Dataset](https://banes-lab.com/records/lex/dataset.md)
- [Metrics](https://banes-lab.com/records/lex/metrics.md)
- [Acceptance Criteria](https://banes-lab.com/records/lex/acceptance-criteria.md)

## reinforces

- [Model Safety](https://banes-lab.com/records/arch/model-safety.md)
- [Correctness](https://banes-lab.com/records/arch/correctness.md)

## enables

- [Model Selection/Regression Detection](https://banes-lab.com/records/lex/model-selection-regression-detection.md)

## conflicts-with

- [Untested Model Deployment](https://banes-lab.com/records/lex/untested-model-deployment.md)

## tensions-with

- [Metric Completeness](https://banes-lab.com/records/lex/metric-completeness.md)

## tensions

- [Model Evaluation Metric Completeness](https://banes-lab.com/records/tension/metric-completeness-model-evaluation.md)

## referenced-by

- [Artificial Intelligence Architecture](https://banes-lab.com/records/arch/artificial-intelligence-architecture.md)
- [Prompt Engineering](https://banes-lab.com/records/arch/prompt-engineering.md)
- [Model Drift Monitoring](https://banes-lab.com/records/arch/model-drift-monitoring.md)
