# Model Evaluation

> The activity of measuring a model against datasets, metrics and slices, and comparing the results with acceptance thresholds.

Record: `architecture:model-evaluation`
Kind: activity
Layer: [Correctness Core](https://banes-lab.com/records/layer/correctness-core.md)
Severity: mandatory
Scope: model, model-backed feature, pipeline
Canonical: https://banes-lab.com/ontology#architecture-model-evaluation

Listed in [Architecture principles](https://banes-lab.com/api/records/architecture.md), after [Model Governance](https://banes-lab.com/records/architecture/model-governance.md) and before [Model Inference](https://banes-lab.com/records/architecture/model-inference.md).

## Repair

- Refactored by: Add Eval Suite, Add Regression Dataset
- Detected by: missing eval report/gate
- Violated by: model change without evaluation
- Measured by: task metrics, safety metrics, regression rate
- Enforced by: model CI gates

## Requires

- [Dataset](https://banes-lab.com/records/lexicon/dataset.md)
- [Metrics](https://banes-lab.com/records/lexicon/metrics.md)
- [Acceptance Criteria](https://banes-lab.com/records/lexicon/acceptance-criteria.md)

## Reinforces

- [Model Safety](https://banes-lab.com/records/architecture/model-safety.md)
- [Correctness](https://banes-lab.com/records/architecture/correctness.md)

## Enables

- [Model Selection/Regression Detection](https://banes-lab.com/records/lexicon/model-selection-regression-detection.md)

## Conflicts with

- [Untested Model Deployment](https://banes-lab.com/records/lexicon/untested-model-deployment.md)

## In tension with

- [Metric Completeness](https://banes-lab.com/records/lexicon/metric-completeness.md)

## Tensions

- [Model Evaluation / Metric Completeness](https://banes-lab.com/records/tension/metric-completeness-model-evaluation.md)

## Severity

- [mandatory](https://banes-lab.com/records/vocabulary/severity-mandatory.md)

## Category

- [Model Architecture](https://banes-lab.com/records/architecture-category/model-architecture.md)

## Reinforced by

- [Artificial Intelligence Architecture](https://banes-lab.com/records/architecture/artificial-intelligence-architecture.md)
- [Prompt Engineering](https://banes-lab.com/records/architecture/prompt-engineering.md)

## Required by

- [Model Drift Monitoring](https://banes-lab.com/records/architecture/model-drift-monitoring.md)

## Linked from

- [Systems built around a model](https://banes-lab.com/software-architecture/scale/systems-built-around-a-model.md)
- [Correctness / Determinism / Verification](https://banes-lab.com/ontology/principles/architecture-category-correctness-determinism-verification.md)
- [Model Architecture](https://banes-lab.com/ontology/principles/architecture-category-model-architecture.md)
- [Core Vocabulary](https://banes-lab.com/ontology/lexicon/lexicon-category-core-vocabulary.md)
- [Model Architecture](https://banes-lab.com/ontology/lexicon/lexicon-category-model-architecture.md)
- [Severity levels](https://banes-lab.com/ontology/schema/the-vocabulary-severity.md)
- [The resolutions](https://banes-lab.com/ontology/schema/the-resolutions.md)
