# Model Safety

Record: `arch:model-safety`
Kind: quality-attribute
Layer: [Correctness Core](https://banes-lab.com/records/layer/correctness-core.md)
Severity: mandatory for model-backed systems
Scope: model-backed system, model, application
Canonical: https://banes-lab.com/ontology#arch-model-safety

## Repair

- Refactored by: Add Guardrails, Add Human Review, Add Safety Evals
- Detected by: safety eval failures, missing policy filters
- Violated by: unsafe outputs/actions without guardrails
- Measured by: safety incident rate, eval pass rate
- Enforced by: safety gates, runtime monitors

## requires

- [Evaluation](https://banes-lab.com/records/lex/evaluation.md)
- [Guardrails](https://banes-lab.com/records/lex/guardrails.md)
- [Monitoring](https://banes-lab.com/records/arch/monitoring.md)

## reinforces

- [Model Governance](https://banes-lab.com/records/arch/model-governance.md)
- [Security](https://banes-lab.com/records/lex/security.md)

## enables

- [Safe Model Deployment](https://banes-lab.com/records/lex/safe-model-deployment.md)

## conflicts-with

- [Unguarded Model Autonomy](https://banes-lab.com/records/lex/unguarded-model-autonomy.md)

## tensions-with

- [Capability/Utility](https://banes-lab.com/records/lex/capability-utility.md)

## tensions

- [Model Safety Capability/Utility](https://banes-lab.com/records/tension/capability-utility-model-safety.md)

## referenced-by

- [Artificial Intelligence Architecture](https://banes-lab.com/records/arch/artificial-intelligence-architecture.md)
- [Model Governance](https://banes-lab.com/records/arch/model-governance.md)
- [Model Evaluation](https://banes-lab.com/records/arch/model-evaluation.md)
- [Agentic Architecture](https://banes-lab.com/records/arch/agentic-architecture.md)
