{
  "code": null,
  "collection": "architecture",
  "href": "https://banes-lab.com/ontology#architecture-model-inference",
  "id": "model-inference",
  "kind": "capability",
  "layer": {
    "href": "https://banes-lab.com/ontology/schema#layer-correctness-core",
    "json": "https://banes-lab.com/json/records/layer/correctness-core",
    "label": "Correctness Core",
    "markdown": "https://banes-lab.com/records/layer/correctness-core.md",
    "ref": "layer:correctness-core"
  },
  "name": "Model Inference",
  "ref": "architecture:model-inference",
  "relations": [
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-model-artifact",
          "json": "https://banes-lab.com/json/records/lexicon/model-artifact",
          "label": "Model Artifact",
          "markdown": "https://banes-lab.com/records/lexicon/model-artifact.md",
          "ref": "lexicon:model-artifact"
        },
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-input-output-contract",
          "json": "https://banes-lab.com/json/records/lexicon/input-output-contract",
          "label": "Input/Output Contract",
          "markdown": "https://banes-lab.com/records/lexicon/input-output-contract.md",
          "ref": "lexicon:input-output-contract"
        }
      ],
      "relation": "requires"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology#architecture-artificial-intelligence-architecture",
          "json": "https://banes-lab.com/json/records/architecture/artificial-intelligence-architecture",
          "label": "Artificial Intelligence Architecture",
          "markdown": "https://banes-lab.com/records/architecture/artificial-intelligence-architecture.md",
          "ref": "architecture:artificial-intelligence-architecture"
        }
      ],
      "relation": "reinforces"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-training-time-only-model-logic",
          "json": "https://banes-lab.com/json/records/lexicon/training-time-only-model-logic",
          "label": "Training-Time-Only Model Logic",
          "markdown": "https://banes-lab.com/records/lexicon/training-time-only-model-logic.md",
          "ref": "lexicon:training-time-only-model-logic"
        }
      ],
      "relation": "conflicts-with"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-latency-cost",
          "json": "https://banes-lab.com/json/records/lexicon/latency-cost",
          "label": "Latency/Cost",
          "markdown": "https://banes-lab.com/records/lexicon/latency-cost.md",
          "ref": "lexicon:latency-cost"
        }
      ],
      "relation": "tensions-with"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology/schema#tension-latency-cost-model-inference",
          "json": "https://banes-lab.com/json/records/tension/latency-cost-model-inference",
          "label": "Model Inference / Latency/Cost",
          "markdown": "https://banes-lab.com/records/tension/latency-cost-model-inference.md",
          "ref": "tension:latency-cost-model-inference"
        }
      ],
      "relation": "tensions"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-opaque-ungoverned-model-use",
          "json": "https://banes-lab.com/json/records/lexicon/opaque-ungoverned-model-use",
          "label": "Opaque Ungoverned Model Use",
          "markdown": "https://banes-lab.com/records/lexicon/opaque-ungoverned-model-use.md",
          "ref": "lexicon:opaque-ungoverned-model-use"
        }
      ],
      "relation": "violated-by"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-extract-module",
          "json": "https://banes-lab.com/json/records/lexicon/extract-module",
          "label": "Extract Module",
          "markdown": "https://banes-lab.com/records/lexicon/extract-module.md",
          "ref": "lexicon:extract-module"
        },
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-extract-adapter",
          "json": "https://banes-lab.com/json/records/lexicon/extract-adapter",
          "label": "Extract Adapter",
          "markdown": "https://banes-lab.com/records/lexicon/extract-adapter.md",
          "ref": "lexicon:extract-adapter"
        }
      ],
      "relation": "refactored-by"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology/schema#vocabulary-severity-contextual",
          "json": "https://banes-lab.com/json/records/vocabulary/severity-contextual",
          "label": "contextual",
          "markdown": "https://banes-lab.com/records/vocabulary/severity-contextual.md",
          "ref": "vocabulary:severity-contextual"
        }
      ],
      "relation": "severity"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology#architecture-category-model-architecture",
          "json": "https://banes-lab.com/json/records/architecture-category/model-architecture",
          "label": "Model Architecture",
          "markdown": "https://banes-lab.com/records/architecture-category/model-architecture.md",
          "ref": "architecture-category:model-architecture"
        }
      ],
      "relation": "category"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology#architecture-prompt-engineering",
          "json": "https://banes-lab.com/json/records/architecture/prompt-engineering",
          "label": "Prompt Engineering",
          "markdown": "https://banes-lab.com/records/architecture/prompt-engineering.md",
          "ref": "architecture:prompt-engineering"
        },
        {
          "href": "https://banes-lab.com/ontology#architecture-agentic-architecture",
          "json": "https://banes-lab.com/json/records/architecture/agentic-architecture",
          "label": "Agentic Architecture",
          "markdown": "https://banes-lab.com/records/architecture/agentic-architecture.md",
          "ref": "architecture:agentic-architecture"
        }
      ],
      "relation": "required-by"
    },
    {
      "links": [
        {
          "href": "https://banes-lab.com/ontology#architecture-category-model-architecture",
          "json": "https://banes-lab.com/json/ontology/principles/architecture-category-model-architecture",
          "label": "Model Architecture",
          "markdown": "https://banes-lab.com/ontology/principles/architecture-category-model-architecture.md",
          "ref": "chapter:/ontology#architecture-category-model-architecture"
        },
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-category-codebase-system-architecture-styles",
          "json": "https://banes-lab.com/json/ontology/lexicon/lexicon-category-codebase-system-architecture-styles",
          "label": "Codebase / System Architecture Styles",
          "markdown": "https://banes-lab.com/ontology/lexicon/lexicon-category-codebase-system-architecture-styles.md",
          "ref": "chapter:/ontology/lexicon#lexicon-category-codebase-system-architecture-styles"
        },
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-category-core-modular-design",
          "json": "https://banes-lab.com/json/ontology/lexicon/lexicon-category-core-modular-design",
          "label": "Core Modular Design",
          "markdown": "https://banes-lab.com/ontology/lexicon/lexicon-category-core-modular-design.md",
          "ref": "chapter:/ontology/lexicon#lexicon-category-core-modular-design"
        },
        {
          "href": "https://banes-lab.com/ontology/lexicon#lexicon-category-model-architecture",
          "json": "https://banes-lab.com/json/ontology/lexicon/lexicon-category-model-architecture",
          "label": "Model Architecture",
          "markdown": "https://banes-lab.com/ontology/lexicon/lexicon-category-model-architecture.md",
          "ref": "chapter:/ontology/lexicon#lexicon-category-model-architecture"
        },
        {
          "href": "https://banes-lab.com/ontology/schema#the-vocabulary-severity",
          "json": "https://banes-lab.com/json/ontology/schema/the-vocabulary-severity",
          "label": "Severity levels",
          "markdown": "https://banes-lab.com/ontology/schema/the-vocabulary-severity.md",
          "ref": "chapter:/ontology/schema#the-vocabulary-severity"
        },
        {
          "href": "https://banes-lab.com/ontology/schema#the-resolutions",
          "json": "https://banes-lab.com/json/ontology/schema/the-resolutions",
          "label": "The resolutions",
          "markdown": "https://banes-lab.com/ontology/schema/the-resolutions.md",
          "ref": "chapter:/ontology/schema#the-resolutions"
        }
      ],
      "relation": "linked-from"
    }
  ],
  "summary": "The ability to run a trained model on validated input at runtime and return a checked prediction or generation.",
  "siblings": {
    "next": {
      "href": "https://banes-lab.com/ontology#architecture-retrieval-augmented-generation",
      "json": "https://banes-lab.com/json/records/architecture/retrieval-augmented-generation",
      "label": "Retrieval-Augmented Generation (RAG)",
      "markdown": "https://banes-lab.com/records/architecture/retrieval-augmented-generation.md",
      "ref": "architecture:retrieval-augmented-generation"
    },
    "previous": {
      "href": "https://banes-lab.com/ontology#architecture-model-evaluation",
      "json": "https://banes-lab.com/json/records/architecture/model-evaluation",
      "label": "Model Evaluation",
      "markdown": "https://banes-lab.com/records/architecture/model-evaluation.md",
      "ref": "architecture:model-evaluation"
    }
  },
  "up": {
    "href": null,
    "json": "https://banes-lab.com/json/api/records/architecture",
    "label": "Architecture principles",
    "markdown": "https://banes-lab.com/api/records/architecture.md",
    "ref": "api:records/architecture"
  },
  "aliases": [
    "Runtime Prediction/Generation"
  ],
  "exemplar": {
    "after": "const input = FooInferenceSchema.parse(rawInput);\nconst output = await inferenceRuntime.predict(fooModelVersion, input, {\n  timeoutMs: 500,\n  traceId,\n});\nreturn FooPredictionSchema.parse(output);",
    "before": "const output = model.predict(input as any);",
    "lang": "ts",
    "medium": "code"
  },
  "formedBy": null,
  "scope": [
    "service",
    "model serving"
  ],
  "severity": "contextual"
}
