Skip to content
FrankX.AI
Enterprise AIJan 21, 202613 min read2,425 words

Production LLMs & AI Agents on OCI: Part 3 - The Operating Model

TL;DR

The definitive guide to operating production AI systems. 5-stage maturity model, evaluation pipelines, MLOps for GenAI, incident response runbooks, cost optimization, and team operating models.

Frank Riemer
FrankX
AI Architect & Independent Creator
Ex-Oracle AI Architect · Starlight & ACOS Systems
The definitive guide to operating production AI systems. 5-stage maturity model, evaluation pipelines, MLOps for GenAI, incident response runbooks, cost optimization, and team operating models.
Reading Goal

You'll understand benchmark performance, cost-efficiency trade-offs, and exact deployment patterns for the latest frontier models.

Production LLMs and AI Agents on OCI: The Operating Model

TL;DR: Production GenAI systems fail not because of bad models, but because of missing operating models. This guide provides a complete 5-stage maturity framework, evaluation pipelines, MLOps architecture, incident runbooks, cost optimization strategies, and team operating models—all mapped to OCI services.

Disclosure: Independent analysis. Not affiliated with, endorsed by, or sponsored by Oracle. Uses public OCI documentation and general enterprise architecture patterns, not confidential Oracle or customer material.

The Operating Model Imperative

Most GenAI projects invest 90% effort on models and 10% on operations. Production systems require the inverse: the model is a dependency; the operating model is the product.

The Operating Model Imperative diagram 1
The Operating Model Imperative

An operating model answers these critical questions:

QuestionWhy It MattersConsequence of Not Answering
How do we version prompt changes?Reproducibility, rollback capabilityCannot diagnose regressions
How do we know if quality is degrading?Early detection of model driftUsers discover issues before you
How do we control costs?Budget predictabilitySurprise bills, service shutdown
How do we respond to incidents?Mean Time To RecoveryExtended outages, reputation damage
How do we maintain compliance?Regulatory requirementsFines, audit failures

The 5-Stage AI Operations Maturity Model

Based on production learnings from enterprise deployments and aligned with industry frameworks like Google's ADK maturity guidance.

The 5-Stage AI Operations Maturity Model diagram 2
The 5-Stage AI Operations Maturity Model

Maturity Assessment Scorecard

Rate your current state (1-5) for each dimension:

DimensionStage 1Stage 2Stage 3Stage 4Stage 5
VersioningNoneGit for promptsSemantic versioning + registryAutomated promotionML-selected versions
MonitoringNoneError logs onlyFull traces + metricsAnomaly detectionPredictive alerts
EvaluationManual testingGolden setsAutomated in CI/CDOnline A/B testsContinuous learning
Cost MgmtNoneBill reviewPer-request trackingBudget enforcementDynamic optimization
Incident ResponseAd-hocRunbooksAutomated detectionAuto-remediationPredictive prevention
GovernanceNoneManual reviewPolicy-as-codeAutomated complianceContinuous audit

Scoring:

  • 6-12: Stage 1 (Ad-hoc)
  • 13-18: Stage 2 (Managed)
  • 19-24: Stage 3 (Measured)
  • 25-28: Stage 4 (Optimized)
  • 29-30: Stage 5 (Autonomous)

Stage-by-Stage Implementation Roadmap

Stage 1 → Stage 2: Foundation (Weeks 1-4)

Stage 1 → Stage 2: Foundation (Weeks 1-4) diagram 3
Stage 1 → Stage 2: Foundation (Weeks 1-4)

Key Deliverables:

  • Prompt repository structure
  • OCI Logging enabled
  • Basic dashboard with error rates
  • 3 incident runbooks
  • Golden test set with 50 cases

Stage 2 → Stage 3: Measurement (Weeks 5-12)

Stage 2 → Stage 3: Measurement (Weeks 5-12) diagram 4
Stage 2 → Stage 3: Measurement (Weeks 5-12)

Stage 3 → Stage 4: Optimization (Months 4-6)

CapabilityImplementationOCI Service
A/B TestingTraffic splitting for prompt variantsOCI API Gateway + Feature Flags
Dynamic RoutingRoute to optimal model based on queryOCI Functions + Generative AI
Automated Quality GatesBlock deployments below quality thresholdOCI DevOps + Functions
Anomaly DetectionML-based detection of quality degradationOCI Anomaly Detection
Cost OptimizationAutomatic model downgrade under budget pressureOCI Functions + Budgets

Stage 4 → Stage 5: Autonomy (Month 6+)

Stage 4 → Stage 5: Autonomy (Month 6+) diagram 5
Stage 4 → Stage 5: Autonomy (Month 6+)

Observability Architecture

The Four Pillars of AI Observability

The Four Pillars of AI Observability diagram 6
The Four Pillars of AI Observability

Distributed Trace Structure

Distributed Trace Structure diagram 7
Distributed Trace Structure

SLO Definition Framework

SLO CategoryMetricTargetBurn Rate AlertOCI Implementation
AvailabilitySuccess rate99.9%1% in 1hrOCI Monitoring Alarms
LatencyP95 response time< 5sP95 > 8sAPM Service Level Objectives
QualityGroundedness score> 90%< 85% avgCustom metrics + Functions
CostCost per query< $0.05> $0.10 avgCost Analysis + Budgets
SafetyHarmful output rate< 0.1%Any detectionLogging + Content Moderation

OCI Observability Stack

OCI Observability Stack diagram 8
OCI Observability Stack

Evaluation Pipeline Architecture

Offline vs Online Evaluation

Offline vs Online Evaluation diagram 9
Offline vs Online Evaluation

Evaluation Metrics Framework

CategoryMetricMeasurement MethodTargetOCI Implementation
SemanticResponse relevanceEmbedding similarity to expected> 0.85Functions + Generative AI
FactualGroundednessCitation verification> 0.90Functions + custom
CompletenessCoverageChecklist evaluation> 0.80LLM-as-judge
SafetyHarmful contentClassifier detection< 0.001Content Moderation API
LatencyResponse timeP95 measurement< 5sAPM
CostPer-request costToken tracking< $0.05Custom metrics

Golden Set Design

Golden Set Design diagram 10
Golden Set Design

CI/CD Integration

CI/CD Integration diagram 11
CI/CD Integration

Prompt & Agent Lifecycle Management

Prompts as Code

Prompts as Code diagram 12
Prompts as Code

Deployment Strategies

Deployment Strategies diagram 13
Deployment Strategies

Deployment Decision Framework

FactorBlue/GreenCanaryShadow
Risk toleranceLowVery lowNone
Rollback timeInstantFastN/A
Resource cost2x during deploy1.05x2x always
Comparison dataBefore/afterStatisticalSide-by-side
User impact on failureNone (if quick)Minimal (5%)None
Best use caseBreaking changesOptimizationsModel swaps

Cost Management Architecture

Cost Attribution Model

Cost Attribution Model diagram 14
Cost Attribution Model

Cost Components Breakdown

ComponentTypical ShareOptimization StrategyOCI Control
LLM Inference40-60%Prompt optimization, caching, model selectionGenerative AI pricing tiers
Embedding10-20%Batch processing, cachingGenerative AI embed pricing
Vector DB10-15%Index optimization, partitioningAutonomous DB tiers
Compute10-20%Right-sizing, autoscalingOKE node pools, Functions
Storage5-10%Tiering, lifecycle policiesObject Storage tiers
Network5-10%Regional deploymentVCN optimization

Cost Control Mechanisms

Cost Control Mechanisms diagram 15
Cost Control Mechanisms

Cost Optimization Strategies

StrategyEffortSavingsImplementation
Prompt cachingMedium20-40%OCI Functions + Redis
Model tieringLow30-50%Route simple queries to smaller models
Batch embeddingLow10-20%Queue and batch embedding requests
Response cachingMedium15-30%Cache common queries
Token optimizationHigh10-20%Prompt engineering
Semantic cachingHigh20-40%Cache similar queries

Incident Response Framework

Incident Classification Matrix

Incident Classification Matrix diagram 16
Incident Classification Matrix

Incident Response Runbooks

Incident Response Runbooks diagram 17
Incident Response Runbooks

Common Incident Types

Incident TypeDetectionImmediate ActionOCI Tools
Model timeoutAPM latency spikeSwitch to fallback modelGenerative AI + Functions
Tool failureError rate increaseCircuit breaker + fallbackFunctions + Logging
Quality degradationEval score dropRoll back promptDevOps + Monitoring
Cost overrunBudget alertRate limit + downgradeBudgets + API Gateway
Prompt injectionPattern detectionBlock + investigateLogging Analytics
Data breachAudit anomalyIsolate + investigateSecurity Zones + Audit

Automated Remediation

Automated Remediation diagram 18
Automated Remediation

Security and Compliance

Security Control Framework

Security Control Framework diagram 19
Security Control Framework

Data Classification and Handling

ClassificationDescriptionAllowed ModelsLoggingOCI Controls
PublicNon-sensitive, shareableAllFullStandard
InternalBusiness-sensitiveOCI-hosted onlyMetadataPrivate endpoints
ConfidentialCustomer data, PIIDedicated clusterAudit onlyCustomer keys
RestrictedRegulated dataPrivate Agent FactoryAudit onlyData residency

Compliance Mapping

RequirementControlOCI Implementation
GDPR Art. 17Data deletionObject Storage lifecycle + DB purge
GDPR Art. 22ExplainabilityTrace logging + decision audit
SOC 2 CC6.1Access controlIdentity Domains + Policies
HIPAAPHI protectionData Safe + Encryption + Audit
PCI DSSCardholder dataTokenization + Isolation

Team Operating Model

Roles and Responsibilities

Roles and Responsibilities diagram 20
Roles and Responsibilities

On-Call Structure

RotationScopeHoursEscalation
PrimaryAll P1/P2 incidents24/7ML Engineer or Platform Eng
SecondaryEscalation backup24/7AI Platform Lead
SpecialistModel-specific issuesBusiness hoursML Engineer (on-call)

Communication Channels

ChannelPurposeResponse Time
#ai-platform-alertsAutomated alertsMonitor during on-call
#ai-platform-supportTeam support requests4 hours (business)
#ai-platform-incidentsActive incident coordinationImmediate
Weekly AI Ops ReviewMetrics review, improvementsWeekly

Production Readiness Checklist

Pre-Launch Checklist

CategoryItemRequiredNotes
SecurityRBAC configuredYesIdentity Domains
SecurityNetwork isolationYesVCN + Private endpoints
SecuritySecrets managementYesOCI Vault
SecurityInput validationYesFunctions + WAF
ReliabilityTimeouts configuredYesAll external calls
ReliabilityRetries with backoffYesTransient failures
ReliabilityFallback behaviorYesGraceful degradation
ReliabilityCircuit breakersRecommendedHigh-frequency tools
QualityGolden set testsYes500+ cases
QualityCI/CD integrationYesDevOps pipelines
QualityOnline evaluationRecommendedSampling
CostBudget alertsYesOCI Budgets
CostRate limitingYesAPI Gateway
CostCost attributionRecommendedTagging
ObservabilityDistributed tracingYesAPM + OpenTelemetry
ObservabilitySLOs definedYesMonitoring
ObservabilityAlerting configuredYesNotifications
GovernancePrompt versioningYesGit repository
GovernanceAudit loggingYesLogging + Audit
GovernanceRunbooks documentedYesAt least 3

Launch Day Checklist

  • All pre-launch items verified
  • Staging environment tested
  • Rollback procedure documented and tested
  • On-call schedule confirmed
  • Stakeholders notified
  • Monitoring dashboards visible
  • Canary deployment started (5%)
  • Initial metrics baseline captured

Series Complete

This three-part series has provided a comprehensive framework for production AI systems on OCI:

  1. Part 1: Architecture — Six-plane enterprise architecture with OCI service mapping
  2. Part 2: Agent Patterns — Six orchestration patterns with decision frameworks
  3. Part 3: Operating Model — 5-stage maturity model, evaluation pipelines, incident response, and team structure

Next Steps

Maturity StageRecommended Actions
Stage 1Start with Part 1 architecture patterns
Stage 2Implement basic monitoring and prompt versioning
Stage 3Build evaluation pipelines using this guide
Stage 4Implement A/B testing and automated quality gates
Stage 5Design autonomous operations architecture

Resources

Visit the AI CoE Hub for all resources, decision frameworks, and links to Oracle Architecture Center patterns.

Related Articles

Stay in the intelligence loop

Weekly field notes on AI systems, production patterns, and builder strategy.

Occasional FrankX field notes. Unsubscribe anytime. Privacy details.