Deployment Status
Optimal Local Deployment
Fits easily within host memory limits
Est. Generation Speed
7.8 t/s
Time-To-First-Token: ~210 ms
AI RAM Allocation
6.0 GB
Model: 4.9GB | KV Cache: 1.10GB
Headroom RAM
21.5 GB
System & Docker: 4.5 GB
RAM Allocation Breakdown (GB) Capacity: 32 GB
Model Weights
KV Cache Overhead
Docker Workloads
Free System Headroom
Memory Bus Saturation & Throughput Bus: 38.4 GB/s
Inference Speed (tokens/s)
Background Bandwidth Loss
System Sizing & Bottleneck Diagnostics
Generated `docker-compose.yml` (Ollama Local Stack) Production Ready
version: '3.8'
services:
  ollama:
    image: ollama/ollama:latest
    container_name: local_ai_ollama
    ports:
      - "11434:11434"
    environment:
      - OLLAMA_NUM_PARALLEL=1
      - OLLAMA_MAX_LOADED_MODELS=1
    deploy:
      resources:
        limits:
          memory: 26.50G
    restart: unless-stopped