Read-only inference telemetry

spoon-ai01 / Ollama

Model, generation, GPU and host status — no controls, no inference probes.

Connecting Activity unknown
Awaiting first sample…
Generation speed
Cumulative output tokens / second
Rolling speed
Most recent three-second window
Generated this task
No active task observed
Context in use
Awaiting context data

Selected model

No loaded model reported

Model ID
Parameters
Family
Format
Quantisation
Allocated context
Model size
VRAM allocation
Residency

Recent completed requests

Ollama journal · metrics only
TaskPrompt tokensPrompt t/sOutput tokensGeneration t/sTotal timeCompleted
Waiting for completed request metrics…

GPU telemetry

NVIDIA GPU
GPU utilisation
VRAM occupancy
Memory activity
Temperature
Power
SM clock
Processes

Host resources

CPU utilisation
System memory
Root filesystem
Load 1m
Load 5m
Swap
Ollama

Inference path

Current state

Read-only collector · three-second hardware sampling · filtered performance events only · prompts and responses are never collected or displayed.