diff --git a/llama/prometheus/README.md b/llama/prometheus/README.md deleted file mode 100644 index 06bbb0b..0000000 --- a/llama/prometheus/README.md +++ /dev/null @@ -1,21 +0,0 @@ -# Short-term Prometheus for llama-server (rootless podman) - -- Container: `prometheus-short`, host networking, web UI on 127.0.0.1:9090 -- Config: `prometheus.yml` (this dir), bind-mounted read-only +SELinux :z -- TSDB data: `~/.local/share/prometheus-data` (7d retention) -- Scrapes router `127.0.0.1:9931/metrics?model=qwen3.6-35b-a3b` every 10s -- Router requires `?model=` per job (400 without it) - -Manage: - podman start prometheus-short | podman stop prometheus-short | podman logs -f prometheus-short - # config edits: podman exec prometheus-short kill -HUP 1 (or restart) - -Useful queries (qwen3.6 job): - increase(llamacpp:prompt_tokens_seconds[...]) # prompt tok/s windowed - llmacpp:predicted_tokens_seconds # gen tok/s gauge - sum(increase(llamacpp:spec_decode_num_accepted_tokens_total[5m])) - / sum(increase(llamacpp:spec_decode_num_draft_tokens_total[5m])) # acceptance - sum(llamacpp:spec_decode_num_accepted_tokens_per_pos_total{position="1"}) - / sum(llamacpp:spec_decode_num_accepted_tokens_per_pos_total{position="0"}) # pos1 conditional - -NOTE: rootless container does NOT auto-restart on machine reboot; restart manually with `podman start prometheus-short` (or promote to a quadlet user service if it outlives the short-term window). diff --git a/llama/prometheus/prometheus.yml b/llama/prometheus/prometheus.yml deleted file mode 100644 index ca8e662..0000000 --- a/llama/prometheus/prometheus.yml +++ /dev/null @@ -1,25 +0,0 @@ -# Short-term Prometheus scrape config for llama-server router (user service, port 9931). -# One scrape job per model instance; the router serves per-model metrics via ?model=. -# Stored in the dotfiles repo for reproducibility alongside tuning notes. -global: - scrape_interval: 10s - evaluation_interval: 30s - -rule_files: [] - -scrape_configs: - # qwen3.6-35b-a3b (current tuning target) - - job_name: llama-qwen3.6-35b-a3b - metrics_path: /metrics - params: - model: ["qwen3.6-35b-a3b"] - static_configs: - - targets: ["127.0.0.1:9931"] - labels: - model: "qwen3.6-35b-a3b" - - # NOTE: the router returns 400 for /metrics without a model param, - # so every job must pin ?model=. User-side aggregate is not exposed. - - # Add other models later by copying the qwen3.6 job and changing params.model - # e.g. qwen3.8-27b, qwen3.8-flash-next, qwen3-coder-next-80b-a3b \ No newline at end of file