infra

Viktor Barzin b92e1166a8 monitoring: prometheus global scrape 1m -> 2m + UPS pinned 30s Halves sample volume on all default-scrape jobs (cAdvisor, node-exporter, service-endpoints, etc.). Memory id 559's earlier scrape-2m tuning was applied live but not codified — this restores the Helm template. Companion changes to keep alerting fidelity: - evaluation_interval kept at 1m (alerts evaluate every minute) - snmp-ups job pinned to scrape_interval=30s so PowerOutage / LowUPSBattery detect within ~30s instead of 2m - 3 alerts bumped from for:1m to for:3m (HighGPUTemp, LowUPSBattery, PowerOutage) for stability above the new 2m global cadence Other jobs that already had per-job overrides (snmp-idrac 1m, redfish-idrac 3m, kubernetes-pods 5m, kubernetes-services 5m) unaffected. Expected: 50-150m sustained CPU saving on Prometheus + apiserver. Verification ongoing — apiserver settles ~minutes after Prometheus config reload due to initial-target-scrape burst.		2026-05-22 14:17:00 +00:00
..
modules/monitoring	monitoring: prometheus global scrape 1m -> 2m + UPS pinned 30s	2026-05-22 14:17:00 +00:00
main.tf	[forgejo] Tolerate missing Vault keys during Phase 0 bootstrap	2026-05-07 23:29:33 +00:00
secrets	extract monitoring, nvidia, mailserver, cloudflared, kyverno from platform [ci skip]	2026-03-17 21:34:11 +00:00
terragrunt.hcl	extract monitoring, nvidia, mailserver, cloudflared, kyverno from platform [ci skip]	2026-03-17 21:34:11 +00:00