infra

Viktor Barzin 8d1d2fb999 All checks were successful ci/woodpecker/push/default Pipeline was successful Details calico: add whisker-watchdog CronJob to self-heal a wedged whisker-backend Whisker showed an empty UI on 2026-06-28. Root cause: whisker-backend dials goldmane:7443 over a long-lived gRPC stream; when that stream dropped during a transient CNI/DNS blip (right after k8s-node5 finished its v1.35.6 upgrade, its pod resolver briefly timed out on the kube-dns ClusterIP) the Go gRPC resolver got WEDGED — spamming "failed to stream flows" / "code = Unavailable: dns ... i/o timeout" forever, never reconnecting. The operator ships whisker-backend with NO liveness probe, so nothing restarted it; the live UI stayed blank until a manual `kubectl delete pod`. (The durable aggregator is a separate pod and was unaffected — only Whisker's ~60-min live view went dark.) Whisker is operator-managed (Whisker CR), so we can't inject a liveness probe. Instead add a watchdog so this never needs a manual restart again: - whisker-watchdog CronJob (every 10 min) + least-privilege SA/Role/RoleBinding (calico-system only: pods get/list/delete, pods/log get). - It restarts the whisker pod only when whisker-backend logs >=10 goldmane- connection errors in 11m AND Goldmane is Ready (the Goldmane-Ready guard avoids restart-thrash during a real Goldmane outage). - Self-tested: a manual run reports "whisker-backend healthy: 0 ... errors" and does not restart. Docs: runbook gains a "Whisker UI empty" troubleshooting entry + a self-heal note; the stale 2026-06-25 "digest never posted" known-state block is updated to Resolved (digest posts to #alerts, lastSuccessfulTime current); CLAUDE.md flow-trail bullet gains the whisker-wedge gotcha. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>		2026-06-28 08:59:31 +00:00
..
apiserver-audit-logging.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
beads-auto-dispatch.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
breakglass-ssh.md	break-glass SSH: drop port-knock for exposed key-only :52222; version host config	2026-06-11 18:23:39 +00:00
breakglass-ui.md	claude-breakglass: in-cluster warm break-glass UI for the devvm	2026-06-12 21:40:17 +00:00
chrome-service-snapshot.md	workstation: per-user playwright browser MCP for all users, reproducible from git	2026-06-16 20:33:47 +00:00
claude-auth-renew-workstation.md	workstation: per-user long-lived Claude token to end concurrent-refresh logout	2026-06-28 08:07:43 +00:00
fan-control.md	fan-control docs: sync runbook/env/service/design to the HA-actuator + anti-flap model	2026-06-16 08:11:48 +00:00
forgejo-open-signups.md	docs(forgejo): runbook reflects Authentik disabled + zero-click GitHub	2026-06-19 17:37:46 +00:00
forgejo-registry-breakglass.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
forgejo-registry-rebuild-image.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
forgejo-registry-setup.md	forgejo pulls: route *.viktorbarzin.me to Technitium, drop /etc/hosts pins [ci skip]	2026-06-10 07:56:31 +00:00
goldmane-flow-trail.md	calico: add whisker-watchdog CronJob to self-heal a wedged whisker-backend	2026-06-28 08:59:31 +00:00
grow-pve-nfs-lv.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
homelab-vault-onboarding.md	homelab vault: install bw system-wide + onboarding runbook	2026-06-27 08:16:52 +00:00
immich-transcode-bitrate.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
job-hunter.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
k8s-node-auto-upgrades.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
k8s-version-upgrade.md	k8s-upgrade: reclaim+auto-prune kubeadm /etc/kubernetes/tmp leak; correct crash root cause to etcd IO (not OIDC)	2026-06-25 15:23:15 +00:00
kms-public-exposure.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
mailserver-pfsense-haproxy.md	pfsense: SNI-routed internal 443 — mail.viktorbarzin.me serves webmail everywhere	2026-06-10 18:41:07 +00:00
mailserver-proxy-protocol.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
nextcloud-add-archive.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
nfs-prerequisites.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
offboard-user.md	workstation: emo direct master push — allow-then-audit [ci skip]	2026-06-10 14:53:43 +00:00
pfsense-unbound.md	dns: pfSense forward-zone for viktorbarzin.me, nodes fully stock [ci skip]	2026-06-10 08:32:34 +00:00
proxmox-host.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
r730-ram-upgrade-272gb.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
registry-rebuild-image.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
registry-vm.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
restore-etcd.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
restore-full-cluster.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
restore-lvm-snapshot.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
restore-mysql.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
restore-postgresql.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
restore-pvc-from-backup.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
restore-vault.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
restore-vaultwarden.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
scale-k8s-cluster.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
security-incident.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
synology-storage.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
t3-drop-attribution.md	t3: connection logging across the path for drop attribution	2026-06-11 13:48:10 +00:00
t3-version-bump.md	docs: t3-migrate-idle runbook section + service-catalog + design status	2026-06-21 12:40:46 +00:00
technitium-apply.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
vault-raft-leader-deadlock.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
vault-token-renew-devvm.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00
woodpecker-onboard-forgejo-repo.md	fix: restore tree dropped by `6d224861`; land stem95su gdrive-sync (10m) [ci skip]	2026-06-09 08:45:33 +00:00