Files
karuo-ai/01_卡资(金)/金仓_存储备份/群晖NAS管理/参考资料/CKBNAS_安全恢复与Docker限流清单.md
2026-07-19 00:21:46 +08:00

1.8 KiB
Raw Blame History

CKBNAS 安全恢复与 Docker 限流清单

记录 2026-06-09 这轮 NAS 排障中已经验证过、可直接复用的安全基线。

1. 当前可用基线

  • RAID md2 已恢复为 [UUUU]
  • speed_limit_min=5000
  • speed_limit_max=70000
  • SMBService 可作为最小访问服务保留
  • DSM 5000/5001 在无 Docker 干扰时可正常访问
  • ContainerManager 不应默认启动

2. 已验证的故障模式

  • ping 正常,但 SSH banner 超时
  • 5000/5001 超时或假在线
  • ContainerManager 一启动,系统内存可用量会快速下降
  • RestartPolicy=always / unless-stopped 的容器会被批量拉起
  • 启动日志里多次出现 SATA link downsoftreset failedSRST failhard resetting link

3. Docker 恢复策略

  1. 默认不启动 ContainerManager
  2. 所有容器 RestartPolicy 先统一改成 no
  3. 只保留基础访问链路,不恢复 AI 大模型容器
  4. 每次只恢复 1 个容器
  5. 每次恢复后至少观察 5 到 10 分钟

4. 容器恢复优先级

  1. SMBService
  2. DSM 5000/5001
  3. 低风险基础容器
  4. 业务容器
  5. ollama / AI 大模型 / 高内存容器最后恢复

5. 回退条件

  • SSH banner 超时
  • 5000/5001 超时
  • 内存可用量跌破安全阈值
  • 新增 SATA link down / SRST fail 日志
  • 系统出现假在线、掉线或重启

6. 回退动作

  • 立即停 ContainerManager
  • 取消 Docker 自动重启
  • 保留 SMBService
  • 继续 speed_limit_max=70000 的限速策略

7. 迭代沉淀规则

  • 每次恢复前先确认 allowlist只保基础服务和已验证稳定的小包。
  • 任何 AI / 大模型 / VM 容器默认都按 restart=no 处理。
  • 每次恢复一个容器后至少观察 5 到 10 分钟,再决定下一步。
  • 出现假在线、SSH banner 超时、或 SATA link down,先回退 Docker不继续加包。