检查点空间监控需先确认各系统存储路径,再用脚本统计总量、新旧目录及最大单个目录大小,并设阈值告警;建议结合定时任务与清理策略形成闭环。
检查点(checkpoint)在数据库、分布式系统或容器平台中常用于保存运行时状态,但长期积累会占用大量磁盘空间。通过脚本定期检查其占用情况,能及时发现异常增长、规避磁盘满风险。
明确检查点的存储位置和命名规则
不同系统中检查点路径和格式差异较大,需先确认实际落盘位置:
- PostgreSQL:通常在
$PGDATA/pg_wal/(WAL 日志)和$PGDATA/pg_logical/(逻辑复制槽)中,检查点本身不单独存为文件,但可通过pg_control和 WAL 归档推断活跃检查点范围; - Apache Flink:检查点默认存在
state.checkpoints.dir配置的 HDFS/S3/本地路径下,目录名含时间戳和检查点 ID,如chk-12345/; - Docker / containerd:若使用 checkpoint 功能(
docker checkpoint create),检查点保存在/var/lib/docker/checkpoints/下,每个容器对应一个子目录; - Kubernetes + Velero 或自定义 Operator:检查点可能作为备份对象存在对象存储中,需调用 API 或
velero backup get结合du -sh对本地缓存目录估算。
编写轻量级空间检查脚本(以 Linux 本地路径为例)
假设检查点统一存于 /data/checkpoints/,以下 Bash 脚本能统计总量、最老/最新目录、单个最大检查点,并输出告警建议:
#!/bin/bash
CHECKPOINT_DIR="/data/checkpoints"
THRESHOLD_GB=50 # 触发警告的总空间阈值(GB)
<p>if [[ ! -d "$CHECKPOINT_DIR" ]]; then
echo "❌ 检查点目录不存在: $CHECKPOINT_DIR"
exit 1
fi</p><h1>总大小(GB,保留1位小数)</h1><p>TOTAL_SIZE=$(du -sh "$CHECKPOINT_DIR" 2>/dev/null | cut -f1 | sed 's/G//; s/M/ <em> 0.001/; s/K/ </em> 0.000001/' | bc -l 2>/dev/null | awk '{printf "%.1f", $1}')
TOTAL_SIZE=${TOTAL_SIZE:-0}</p><p>echo "? 当前检查点总占用: ${TOTAL_SIZE} GB"</p><h1>最新和最老检查点目录(按修改时间)</h1><p>LATEST=$(find "$CHECKPOINT_DIR" -mindepth 1 -type d -print0 2>/dev/null | xargs -0 ls -t | head -n1 | xargs basename 2>/dev/null)
OLDEST=$(find "$CHECKPOINT_DIR" -mindepth 1 -type d -print0 2>/dev/null | xargs -0 ls -tr | head -n1 | xargs basename 2>/dev/null)</p><h1>单个最大检查点(按目录大小)</h1><p>LARGEST_DIR=$(du -sh "$CHECKPOINT_DIR"/*/ 2>/dev/null | sort -hr | head -n1 | awk '{print $2}' | xargs basename 2>/dev/null)
LARGEST_SIZE=$(du -sh "$CHECKPOINT_DIR/$LARGEST_DIR" 2>/dev/null | awk '{print $1}')</p><p>echo "? 最新检查点: $LATEST"
echo "⏳ 最老检查点: $OLDEST"
echo "? 最大单个检查点: $LARGEST_DIR ($LARGEST_SIZE)"</p><h1>超阈值提示</h1><p>if (( $(echo "$TOTAL_SIZE > $THRESHOLD_GB" | bc -l) )); then
echo "⚠️ 警告:总空间超过 ${THRESHOLD_GB}GB,请核查是否需清理过期检查点。"
echo "? 建议执行:find $CHECKPOINT_DIR -mindepth 1 -type d -mtime +7 -exec du -sh {} \; | sort -hr | head -5"
fi
配置定时任务自动执行
将脚本保存为 /opt/bin/check-checkpoints.sh,添加可执行权限后,加入 crontab:
chmod +x /opt/bin/check-checkpoints.sh # 每天凌晨2:30运行,并将结果邮件通知管理员(需已配置 mailutils/postfix) 30 2 * * * /opt/bin/check-checkpoints.sh | mail -s "【检查点空间报告】$(hostname)" admin@example.com
如无需邮件,可改写为追加日志:
30 2 * * * /opt/bin/check-checkpoints.sh >> /var/log/checkpoint-monitor.log 2>&1
结合清理策略形成闭环(可选增强)
仅检查不够,建议搭配自动清理逻辑(谨慎启用):
- 保留最近 N 个检查点:
ls -t "$CHECKPOINT_DIR"/*/ | tail -n +6 | xargs rm -rf(保留最新5个); - 清理超过 M 天未修改的检查点:
find "$CHECKPOINT_DIR" -mindepth 1 -type d -mtime +14 -exec rm -rf {} +; - Flink 用户优先使用
state.checkpoints.num-retained参数控制数量,脚本只作兜底校验; - 所有删除操作建议先加
echo模拟,确认路径无误后再移除。
不复杂但容易忽略的是:检查点路径是否跨文件系统、是否有硬链接或快照干扰 du 统计——首次运行时建议人工核对 1–2 个目录的 du -sh 与 ls -lh 是否一致。


















