用 OverlayFS 构建只读系统服务沙箱,核心是三层物理隔离、强制挂载约束与“一次一清”生命周期:lowerdir 只读冻结并 chmod 555,upperdir 独立分区且清除 setuid/setgid,workdir 同文件系统并清空;必须启用 redirect_dir=on、index=on、noexec/nosuid/nodev;每次启动分配唯一目录、启动前重建、退出后销毁,并叠加命名空间、seccomp-bpf 与 cgroups v2 实现全栈隔离。

用 OverlayFS 构建只读系统服务沙箱,核心是让服务运行在“表面可写、底层 immutable”的环境中:所有修改都落在上层(upperdir),基础系统(lowerdir)完全冻结,服务退出后上层即销毁,不留痕迹。这不是简单挂载,而是围绕 COW 机制设计的隔离闭环。
三层目录必须物理分离且权限固化
安全起点是目录结构不可妥协:
-
lowerdir 必须是只读快照,例如从可信镜像解压出的最小 rootfs;执行
chown root:root && chmod 555,禁用写入与执行位,防止符号链接逃逸或 setuid 程序绕过 -
upperdir 必须位于独立可写分区(如 tmpfs 或专用 ext4 分区),严禁与 lowerdir 共享挂载点;创建后立即
chown -R sandbox:sandbox并清除所有 setuid/setgid 位:find . -type f -perm /6000 -exec chmod a-s {} \; - workdir 必须与 upperdir 同一文件系统,仅用于 OverlayFS 内部原子操作;每次启动前清空内容,不存放用户数据,也不暴露给服务进程
挂载选项必须启用关键安全约束
默认挂载不具备防护能力,以下参数缺一不可:
-
redirect_dir=on:确保rename()等目录操作在 merged 视图下正确重定向到 upperdir,避免路径解析绕过覆盖逻辑 -
index=on:启用硬链接索引,防止同一 lower 文件的多个硬链接在 copy-up 时元数据错乱,保障审计一致性 -
noexec,nosuid,nodev:从 VFS 层面阻断代码执行、特权提升和设备节点访问,即使 upperdir 混入恶意文件也无效 - 不使用
default_permissions(已废弃且无实际作用),依赖内核原生 VFS 权限检查更可靠
服务生命周期必须“一次一清”
每个服务实例都应视为全新可信边界,杜绝状态复用:
- 为每次启动生成唯一 upperdir 和 workdir 名称(例如基于 PID 或 SHA256(timestamp+nonce)),避免跨实例污染
- 启动前强制重建 upperdir:
rm -rf $upper && mkdir -p $upper,清除所有历史残留、临时文件或持久化后门 - 服务退出后立即
umount /merged并递归删除整个 upperdir;所有运行时变更彻底消失 - 如需保留日志或输出,仅允许显式
cp --reflink=always从 merged 中拷出白名单路径(如/var/log/app.log),目标目录需单独挂载为只读
叠加命名空间与 seccomp 实现完整服务隔离
OverlayFS 只解决文件系统层隔离,必须补全其他维度:
- 用
unshare --user --pid --mount --net --ipc --uts创建独立命名空间,使服务看不到宿主进程、网络栈和挂载树 - 配合 seccomp-bpf 过滤系统调用,例如禁止
unlink、mount、ptrace、open_by_handle_at等高危操作 - 通过 cgroups v2 限制 CPU 时间片、内存上限与 I/O 带宽,防止单个服务耗尽资源


















