根本原因是ceph-deploy不自动分发Ceph包,需手动在各节点安装ceph、ceph-common等;cephadm bootstrap失败主因是docker.io镜像拉取超时,应配置国内镜像源或改用quay.io;OSD激活卡住多因磁盘残留元数据,须用ceph-volume lvm zap清理;cephfs挂载报错常因内核不支持msgr2,可降级协议或改用ceph-fuse。

ceph-deploy 初始化集群失败:找不到 ceph 命令
根本原因不是没装 Ceph,而是 ceph-deploy 默认只在本地执行命令,不会自动把 Ceph 包推送到目标节点。它假设你已经手动在所有节点上装好了 ceph、ceph-mon、ceph-osd 等包。
实操建议:
- 先在每个节点(包括部署机)运行
sudo apt install ceph ceph-common ceph-mon ceph-osd(Debian/Ubuntu)或sudo yum install centos-release-ceph-quincy && sudo yum install ceph-common ceph-mon ceph-osd(CentOS 8+) -
ceph-deploy不再维护,官方已弃用;新集群直接用cephadm,它自带包分发能力 - 如果坚持用
ceph-deploy,必须确认所有节点的/usr/bin/ceph存在且可执行,否则初始化到mon步骤就会报command not found
cephadm bootstrap 失败:Failed to pull image docker.io/ceph/ceph:v17
默认拉取的是国外镜像源,国内网络常超时或被重置。这不是配置写错,是网络策略问题。
实操建议:
- 提前在所有节点配置好国内镜像加速器,比如阿里云的
https://<your-id>.mirror.aliyuncs.com</your-id>,写入/etc/docker/daemon.json - 用
cephadm指定镜像:cephadm bootstrap --mon-ip <code>192.168.10.10--image quay.io/ceph/ceph:v17(quay.io 在国内比 docker.io 稳定) - 若仍失败,先手动拉一次:
sudo podman pull quay.io/ceph/ceph:v17(cephadm默认优先用podman) - 注意:v17(Quincy)要求内核 ≥ 5.4,老系统(如 CentOS 7)需升级 kernel 或改用 v16(Pacific)
OSD 创建卡在 activating 状态,ceph -s 显示 HEALTH_WARN
常见于使用裸设备(如 /dev/sdb)但未清空分区表或 LVM 元数据,Ceph 拒绝复用有残留结构的磁盘。
实操建议:
- 创建前务必清理:用
sudo ceph-volume lvm zap /dev/sdb --destroy(安全擦除),不要只用dd if=/dev/zero of=/dev/sdb bs=1M count=100 - 确认磁盘没有挂载、没被 LVM 占用:
lsblk和sudo pvs都应不显示该设备 - 若用目录方式(
--data /var/lib/ceph/osd/ceph-0),确保父目录属主是ceph:ceph,权限为0755 - 日志看
journalctl -u ceph.target -f,重点搜bluestore和device is busy
客户端 mount cephfs 报错:mount error(22): Invalid argument
不是密钥错了,是内核版太低或没启用 CephFS 模块。CentOS 7.9 默认内核 3.10 不支持 cephfs 的新协议(msgr2),而 cephadm 默认启用了 msgr2。
实操建议:
- 检查内核支持:
zcat /proc/config.gz | grep -i ceph(需开启CONFIG_CEPH_FS) - 临时降级协议:在 mon 节点修改
/etc/ceph/ceph.conf,加ms_bind_msgr2 = false,然后sudo systemctl restart ceph-mon.target - 推荐用
kernel client+ceph-fuse作为过渡:ceph-fuse -n client.admin -r / /mnt/cephfs,绕过内核限制 - 注意:RBD 映射(
rbd map)不受此影响,它走的是 block 层,和 cephfs 协议无关
真正麻烦的是跨版本兼容——比如 Pacific 集群混用 Quincy 客户端,某些 crush rule 或 pool 参数会静默失效,得盯紧 ceph health detail 里的 warning 级提示。

















