Docker部署Flink最适用于开发测试,关键在于网络互通、配置对齐和作业提交方式;需自定义镜像覆盖flink-conf.yaml、放入依赖JAR、暴露端口;推荐docker-compose编排集群,用REST API或CLI提交作业,并验证日志、checkpoint路径、内存及外部服务连通性。

用 Docker 部署 Flink 是开发和测试阶段最高效的方式,能快速拉起一致环境、避免“本地跑通、线上报错”,也便于后续对接 Kafka、MySQL 等组件。关键不在拉镜像,而在网络打通、配置对齐和作业提交方式选对。
准备基础镜像与自定义配置
官方镜像(如 flink:1.18.1-scala_2.12)开箱即用,但默认不支持 checkpoint 持久化或外部连接器。建议基于它构建自定义镜像:
- 覆盖 flink-conf.yaml:设
jobmanager.rpc.address: jobmanager(必须是服务名,非 IP),启用state.backend: filesystem,并指定state.checkpoints.dir到挂载卷路径(如/checkpoints) - 放入必要 JAR:把 MySQL CDC、Elasticsearch sink、Kafka connector 等依赖包复制进
/opt/flink/lib/ - 暴露端口:至少开放 8081(Web UI)和 6123(JobManager RPC),若需远程提交作业,确保宿主机可访问
用 docker-compose 编排多节点集群
单机部署推荐 docker-compose.yml,比手动 docker run 更可靠,避免硬编码 IP 和启动顺序问题:
- 定义 jobmanager 服务:指定镜像、端口映射、启动命令为
jobmanager,环境变量JOB_MANAGER_RPC_ADDRESS=jobmanager - 定义 taskmanager 服务:用
depends_on声明依赖,同样设JOB_MANAGER_RPC_ADDRESS=jobmanager,可设deploy.replicas: 2启动多个实例 - 创建独立网络:运行
docker network create flink-network,并在 compose 中指定networks: [flink-network],让容器靠服务名互通
执行 docker-compose up -d 后,访问 http://localhost:8081,能看到 TaskManager 成功注册。
提交作业别只靠 Web UI
Web UI 上传 JAR 容易超时、无日志反馈、不支持参数传递。推荐两种更稳的方式:
-
REST API 提交:先 GET
http://localhost:8081/v1/clusters获取 session ID,再 POST JAR 文件 + 入口类 +programArgs(运行参数)+parallelism(并行度) -
CLI 远程提交:在宿主机装 Flink CLI(同版本),执行
flink run -t remote -j /path/to/job.jar --parallelism 4,自动连到localhost:8081
验证与调试要点
集群起来不等于能稳定跑作业,注意几个易错细节:
- 检查
TaskManager 日志:执行docker logs flink-taskmanager-1,确认是否成功连接 JobManager(含 “Registered at” 字样) - 确认 checkpoint 路径可写:挂载卷需有读写权限,目录结构应为
/checkpoints/checkpoint-xxx,否则状态无法保存 - 内存限制要合理:在 compose 中给
taskmanager加deploy.resources.limits.memory: 2g,防止 OOM 导致任务失败 - 外部服务连通性:若作业要读 Kafka 或写 MySQL,确保 taskmanager 容器能通过服务名(如
kafka:9092)访问,而不是localhost


















