Apache PredictionIO Docker 部署指南:用 docker-compose 可插拔存储启动事件服务器、训练与部署推荐引擎
【免费下载链接】predictionioPredictionIO, a machine learning server for developers and ML engineers.项目地址: https://gitcode.com/gh_mirrors/pred/predictionio
本篇技术指南围绕 docker/README.md 展开,完整讲解如何通过 Docker 与 docker-compose 快速拉起 Apache PredictionIO 的完整运行环境:包括按需选择 Event / Meta / Model 三类存储后端(PostgreSQL、MySQL、Elasticsearch、LocalFS)、使用pio-docker封装命令完成"注册应用 → 导入数据 → 构建模板 → 训练 → 部署 → 在线查询"的推荐引擎全流程,并覆盖 Spark 集群训练、Engine Server 独立部署、Jupyter 交互式分析等进阶场景。读完本文,你将能够在开发或生产环境中用一套可复用的 docker-compose 组合文件启动 PredictionIO 事件服务器,并完成一个可查询推荐结果的端到端演示。
一、PredictionIO Docker 概览
Apache PredictionIO 是一个面向开发者和 ML 工程师的机器学习服务器,其典型的 DASE(DataSource、Algorithm、Serving、Evaluator)架构由多个组件协作:Event Server(收集用户行为事件)、训练引擎(Spark 驱动)、Engine Server(对外提供查询接口)以及存放 metadata / event data / model data 三类数据的存储后端。
Docker 化部署把这些组件封装进镜像,使开发与生产环境保持一致。仓库中的 docker 目录提供了:
- 基础
pio镜像定义(docker/pio/Dockerfile); - 一系列可组合的 docker-compose 文件,用于按需选择存储后端;
- 用于在容器内执行
pio命令的入口脚本(docker/pio/pio_run); - Jupyter 镜像与 docker/JUPYTER.md 文档;
- Kubernetes Helm Chart(docker/charts)。
与直接在宿主机安装 PredictionIO 相比,Docker 方案的核心优势在于:存储后端以"可插拔"方式通过 docker-compose 叠加文件选择,无需手工修改pio-env.sh,即可切换 PostgreSQL / MySQL / Elasticsearch / LocalFS 等组合。
二、核心概念:用可选择的 docker-compose 文件决定存储后端
PredictionIO 有三类数据仓库,分别由环境变量PIO_STORAGE_REPOSITORIES_*指定:
| 仓库 | 环境变量前缀 | 用途 |
|---|---|---|
| Meta | PIO_STORAGE_REPOSITORIES_METADATA_* | 存储引擎元数据(引擎注册、参数变体等) |
| Event | PIO_STORAGE_REPOSITORIES_EVENTDATA_* | 存储事件数据(用户行为、属性等),供 Event Server 读写 |
| Model | PIO_STORAGE_REPOSITORIES_MODELDATA_* | 存储训练产生的模型 |
docker-compose 目录按存储类型分目录组织,每个目录内又按"仓库用途"拆分为base、meta、event、model四个叠加文件。支持的存储后端组合如下(对应 docker/README.md 中的表格):
| 类型 | 可选存储 |
|---|---|
| Event | PostgreSQL、MySQL、Elasticsearch |
| Meta | PostgreSQL、MySQL、Elasticsearch |
| Model | PostgreSQL、MySQL、LocalFS |
由于 docker-compose 支持-f指定多个文件并按顺序叠加(后加载的键覆盖先加载的键),所以可以通过"基础文件 + 任意存储组合"的方式启动环境:
docker-compose -f docker-compose.yml -f ... up2.1 基础文件:docker-compose.yml
docker/docker-compose.yml 定义核心pio服务:
version: "3" services: pio: image: predictionio/pio:latest ports: - 7070:7070 - 8000:8000 volumes: - ./templates:/templates dns: 8.8.8.8要点:
- 端口映射:
7070是 Event Server 端口(接收事件写入),8000是 Engine Server 查询端口(/queries.json); - 卷挂载:宿主机
./templates目录挂载到容器内/templates,模板工程放在宿主机该目录下即可在容器内访问; dns: 8.8.8.8用于保证容器内能解析外部域名(下载依赖、拉取数据等)。
2.2 存储后端叠加文件剖析
以 PostgreSQL 为例,需要叠加 4 个文件:
docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up- docker/pgsql/docker-compose.base.yml 启动
postgres:9数据库服务(用户/密码均为pio,--encoding=UTF8),并通过depends_on保证数据库先就绪,同时注入 JDBC 数据源配置:
environment: PIO_STORAGE_SOURCES_PGSQL_TYPE: jdbc PIO_STORAGE_SOURCES_PGSQL_URL: "jdbc:postgresql://postgres/pio" PIO_STORAGE_SOURCES_PGSQL_USERNAME: pio PIO_STORAGE_SOURCES_PGSQL_PASSWORD: pio- docker/pgsql/docker-compose.meta.yml、docker/pgsql/docker-compose.event.yml、docker/pgsql/docker-compose.model.yml 分别把三个仓库指向
PGSQL数据源并命名:
environment: PIO_STORAGE_REPOSITORIES_METADATA_NAME: pio_meta PIO_STORAGE_REPOSITORIES_METADATA_SOURCE: PGSQL其他后端同理:
- MySQL:docker/mysql/docker-compose.base.yml 使用
mysql:8,PIO_STORAGE_SOURCES_MYSQL_TYPE: jdbc、PIO_STORAGE_SOURCES_MYSQL_URL: "jdbc:mysql://mysql/pio";meta/event/model 三个文件把仓库指向MYSQL; - Elasticsearch:docker/elasticsearch/docker-compose.base.yml 使用
elasticsearch:5.6.4,关闭 xpack 各组件(security/ml/monitoring/watcher/graph),设置cluster.name=predictionio、ES_JAVA_OPTS=-Xms1g -Xmx1g,并注入PIO_STORAGE_SOURCES_ELASTICSEARCH_HOSTS: elasticsearch、PORTS: 9200、SCHEMES: http; - LocalFS(仅 Model):docker/localfs/docker-compose.model.yml 使用本地文件系统存放模型:
environment: PIO_STORAGE_REPOSITORIES_MODELDATA_NAME: pio_model PIO_STORAGE_REPOSITORIES_MODELDATA_SOURCE: LOCALFS PIO_FS_BASEDIR: /work/pio_store PIO_FS_ENGINESDIR: /work/pio_store/engines PIO_FS_TMPDIR: /work/pio_store/tmp PIO_STORAGE_SOURCES_LOCALFS_TYPE: localfs PIO_STORAGE_SOURCES_LOCALFS_PATH: /work/pio_store/models这些PIO_STORAGE_SOURCES_*/PIO_STORAGE_REPOSITORIES_*/PIO_FS_*环境变量与pio-env.sh中的配置一一对应,容器启动时会被加载为 PredictionIO 的存储配置。注意:叠加文件之间是"仓库用途"的解耦,例如 Model 完全可以换成 LocalFS 而保持 Meta/Event 用 PostgreSQL。
三、实战教程:用 Docker 构建一个推荐引擎
下面完整复现 docker/README.md 的推荐模板演示流程。
3.1 启动 PredictionIO 环境
以 PostgreSQL 作为三类存储启动环境:
$ docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up容器启动后,docker/pio/pio_run 入口脚本会依次执行:
- 若配置了 Elasticsearch 数据源,则循环等待 ES 集群健康状态变为 green(最多重试 10 次);
- 若配置了 MySQL 数据源,则检查
$PIO_HOME/lib/mysql-connector-java-$MYSQL_VERSION.jar是否存在,不存在则自动下载; - 循环执行
pio status等待 PredictionIO 就绪; - 最后默认启动 Event Server(
pio eventserver),除非设置了PIO_RUN_FILE(见下文 Engine Server 一节)。
3.2 使用 pio-docker 封装命令
仓库为pio命令提供了容器内的封装pio-docker:它在 PredictionIO 容器内执行对应的pio子命令,使你不必手动docker exec。将仓库根目录的bin加入 PATH 后即可使用:
$ export PATH=`pwd`/bin:$PATH $ pio-docker status ... [INFO] [Management$] Your system is all ready to go.3.3 下载推荐模板
本演示使用 Apache PredictionIO 的推荐模板(recommender template)。进入挂载目录并克隆模板:
$ cd templates $ git clone https://github.com/apache/predictionio-template-recommender.git MyRecommendation $ cd MyRecommendation由于./templates已挂载进容器/templates,模板源码在容器内可见。
3.4 注册应用(Application)
每个引擎对应一个 Application,需要先在 PredictionIO 中注册以获取 Access Key:
$ pio-docker app new MyApp1 [INFO] [App$] Initialized Event Store for this app ID: 1. [INFO] [Pio$] Created a new app: [INFO] [Pio$] Name: MyApp1 [INFO] [Pio$] ID: 1 [INFO] [Pio$] Access Key: i-zc4EleEM577EJhx3CzQhZZ0NnjBKKdSbp3MiR5JDb2zdTKKzH9nF6KLqjlMnvlAccess Key 是后续导入数据、写事件的凭证,先保存到环境变量:
$ ACCESS_KEY=i-zc4EleEM577EJhx3CzQhZZ0NnjBKKdSbp3MiR5JDb2zdTKKzH9nF6KLqjlMnvl同时,模板的engine.json中datasource.params.appName默认是占位符INVALID_APP_NAME,必须改成MyApp1:
"datasource": { "params" : { "appName": "MyApp1" } }3.5 导入训练数据
模板提供了 Python 导入脚本,它依赖 PredictionIO Python SDK:
$ pip install predictionio下载 MovieLens 样例数据并导入事件服务器:
$ curl https://raw.githubusercontent.com/apache/spark/master/data/mllib/sample_movielens_data.txt --create-dirs -o data/sample_movielens_data.txt $ python data/import_eventserver.py --access_key $ACCESS_KEY该脚本通过 SDK 把rate等事件写入运行在7070端口的 Event Server。事件数据会落到你在第 2 节选择的 Event 存储中。
3.6 构建模板
推荐模板是 Scala 工程,需要由pio build编译打包:
$ pio-docker build --verbose构建产物与依赖(Spark、Elasticsearch 等)都由容器内预装的环境提供(详见 docker/pio/Dockerfile)。
3.7 训练并生成模型
执行训练子命令:
$ pio-docker train训练由 Spark 驱动(默认使用容器内嵌的 Spark 本地模式;若叠加了 Spark 集群文件,见第 4.2 节),训练完成后模型写入 Model 存储(如 PostgreSQL 或 LocalFS 的/work/pio_store/models)。
3.8 部署并查询推荐结果
模型训练成功后,部署到 Prediction Server:
$ pio-docker deploy部署成功后,Engine Server 在8000端口对外提供查询接口。发送一个推荐请求:
$ curl -H "Content-Type: application/json" \ -d '{ "user": "1", "num": 4 }' http://localhost:8000/queries.json返回的 JSON 即为该用户 Top-4 推荐项列表。至此,一个完整的"数据收集 → 训练 → 服务"闭环已在 Docker 环境中跑通。
四、进阶主题
4.1 使用 Elasticsearch 作为 Meta / Event 存储
Elasticsearch 可作 Meta 与 Event 存储;Model 存储没有 ES 支持,示例中改用 LocalFS:
docker-compose -f docker-compose.yml \ -f elasticsearch/docker-compose.base.yml \ -f elasticsearch/docker-compose.meta.yml \ -f elasticsearch/docker-compose.event.yml \ -f localfs/docker-compose.model.yml \ up4.2 使用 Spark 集群训练
在基础组合之外追加 docker/docker-compose.spark.yml,即可拉起独立的 Spark Master 与 Worker:
docker-compose -f docker-compose.yml \ -f docker-compose.spark.yml \ -f elasticsearch/docker-compose.base.yml \ -f elasticsearch/docker-compose.meta.yml \ -f elasticsearch/docker-compose.event.yml \ -f localfs/docker-compose.model.yml \ up该文件使用bde2020/spark-master:2.2.2-hadoop2.7与bde2020/spark-worker:2.2.2-hadoop2.7镜像,Master 暴露8080(Web UI)与7077(Spark 通信端口),Worker 通过SPARK_MASTER=spark://spark-master:7077注册。
将训练任务提交到集群时,通过--master指定 Spark 集群地址(注意pio train自身参数用--分隔):
pio-docker train -- --master spark://spark-master:7077如需调整集群配置,直接修改 docker/docker-compose.spark.yml(例如增加 Worker 数量、调整端口)。
4.3 独立部署 Engine Server
pio-docker deploy是在容器内手动部署;如果希望容器启动即自动部署指定引擎,可追加 docker/docker-compose.deploy.yml:
docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ -f docker-compose.deploy.yml \ up该文件设置:
environment: - "PIO_TEMPLATE_NAME=MyRecommendation" - "PIO_RUN_FILE=/deploy/run.sh" volumes: - ./deploy:/deployPIO_RUN_FILE会改变容器入口行为:pio_run检测到该变量后不再启动 Event Server,而是执行 docker/deploy/run.sh:
cd /templates/$PIO_TEMPLATE_NAME pio deploy即进入模板目录并执行pio deploy,把引擎常驻部署为服务。修改部署行为时,可调整PIO_TEMPLATE_NAME与deploy/run.sh。
4.4 与 Jupyter 结合做探索性数据分析(EDA)
追加 docker/docker-compose.jupyter.yml 可启动带 Jupyter Notebook 的环境:
docker-compose -f docker-compose.jupyter.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up该文件使用predictionio/pio-jupyter:latest镜像,额外映射8888端口,并把./templates挂载到/home/jovyan/templates。启动后在浏览器打开http://127.0.0.1:8888/,从New下拉菜单打开终端,即可在 PredictionIO 环境内执行pio命令进行探索性数据分析(EDA)。更完整的说明(含 Scala 模板与 Python 模板两套入门流程、pio train --main-py-file train.py等用法)见 docker/JUPYTER.md。
五、开发与发布:构建、打标签与推送镜像
5.1 构建基础镜像
基础镜像定义在 docker/pio/Dockerfile,其构建逻辑值得注意:
- 基础镜像为
openjdk:8; - 内置版本:Scala
2.11.12、Spark2.2.3、Hadoop2.7.7、Elasticsearch5.5.3、PostgreSQL JDBC42.2.4、MySQL JDBC8.0.12; - 从源码仓库 checkout
v0.13.0标签,执行make-distribution.sh -Dscala.version=... -Dspark.version=... -Dhadoop.version=... -Delasticsearch.version=... --with-deb构建 deb 包并安装到/usr/share/predictionio(即PIO_HOME); - 初始化
/etc/predictionio/pio-env.sh,写入POSTGRES_JDBC_DRIVER、MYSQL_JDBC_DRIVER、SPARK_HOME等变量; EXPOSE 7070 8000,默认CMD ["sh", "/usr/bin/pio_run"]。
构建命令:
docker build -t predictionio/pio pio5.2 构建 Jupyter 镜像
docker build -t predictionio/pio-jupyter jupyter5.3 推送镜像(发布流程)
docker push predictionio/pio:latest docker tag predictionio/pio:latest predictionio/pio:$PIO_VERSION docker push predictionio/pio:$PIO_VERSION其中$PIO_VERSION对应发布版本号(如v0.13.0),保证latest与版本标签同步发布。
六、小结与进一步探索
本文围绕 docker/README.md 梳理了 Apache PredictionIO 的 Docker 化部署全貌:通过 docker-compose 叠加文件自由组合 Meta / Event / Model 三类存储(PostgreSQL、MySQL、Elasticsearch、LocalFS),用pio-docker在容器内完成从应用注册到推荐查询的完整引擎生命周期,并支持 Spark 集群训练、自动部署 Engine Server、Jupyter EDA 等进阶用法。在此基础上,还可进一步阅读:
- docker/pio/pio_run:容器入口脚本,理解启动等待与 Event Server / 部署脚本的分流逻辑;
- docker/pio/Dockerfile:镜像内部版本矩阵与构建过程;
- docker/docker-compose.deploy.yml 与 docker/deploy/run.sh:自动部署机制;
- docker/docker-compose.spark.yml:Spark 集群编排;
- docker/JUPYTER.md:Jupyter 环境下的完整模板演练;
- docker/charts:面向 Kubernetes 的 Helm Chart 部署方案。
【免费下载链接】predictionioPredictionIO, a machine learning server for developers and ML engineers.项目地址: https://gitcode.com/gh_mirrors/pred/predictionio
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考