news 2026/9/23 8:00:26

Apache PredictionIO Docker 部署指南:用 docker-compose 可插拔存储启动事件服务器、训练与部署推荐引擎

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Apache PredictionIO Docker 部署指南:用 docker-compose 可插拔存储启动事件服务器、训练与部署推荐引擎

Apache PredictionIO Docker 部署指南:用 docker-compose 可插拔存储启动事件服务器、训练与部署推荐引擎

【免费下载链接】predictionioPredictionIO, a machine learning server for developers and ML engineers.项目地址: https://gitcode.com/gh_mirrors/pred/predictionio

本篇技术指南围绕 docker/README.md 展开,完整讲解如何通过 Docker 与 docker-compose 快速拉起 Apache PredictionIO 的完整运行环境:包括按需选择 Event / Meta / Model 三类存储后端(PostgreSQL、MySQL、Elasticsearch、LocalFS)、使用pio-docker封装命令完成"注册应用 → 导入数据 → 构建模板 → 训练 → 部署 → 在线查询"的推荐引擎全流程,并覆盖 Spark 集群训练、Engine Server 独立部署、Jupyter 交互式分析等进阶场景。读完本文,你将能够在开发或生产环境中用一套可复用的 docker-compose 组合文件启动 PredictionIO 事件服务器,并完成一个可查询推荐结果的端到端演示。

一、PredictionIO Docker 概览

Apache PredictionIO 是一个面向开发者和 ML 工程师的机器学习服务器,其典型的 DASE(DataSource、Algorithm、Serving、Evaluator)架构由多个组件协作:Event Server(收集用户行为事件)、训练引擎(Spark 驱动)、Engine Server(对外提供查询接口)以及存放 metadata / event data / model data 三类数据的存储后端。

Docker 化部署把这些组件封装进镜像,使开发与生产环境保持一致。仓库中的 docker 目录提供了:

  • 基础pio镜像定义(docker/pio/Dockerfile);
  • 一系列可组合的 docker-compose 文件,用于按需选择存储后端;
  • 用于在容器内执行pio命令的入口脚本(docker/pio/pio_run);
  • Jupyter 镜像与 docker/JUPYTER.md 文档;
  • Kubernetes Helm Chart(docker/charts)。

与直接在宿主机安装 PredictionIO 相比,Docker 方案的核心优势在于:存储后端以"可插拔"方式通过 docker-compose 叠加文件选择,无需手工修改pio-env.sh,即可切换 PostgreSQL / MySQL / Elasticsearch / LocalFS 等组合。

二、核心概念:用可选择的 docker-compose 文件决定存储后端

PredictionIO 有三类数据仓库,分别由环境变量PIO_STORAGE_REPOSITORIES_*指定:

仓库环境变量前缀用途
MetaPIO_STORAGE_REPOSITORIES_METADATA_*存储引擎元数据(引擎注册、参数变体等)
EventPIO_STORAGE_REPOSITORIES_EVENTDATA_*存储事件数据(用户行为、属性等),供 Event Server 读写
ModelPIO_STORAGE_REPOSITORIES_MODELDATA_*存储训练产生的模型

docker-compose 目录按存储类型分目录组织,每个目录内又按"仓库用途"拆分为basemetaeventmodel四个叠加文件。支持的存储后端组合如下(对应 docker/README.md 中的表格):

类型可选存储
EventPostgreSQL、MySQL、Elasticsearch
MetaPostgreSQL、MySQL、Elasticsearch
ModelPostgreSQL、MySQL、LocalFS

由于 docker-compose 支持-f指定多个文件并按顺序叠加(后加载的键覆盖先加载的键),所以可以通过"基础文件 + 任意存储组合"的方式启动环境:

docker-compose -f docker-compose.yml -f ... up

2.1 基础文件:docker-compose.yml

docker/docker-compose.yml 定义核心pio服务:

version: "3" services: pio: image: predictionio/pio:latest ports: - 7070:7070 - 8000:8000 volumes: - ./templates:/templates dns: 8.8.8.8

要点:

  • 端口映射7070是 Event Server 端口(接收事件写入),8000是 Engine Server 查询端口(/queries.json);
  • 卷挂载:宿主机./templates目录挂载到容器内/templates,模板工程放在宿主机该目录下即可在容器内访问;
  • dns: 8.8.8.8用于保证容器内能解析外部域名(下载依赖、拉取数据等)。

2.2 存储后端叠加文件剖析

以 PostgreSQL 为例,需要叠加 4 个文件:

docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up
  • docker/pgsql/docker-compose.base.yml 启动postgres:9数据库服务(用户/密码均为pio--encoding=UTF8),并通过depends_on保证数据库先就绪,同时注入 JDBC 数据源配置:
environment: PIO_STORAGE_SOURCES_PGSQL_TYPE: jdbc PIO_STORAGE_SOURCES_PGSQL_URL: "jdbc:postgresql://postgres/pio" PIO_STORAGE_SOURCES_PGSQL_USERNAME: pio PIO_STORAGE_SOURCES_PGSQL_PASSWORD: pio
  • docker/pgsql/docker-compose.meta.yml、docker/pgsql/docker-compose.event.yml、docker/pgsql/docker-compose.model.yml 分别把三个仓库指向PGSQL数据源并命名:
environment: PIO_STORAGE_REPOSITORIES_METADATA_NAME: pio_meta PIO_STORAGE_REPOSITORIES_METADATA_SOURCE: PGSQL

其他后端同理:

  • MySQL:docker/mysql/docker-compose.base.yml 使用mysql:8PIO_STORAGE_SOURCES_MYSQL_TYPE: jdbcPIO_STORAGE_SOURCES_MYSQL_URL: "jdbc:mysql://mysql/pio";meta/event/model 三个文件把仓库指向MYSQL
  • Elasticsearch:docker/elasticsearch/docker-compose.base.yml 使用elasticsearch:5.6.4,关闭 xpack 各组件(security/ml/monitoring/watcher/graph),设置cluster.name=predictionioES_JAVA_OPTS=-Xms1g -Xmx1g,并注入PIO_STORAGE_SOURCES_ELASTICSEARCH_HOSTS: elasticsearchPORTS: 9200SCHEMES: http
  • LocalFS(仅 Model):docker/localfs/docker-compose.model.yml 使用本地文件系统存放模型:
environment: PIO_STORAGE_REPOSITORIES_MODELDATA_NAME: pio_model PIO_STORAGE_REPOSITORIES_MODELDATA_SOURCE: LOCALFS PIO_FS_BASEDIR: /work/pio_store PIO_FS_ENGINESDIR: /work/pio_store/engines PIO_FS_TMPDIR: /work/pio_store/tmp PIO_STORAGE_SOURCES_LOCALFS_TYPE: localfs PIO_STORAGE_SOURCES_LOCALFS_PATH: /work/pio_store/models

这些PIO_STORAGE_SOURCES_*/PIO_STORAGE_REPOSITORIES_*/PIO_FS_*环境变量与pio-env.sh中的配置一一对应,容器启动时会被加载为 PredictionIO 的存储配置。注意:叠加文件之间是"仓库用途"的解耦,例如 Model 完全可以换成 LocalFS 而保持 Meta/Event 用 PostgreSQL。

三、实战教程:用 Docker 构建一个推荐引擎

下面完整复现 docker/README.md 的推荐模板演示流程。

3.1 启动 PredictionIO 环境

以 PostgreSQL 作为三类存储启动环境:

$ docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up

容器启动后,docker/pio/pio_run 入口脚本会依次执行:

  1. 若配置了 Elasticsearch 数据源,则循环等待 ES 集群健康状态变为 green(最多重试 10 次);
  2. 若配置了 MySQL 数据源,则检查$PIO_HOME/lib/mysql-connector-java-$MYSQL_VERSION.jar是否存在,不存在则自动下载;
  3. 循环执行pio status等待 PredictionIO 就绪;
  4. 最后默认启动 Event Server(pio eventserver),除非设置了PIO_RUN_FILE(见下文 Engine Server 一节)。

3.2 使用 pio-docker 封装命令

仓库为pio命令提供了容器内的封装pio-docker:它在 PredictionIO 容器内执行对应的pio子命令,使你不必手动docker exec。将仓库根目录的bin加入 PATH 后即可使用:

$ export PATH=`pwd`/bin:$PATH $ pio-docker status ... [INFO] [Management$] Your system is all ready to go.

3.3 下载推荐模板

本演示使用 Apache PredictionIO 的推荐模板(recommender template)。进入挂载目录并克隆模板:

$ cd templates $ git clone https://github.com/apache/predictionio-template-recommender.git MyRecommendation $ cd MyRecommendation

由于./templates已挂载进容器/templates,模板源码在容器内可见。

3.4 注册应用(Application)

每个引擎对应一个 Application,需要先在 PredictionIO 中注册以获取 Access Key:

$ pio-docker app new MyApp1 [INFO] [App$] Initialized Event Store for this app ID: 1. [INFO] [Pio$] Created a new app: [INFO] [Pio$] Name: MyApp1 [INFO] [Pio$] ID: 1 [INFO] [Pio$] Access Key: i-zc4EleEM577EJhx3CzQhZZ0NnjBKKdSbp3MiR5JDb2zdTKKzH9nF6KLqjlMnvl

Access Key 是后续导入数据、写事件的凭证,先保存到环境变量:

$ ACCESS_KEY=i-zc4EleEM577EJhx3CzQhZZ0NnjBKKdSbp3MiR5JDb2zdTKKzH9nF6KLqjlMnvl

同时,模板的engine.jsondatasource.params.appName默认是占位符INVALID_APP_NAME,必须改成MyApp1

"datasource": { "params" : { "appName": "MyApp1" } }

3.5 导入训练数据

模板提供了 Python 导入脚本,它依赖 PredictionIO Python SDK:

$ pip install predictionio

下载 MovieLens 样例数据并导入事件服务器:

$ curl https://raw.githubusercontent.com/apache/spark/master/data/mllib/sample_movielens_data.txt --create-dirs -o data/sample_movielens_data.txt $ python data/import_eventserver.py --access_key $ACCESS_KEY

该脚本通过 SDK 把rate等事件写入运行在7070端口的 Event Server。事件数据会落到你在第 2 节选择的 Event 存储中。

3.6 构建模板

推荐模板是 Scala 工程,需要由pio build编译打包:

$ pio-docker build --verbose

构建产物与依赖(Spark、Elasticsearch 等)都由容器内预装的环境提供(详见 docker/pio/Dockerfile)。

3.7 训练并生成模型

执行训练子命令:

$ pio-docker train

训练由 Spark 驱动(默认使用容器内嵌的 Spark 本地模式;若叠加了 Spark 集群文件,见第 4.2 节),训练完成后模型写入 Model 存储(如 PostgreSQL 或 LocalFS 的/work/pio_store/models)。

3.8 部署并查询推荐结果

模型训练成功后,部署到 Prediction Server:

$ pio-docker deploy

部署成功后,Engine Server 在8000端口对外提供查询接口。发送一个推荐请求:

$ curl -H "Content-Type: application/json" \ -d '{ "user": "1", "num": 4 }' http://localhost:8000/queries.json

返回的 JSON 即为该用户 Top-4 推荐项列表。至此,一个完整的"数据收集 → 训练 → 服务"闭环已在 Docker 环境中跑通。

四、进阶主题

4.1 使用 Elasticsearch 作为 Meta / Event 存储

Elasticsearch 可作 Meta 与 Event 存储;Model 存储没有 ES 支持,示例中改用 LocalFS:

docker-compose -f docker-compose.yml \ -f elasticsearch/docker-compose.base.yml \ -f elasticsearch/docker-compose.meta.yml \ -f elasticsearch/docker-compose.event.yml \ -f localfs/docker-compose.model.yml \ up

4.2 使用 Spark 集群训练

在基础组合之外追加 docker/docker-compose.spark.yml,即可拉起独立的 Spark Master 与 Worker:

docker-compose -f docker-compose.yml \ -f docker-compose.spark.yml \ -f elasticsearch/docker-compose.base.yml \ -f elasticsearch/docker-compose.meta.yml \ -f elasticsearch/docker-compose.event.yml \ -f localfs/docker-compose.model.yml \ up

该文件使用bde2020/spark-master:2.2.2-hadoop2.7bde2020/spark-worker:2.2.2-hadoop2.7镜像,Master 暴露8080(Web UI)与7077(Spark 通信端口),Worker 通过SPARK_MASTER=spark://spark-master:7077注册。

将训练任务提交到集群时,通过--master指定 Spark 集群地址(注意pio train自身参数用--分隔):

pio-docker train -- --master spark://spark-master:7077

如需调整集群配置,直接修改 docker/docker-compose.spark.yml(例如增加 Worker 数量、调整端口)。

4.3 独立部署 Engine Server

pio-docker deploy是在容器内手动部署;如果希望容器启动即自动部署指定引擎,可追加 docker/docker-compose.deploy.yml:

docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ -f docker-compose.deploy.yml \ up

该文件设置:

environment: - "PIO_TEMPLATE_NAME=MyRecommendation" - "PIO_RUN_FILE=/deploy/run.sh" volumes: - ./deploy:/deploy

PIO_RUN_FILE会改变容器入口行为:pio_run检测到该变量后不再启动 Event Server,而是执行 docker/deploy/run.sh:

cd /templates/$PIO_TEMPLATE_NAME pio deploy

即进入模板目录并执行pio deploy,把引擎常驻部署为服务。修改部署行为时,可调整PIO_TEMPLATE_NAMEdeploy/run.sh

4.4 与 Jupyter 结合做探索性数据分析(EDA)

追加 docker/docker-compose.jupyter.yml 可启动带 Jupyter Notebook 的环境:

docker-compose -f docker-compose.jupyter.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up

该文件使用predictionio/pio-jupyter:latest镜像,额外映射8888端口,并把./templates挂载到/home/jovyan/templates。启动后在浏览器打开http://127.0.0.1:8888/,从New下拉菜单打开终端,即可在 PredictionIO 环境内执行pio命令进行探索性数据分析(EDA)。更完整的说明(含 Scala 模板与 Python 模板两套入门流程、pio train --main-py-file train.py等用法)见 docker/JUPYTER.md。

五、开发与发布:构建、打标签与推送镜像

5.1 构建基础镜像

基础镜像定义在 docker/pio/Dockerfile,其构建逻辑值得注意:

  • 基础镜像为openjdk:8
  • 内置版本:Scala2.11.12、Spark2.2.3、Hadoop2.7.7、Elasticsearch5.5.3、PostgreSQL JDBC42.2.4、MySQL JDBC8.0.12
  • 从源码仓库 checkoutv0.13.0标签,执行make-distribution.sh -Dscala.version=... -Dspark.version=... -Dhadoop.version=... -Delasticsearch.version=... --with-deb构建 deb 包并安装到/usr/share/predictionio(即PIO_HOME);
  • 初始化/etc/predictionio/pio-env.sh,写入POSTGRES_JDBC_DRIVERMYSQL_JDBC_DRIVERSPARK_HOME等变量;
  • EXPOSE 7070 8000,默认CMD ["sh", "/usr/bin/pio_run"]

构建命令:

docker build -t predictionio/pio pio

5.2 构建 Jupyter 镜像

docker build -t predictionio/pio-jupyter jupyter

5.3 推送镜像(发布流程)

docker push predictionio/pio:latest docker tag predictionio/pio:latest predictionio/pio:$PIO_VERSION docker push predictionio/pio:$PIO_VERSION

其中$PIO_VERSION对应发布版本号(如v0.13.0),保证latest与版本标签同步发布。

六、小结与进一步探索

本文围绕 docker/README.md 梳理了 Apache PredictionIO 的 Docker 化部署全貌:通过 docker-compose 叠加文件自由组合 Meta / Event / Model 三类存储(PostgreSQL、MySQL、Elasticsearch、LocalFS),用pio-docker在容器内完成从应用注册到推荐查询的完整引擎生命周期,并支持 Spark 集群训练、自动部署 Engine Server、Jupyter EDA 等进阶用法。在此基础上,还可进一步阅读:

  • docker/pio/pio_run:容器入口脚本,理解启动等待与 Event Server / 部署脚本的分流逻辑;
  • docker/pio/Dockerfile:镜像内部版本矩阵与构建过程;
  • docker/docker-compose.deploy.yml 与 docker/deploy/run.sh:自动部署机制;
  • docker/docker-compose.spark.yml:Spark 集群编排;
  • docker/JUPYTER.md:Jupyter 环境下的完整模板演练;
  • docker/charts:面向 Kubernetes 的 Helm Chart 部署方案。

【免费下载链接】predictionioPredictionIO, a machine learning server for developers and ML engineers.项目地址: https://gitcode.com/gh_mirrors/pred/predictionio

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/23 8:00:07

Node-RED 之外,国产规则引擎的新方案:基于标准语法,Go 先行实现

一、规则引擎是什么 规则引擎,简单说是:给业务逻辑提供一种专门的表达语言,而不用每次用代码重写一遍。 物联网的场景联动,就是规则引擎最常见的一种形态:一段规则 触发器(什么时候开始) 条件…

作者头像 李华
网站建设 2026/9/23 7:58:52

网络热词“cua”走红:从游戏到生活的速度拟声词解析

最近刷短视频,我算是被同一个词“轰炸”了:评论区一水的“cua”,游戏主播被打死刷“cua一下没了”,小猫从桌上蹿出去也刷“cua!”,连手机掉地上碎屏都有人来一句“cua,钱没了”。作为一个常年蹲…

作者头像 李华
网站建设 2026/9/23 7:58:32

Bandizip 使用教程:从下载安装到解压压缩与常见问题排查

Bandizip 是我这几年来在 Windows 上最常跟别人推荐的一款压缩软件,它兼顾了“开箱即用的方便”和“偶尔需要的硬核功能”。如果你已经被 WinRAR 的弹窗提醒烦了很久,或者是第一次想找一个能解压 rar、7z、zip、tar 等格式的清爽工具,这篇文章…

作者头像 李华
网站建设 2026/9/23 7:55:57

安全测试工具清单|常见安全测试工具介绍及比对

安全测试工具清单|常见安全测试工具介绍及比对 一、AppScan Appscan是一款专业的漏洞扫描和安全评估工具,它主要用于帮助企业评估和发现其网站和应用程序中存在的安全漏洞和风险。其主要功能包括漏洞扫描、安全审计和风险评估。它可以自动扫描网站和应…

作者头像 李华
网站建设 2026/9/23 7:55:49

给编码助手加装安全审计技能:从SQL注入到硬编码密钥的实战指南

1. 为什么我要给编码助手加一套安全审计技能第一次听到“security-audit-skill”这个词,是在一个内部技术交流群里。有人丢了一张截图,内容是某个编码助手在生成代码时,顺手把一段硬编码的密钥写进了配置文件,还贴心地加了一行注释…

作者头像 李华
网站建设 2026/9/23 7:55:24

配电网韧性提升:移动储能预布局与动态调度建模及Matlab实现

1. 一文看懂“预布局动态调度”到底在解决什么问题如果你这两年一直在关注配电网方向的研究,大概率会发现一个高频词:配电网韧性。这个词跟传统的“可靠性”不完全是一回事。可靠性强调的是平均意义上的停电频率和时长,而韧性针对的是小概率、…

作者头像 李华