news 2026/4/20 9:59:11

蓝易云 - ubuntu22安装和部署Kettle8.2

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
蓝易云 - ubuntu22安装和部署Kettle8.2

蓝易云:Ubuntu 22.04 安装与部署 Kettle 8.2(PDI 8.2)全流程

Kettle(Pentaho Data Integration / PDI)8.2 常见交付形态包含:图形界面 Spoon、命令行执行器 Kitchen/Pan、轻量 HTTP 服务 Carte。PDI 相关构建/运行链路通常以 Java 8 作为基线要求(JDK 1.8)。(SourceForge)


部署方式对比表(先选路,再动手)✅

方式适用场景启动入口优点风险点
Spoon(GUI)有桌面/远程桌面开发调试spoon.sh开发效率高需 X/图形依赖
Kitchen/Pan(CLI)服务器跑作业/定时调度kitchen.sh/pan.sh最稳、最轻需要规范日志与参数
Carte(服务化)远程触发、分布式/集群carte.sh易做平台化需鉴权、端口治理 (pentaho-public.atlassian.net)

1)基础环境准备:安装 Java 8 + 常用依赖 🔧

sudo apt update sudo apt install -y unzip fontconfig sudo apt install -y openjdk-8-jdk java -version

解释(逐行):

  • apt update:刷新软件索引,避免“装不到包/版本不对”。

  • unzip:解压 PDI 压缩包必备。

  • fontconfig:GUI/字体渲染常用依赖,服务器也建议装,减少 SWT/字体类异常概率。

  • openjdk-8-jdk:安装 JDK 8(Ubuntu 22.04 的 openjdk-8 在发行包体系中可用)。(Launchpad)

  • java -version:确认“当前生效的 Java”确实是 1.8,而不是 11/17。

如果你的环境因仓库策略无法直接装到 JDK 8,务实方案是改用企业可控的 JDK 8 发行版(例如 Temurin 8)并显式指定PENTAHO_JAVA_HOME,避免“装了多个 Java 但实际跑错版本”。


2)获取并解压 PDI 8.2 安装包 📦

PDI 8.2 社区版常见包名为:pdi-ce-8.2.0.0-342.zip。(SourceForge)

sudo mkdir -p /opt/pdi sudo unzip pdi-ce-8.2.0.0-342.zip -d /opt/pdi ls -l /opt/pdi

解释:

  • /opt/pdi:建议作为标准化安装目录,便于权限、备份、运维脚本统一。

  • unzip ... -d:解压到目标目录,解压后通常会得到data-integration/目录(后续命令都在里面执行)。


3)设置运行环境变量(让“版本与路径”可控)🧩

sudo tee /etc/profile.d/kettle.sh >/dev/null <<'EOF' export PENTAHO_JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64 export KETTLE_HOME=/opt/pdi/data-integration export PATH=$KETTLE_HOME:$PATH EOF source /etc/profile.d/kettle.sh

解释:

  • PENTAHO_JAVA_HOME:强制 PDI 使用指定的 Java 8,避免系统默认 Java 被升级后“无声故障”。

  • KETTLE_HOME:统一指向data-integration目录,后续脚本更简洁。

  • profile.d:全局生效,适合服务器多用户运维。


4)三种“上线姿势”:CLI 执行 / Carte 服务化 / GUI 启动 🚀

A. 服务器跑作业(推荐:Kitchen)🙂

cd /opt/pdi/data-integration ./kitchen.sh -file=/data/etl/demo.kjb -level=Basic -log=/var/log/kettle/demo.log

解释:

  • kitchen.sh:执行作业(.kjb)。

  • -file=:指定作业文件绝对路径,避免相对路径导致的“找不到资源”。

  • -level=Basic:日志级别,建议从 Basic 起步,排障再提高。

  • -log=:把日志落盘,便于告警与追溯(生产必配)。

B. 服务器跑转换(Pan)

cd /opt/pdi/data-integration ./pan.sh -file=/data/etl/demo.ktr -level=Basic -log=/var/log/kettle/demo-pan.log

解释:

  • pan.sh:执行转换(.ktr),其余参数语义与 Kitchen 一致。

C. Carte 服务化(用于远程触发/集群)🌐

Carte 支持命令行启动,也支持 XML 配置启动:sh carte.sh localhost 8080sh carte.sh configuration.xml。(pentaho-public.atlassian.net)

示例:创建配置文件

sudo tee /opt/pdi/carte-config.xml >/dev/null <<'EOF' <slave_config> <slaveserver> <name>carte-1</name> <hostname>0.0.0.0</hostname> <port>8080</port> <master>Y</master> </slaveserver> </slave_config> EOF

解释:

  • hostname=0.0.0.0:监听所有网卡,适合服务器对外提供服务(同时要做防火墙与鉴权)。

  • port=8080:服务端口;与业务端口冲突就换,原则是“端口治理可审计”。

启动:

cd /opt/pdi/data-integration ./carte.sh /opt/pdi/carte-config.xml

解释:

  • 通过配置文件启动,便于把配置纳入版本管理与运维基线。


5)把 Carte 做成 systemd 服务(生产交付建议)🛠️

sudo tee /etc/systemd/system/kettle-carte.service >/dev/null <<'EOF' [Unit] Description=Kettle Carte Service After=network.target [Service] Type=simple User=root WorkingDirectory=/opt/pdi/data-integration Environment=PENTAHO_JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64 ExecStart=/opt/pdi/data-integration/carte.sh /opt/pdi/carte-config.xml Restart=on-failure RestartSec=3 [Install] WantedBy=multi-user.target EOF sudo systemctl daemon-reload sudo systemctl enable --now kettle-carte sudo systemctl status kettle-carte --no-pager

解释:

  • After=network.target:确保网络就绪再起服务。

  • Environment=...:把 Java 版本锁死在服务级,避免 profile 失效导致漂移。

  • Restart=on-failure:失败自动拉起,提升可用性。

  • enable --now:开机自启并立即启动;status用于确认健康状态。


部署工作流图(vditor Mermaid)📌

flowchart TD A[安装 JDK 8 与依赖] --> B[解压 PDI 8.2 到 /opt/pdi] B --> C[设置 PENTAHO_JAVA_HOME / KETTLE_HOME] C --> D{交付形态} D -->|开发调试| E[Spoon GUI] D -->|定时/批处理| F[Kitchen/Pan CLI] D -->|平台化/远程触发| G[Carte + systemd]

一句落地建议(少走弯路)

如果你是生产服务器,我的建议很明确:优先用 Kitchen/Pan 做“可控批处理”,需要平台化再上 Carte;GUI 只留给开发机或带桌面的跳板机。这样你的交付成本最低、稳定性最高,也最容易做标准化。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/4/18 14:42:12

veScale:终极PyTorch分布式训练框架完整指南

veScale&#xff1a;终极PyTorch分布式训练框架完整指南 【免费下载链接】veScale A PyTorch Native LLM Training Framework 项目地址: https://gitcode.com/gh_mirrors/ve/veScale veScale是一个基于PyTorch原生的大规模语言模型训练框架&#xff0c;专为简化分布式训…

作者头像 李华
网站建设 2026/4/16 19:18:55

数字三角形问题

🌏个人博客:尹蓝锐的博客 希望文章能够给到初学的你一些启发~ 如果觉得文章对你有帮助的话,点赞 + 关注+ 收藏支持一下笔者吧~ 1、题目要求: 数字三角形问题 2、输入: 5 7 3 8 8 1 0 2 7 4 4 4 5 2 6 5 3、程序: #define _CRT_SECURE_NO_WARNINGS 1 #include <…

作者头像 李华
网站建设 2026/4/18 15:26:58

Powershell管理远程计算机(四)

信任主机配置Set-Item wsman:\localhost\client\trustedhosts "远程计算机IP或名称"完成后&#xff0c;通常需要重启 WinRM 服务以使更改生效Restart-Service WinRM在建立正式连接前&#xff0c;可以先测试远程计算机是否已准备好接受 PowerShell 远程连接Test-WSMan…

作者头像 李华
网站建设 2026/4/17 23:27:13

Kickstart文件密码设置指南:自动化安装的核心实践

引言 作为Linux OS镜像定制开发的DevOps专家和Anaconda维护者&#xff0c;我深刻理解Kickstart文件在自动化安装中的关键作用。本文将结合Red Hat官方文档及实际案例&#xff0c;系统阐述如何在Kickstart文件中安全配置用户名和密码&#xff0c;解决密文密码安装失败等常见问题…

作者头像 李华
网站建设 2026/4/17 17:42:57

EmotiVoice开源模型测评:语音自然度与情感表现力全面领先

EmotiVoice开源模型测评&#xff1a;语音自然度与情感表现力全面领先 在虚拟主播直播时突然“情绪上头”&#xff0c;用带着颤抖的嗓音说出一句充满委屈的台词&#xff1b;或是智能客服在检测到用户多次重复提问后&#xff0c;自动切换成温和安抚的语气——这些曾属于科幻场景的…

作者头像 李华
网站建设 2026/4/18 9:37:07

EmotiVoice语音合成节奏控制参数详解

EmotiVoice语音合成节奏控制参数详解 在虚拟助手越来越“会说话”、游戏NPC开始“动感情”的今天&#xff0c;用户早已不满足于一段字正腔圆但毫无波澜的朗读。他们想要的是有呼吸感、有情绪起伏、像真人一样带着节奏与语气表达的语音——而这正是现代TTS系统面临的最大挑战。 …

作者头像 李华