Apache Zeppelin 怎么跑起来:一个支持 Spark/Flink/Hive 的协作 Notebook
Apache Zeppelin 是一个基于 Web 的交互式数据分析 Notebook,覆盖数据接入、数据分析、数据可视化和协作文档,交互形态类似 Jupyter Notebook。
支持的语言和数据源
Zeppelin 支持使用 SQL、Java、Scala、Python、R 等语言处理数据,并集成/支持以下后端:
- Apache Spark(内置)
- Apache Flink
- Apache Kylin
- BigQuery
- Cassandra
- Elasticsearch
- HBase
- Apache Hive
- MongoDB
- Neo4j
- Groovy
- Markdown
- Shell
也支持常用数据图表和动态表单,多个用户可以协作并分享 Notebook。
安装前提
Zeppelin 基于 Java 开发,官方支持并完成测试的平台环境如下:
- OpenJDK 1.8 (151+) 或 Oracle JDK 1.8 (151+)
- Ubuntu 18.04、Ubuntu 20.04、macOS
在 Apache Zeppelin 官方下载页面选择安装包。安装包分两种:
- 包含所有语言解释器的安装包
- 默认只包含 Spark、Python、Markdown、Shell 解释器的安装包
选择其中一个 zip 文件,下载后解压即完成安装。
启动与访问
Unix/Linux 下启动:
bin/zeppelin-daemon.sh start
Windows 下启动:
bin\zeppelin.cmd
启动后在浏览器访问 http://localhost:8080 打开首页。
安装目录下的 notebook 子目录中提供了几个示例 Notebook,可以作为入门参考。
此外,Zeppelin 还支持源码安装和 Docker 镜像安装。