Apache Amoro (incubating) 使用教程
2026-01-16 10:02:13作者:廉彬冶Miranda
项目介绍
Apache Amoro (incubating) 是一个基于开放数据湖格式的 Lakehouse 管理系统。它与包括 Flink、Spark 和 Trino 在内的计算引擎协同工作,为 Lakehouse 提供可插拔和自管理的特性,从而提供开箱即用的数据仓库体验。Amoro 帮助数据平台或产品轻松构建基础设施解耦、流批融合和湖原生架构。
项目快速启动
环境准备
- JDK 8 或 JDK 17(仅针对 amoro-mixed-format/amoro-mixed-format-trino 模块)
- Maven
构建项目
# 克隆项目
git clone https://github.com/apache/amoro.git
cd amoro
# 构建所有模块,不包括 amoro-mixed-format-trino
mvn clean package
# 构建并跳过测试
mvn clean package -DskipTests
# 构建并跳过 dashboard
mvn clean package -Pskip-dashboard-build
启动服务
# 启动 Amoro Management Service
cd amoro-ams-server
mvn exec:java
应用案例和最佳实践
案例一:流批融合架构
Amoro 支持流批融合架构,通过使用 Mixed-Iceberg 格式,用户可以在流处理和批处理之间无缝切换,提高数据处理的灵活性和效率。
案例二:数据湖升级
许多用户希望在使用数据湖的同时不影响原有基于 Hive 的业务。Amoro 提供的 Mixed-Hive 格式可以通过元数据迁移将 Hive 表升级为 Mixed-Hive 格式,同时保持原有 Hive 表的正常使用。
典型生态项目
Apache Flink
Amoro 与 Apache Flink 紧密集成,提供 Flink 连接器,支持在 Flink 中使用 Mixed 格式表。
Apache Spark
Amoro 提供 Spark 连接器,支持在 Spark 中使用 Mixed 格式表,实现高效的批处理和流处理。
Apache Trino
Amoro 支持 Trino 连接器,允许用户在 Trino 中查询和管理 Mixed 格式表,提供高性能的查询体验。
通过以上教程,您可以快速了解和使用 Apache Amoro (incubating),构建高效、灵活的数据湖和 Lakehouse 架构。
登录后查看全文
热门项目推荐
相关项目推荐
GLM-5智谱 AI 正式发布 GLM-5,旨在应对复杂系统工程和长时域智能体任务。Jinja00
GLM-5-w4a8GLM-5-w4a8基于混合专家架构,专为复杂系统工程与长周期智能体任务设计。支持单/多节点部署,适配Atlas 800T A3,采用w4a8量化技术,结合vLLM推理优化,高效平衡性能与精度,助力智能应用开发Jinja00
jiuwenclawJiuwenClaw 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。Python0203- QQwen3.5-397B-A17BQwen3.5 实现了重大飞跃,整合了多模态学习、架构效率、强化学习规模以及全球可访问性等方面的突破性进展,旨在为开发者和企业赋予前所未有的能力与效率。Jinja00
AtomGit城市坐标计划AtomGit 城市坐标计划开启!让开源有坐标,让城市有星火。致力于与城市合伙人共同构建并长期运营一个健康、活跃的本地开发者生态。01
awesome-zig一个关于 Zig 优秀库及资源的协作列表。Makefile00
项目优选
收起
deepin linux kernel
C
27
12
OpenHarmony documentation | OpenHarmony开发者文档
Dockerfile
607
4.05 K
🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer(第 2 版)》、《程序员面试金典(第 6 版)》题解
Java
69
21
暂无简介
Dart
849
205
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.47 K
829
Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台,包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分,采用java语言实现,可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用
Java
12
1
喝着茶写代码!最易用的自托管一站式代码托管平台,包含Git托管,代码审查,团队协作,软件包和CI/CD。
Go
24
0
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
924
772
🎉 基于Spring Boot、Spring Cloud & Alibaba、Vue3 & Vite、Element Plus的分布式前后端分离微服务架构权限管理系统
Vue
235
152
昇腾LLM分布式训练框架
Python
131
157