LiquidCache 使用教程
2025-04-20 21:01:24作者:秋阔奎Evelyn
1. 项目介绍
LiquidCache 是一个为 DataFusion 系统设计的 S3 缓存解决方案。它通过一个优化器规则,能够将成本和延迟降低高达 10 倍。LiquidCache 不是透明的缓存(可以考虑使用 Foyer),它利用查询语义来优化缓存。LiquidCache 将 S3 数据(如 JSON、CSV、Parquet)转码为内部格式,这种格式更加压缩,更适合 NVMe 存储,且对 DataFusion 操作更高效。
2. 项目快速启动
以下是快速启动 LiquidCache 的步骤:
首先,确保你已经安装了 Rust 编译环境和 Cargo 包管理工具。
启动 Cache Server
#[tokio::main]
async fn main() -> Result<(), Box<dyn std::error::Error>> {
let liquid_cache = LiquidCacheService::new(
SessionContext::new(),
Some(1024 * 1024 * 1024), // 最大内存缓存大小 1GB
Some(tempfile::tempdir()?),
// 磁盘缓存目录
);
let flight = FlightServiceServer::new(liquid_cache);
Server::builder()
.add_service(flight)
.serve("0.0.0.0:50051".parse()?)
.await?
;
Ok(())
}
或者,你可以使用预构建的 Docker 镜像:
docker run -p 50051:50051 -v ~/liquid_cache:/cache \
ghcr.io/xiangpenghao/liquid-cache/liquid-cache-server:latest \
/app/bench_server --address 0.0.0.0:50051 --disk-cache-dir /cache
连接到缓存服务器
在你的 DataFusion 项目中添加以下依赖:
[dependencies]
liquid-cache-client = "0.1.0"
然后,创建一个新的 DataFusion 上下文,并连接到 LiquidCache:
#[tokio::main]
pub async fn main() -> Result<(), Box<dyn std::error::Error>> {
/*==========================LiquidCache============================*/
let ctx = LiquidCacheBuilder::new(cache_server)
.with_object_store(ObjectStoreUrl::parse(object_store_url.as_str())?, None)
.with_cache_mode(CacheMode::Liquid)
.build(SessionConfig::from_env()?);
/*=================================================================*/
let ctx: Arc<SessionContext> = Arc::new(ctx);
ctx.register_table(table_name, ..).await?;
ctx.sql(&sql).await?.show().await?;
Ok(())
}
3. 应用案例和最佳实践
社区服务器
LiquidCache 在 Xiangpeng 的 NAS 上运行了一个社区服务器,地址为 https://hex.tail0766e4.ts.net:50051(使用风险自负)。你可以通过运行以下命令来尝试它:
cargo run --bin example_client --release -- \
--cache-server https://hex.tail0766e4.ts.net:50051 \
--file "https://huggingface.co/datasets/HuggingFaceFW/fineweb/resolve/main/data/CC-MAIN-2024-51/000_00042.parquet" \
--query "SELECT COUNT(*) FROM \"000_00042\" WHERE \"token_count\" < 100"
运行 ClickBench
-
设置仓库
git clone https://github.com/XiangpengHao/liquid-cache.git cd liquid-cache -
运行 LiquidCache 服务器
cargo run --bin bench_server --release -
在另一个终端运行 ClickBench 客户端
cargo run --bin clickbench_client --release -- --query-path benchmark/clickbench/queries.sql --file examples/nano_hits.parquet注意:替换
nano_hits.parquet为实际的 ClickBench 数据集以进行完整的基准测试。
4. 典型生态项目
目前,LiquidCache 主要与 DataFusion 配合使用,但也可以与其他数据分析和查询引擎集成。它的开源性质鼓励社区贡献和扩展,以支持更多的项目和用例。
登录后查看全文
热门项目推荐
GLM-5智谱 AI 正式发布 GLM-5,旨在应对复杂系统工程和长时域智能体任务。Jinja00
GLM-5.1GLM-5.1是智谱迄今最智能的旗舰模型,也是目前全球最强的开源模型。GLM-5.1大大提高了代码能力,在完成长程任务方面提升尤为显著。和此前分钟级交互的模型不同,它能够在一次任务中独立、持续工作超过8小时,期间自主规划、执行、自我进化,最终交付完整的工程级成果。Jinja00
LongCat-AudioDiT-1BLongCat-AudioDiT 是一款基于扩散模型的文本转语音(TTS)模型,代表了当前该领域的最高水平(SOTA),它直接在波形潜空间中进行操作。00- QQwen3.5-397B-A17BQwen3.5 实现了重大飞跃,整合了多模态学习、架构效率、强化学习规模以及全球可访问性等方面的突破性进展,旨在为开发者和企业赋予前所未有的能力与效率。Jinja00
HY-Embodied-0.5这是一套专为现实世界具身智能打造的基础模型。该系列模型采用创新的混合Transformer(Mixture-of-Transformers, MoT) 架构,通过潜在令牌实现模态特异性计算,显著提升了细粒度感知能力。Jinja00
FreeSql功能强大的对象关系映射(O/RM)组件,支持 .NET Core 2.1+、.NET Framework 4.0+、Xamarin 以及 AOT。C#00
热门内容推荐
项目优选
收起
deepin linux kernel
C
27
14
OpenHarmony documentation | OpenHarmony开发者文档
Dockerfile
659
4.26 K
Ascend Extension for PyTorch
Python
503
608
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
939
862
Oohos_react_native
React Native鸿蒙化仓库
JavaScript
334
378
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
390
285
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
123
195
openGauss kernel ~ openGauss is an open source relational database management system
C++
180
258
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.54 K
892
昇腾LLM分布式训练框架
Python
142
168