ByConity磁盘缓存导致Inode耗尽问题的分析与解决
2025-07-03 14:19:18作者:董斯意
问题现象
在使用ByConity 0.4.2-testonly-3版本进行ClickHouse数据迁移时,系统报错"DB::ErrnoException: Cannot open file /var/byconity/disks/DISK_INFOS.tmp, errno: 28, strerror: No space left on device"。经检查发现,这是由于宿主机文件系统的Inode使用率已达95%,导致系统无法继续创建新文件。
问题分析
ByConity的磁盘缓存机制会在以下两个目录产生大量文件:
/var/byconity/data/auxility_store- 该目录下的文件会被自动清理/var/byconity/data/part_disk_cache/meta- 该目录会积累大量缓存元数据文件
虽然auxility_store目录有自动清理机制,但part_disk_cache/meta目录的文件会持续增长,最终导致Inode资源耗尽。
解决方案
临时解决方案
- 清理现有缓存文件:手动删除/var/byconity/data/part_disk_cache/meta目录下的部分文件,释放Inode资源
- 监控Inode使用率:建立Inode使用率监控机制,提前预警
长期解决方案
- 调整磁盘缓存策略:在values.yaml配置文件中修改worker的disk_cache_strategies配置:
configOverwrite:
disk_cache_strategies:
simple:
lru_max_size: 12949672960 # 设置缓存最大大小
lru_max_object_num: 12600000 # 限制缓存对象数量
- 定期维护机制:建立定期清理陈旧缓存文件的自动化机制
- 文件系统优化:考虑使用支持更大Inode数量的文件系统,或增加Inode数量
实施建议
- 首先清理现有缓存文件,恢复服务可用性
- 然后应用配置变更,限制缓存对象数量
- 最后建立长期监控和维护机制,防止问题复发
注意事项
修改配置后需要执行upgrade操作使配置生效。同时需要注意,单纯调整lru_max_object_num参数可能无法立即解决已存在的Inode耗尽问题,需要结合文件清理操作。
对于生产环境,建议在非高峰期进行这些操作,并做好回滚准备。
登录后查看全文
热门项目推荐
相关项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0220
cann-learning-hubCANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。Jupyter Notebook0140
uni-appA cross-platform framework using Vue.jsJavaScript09
GLM-5.2智谱开源 GLM-5.2,这是针对长文本任务的最新旗舰模型。相较于前代产品 GLM-5.1,它在长文本任务处理能力上实现了显著飞跃,并且首次在稳定的 100 万 token 上下文中提供这一能力。Jinja00
SwanLab⚡️SwanLab - an open-source, modern-design AI training tracking and visualization tool. Supports Cloud / Self-hosted use. Integrated with PyTorch / Transformers / LLaMA Factory / veRL/ Swift / Ultralytics / MMEngine / Keras etc.Python00
tiny-universe《大模型白盒子构建指南》:一个全手搓的Tiny-UniverseJupyter Notebook03
项目优选
收起
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
471
466
deepin linux kernel
C
32
16
暂无描述
Dockerfile
780
5.08 K
Ascend Extension for PyTorch
Python
759
969
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
700
1.4 K
Claude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed.
Get Started
Rust
2.1 K
220
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
880
2.02 K
本仓库是 Flutter SDK 与 Flutter Engine 的 OpenHarmony 适配版本,由 CPF-Flutter 团队维护。开发者可使用熟悉的 Flutter 技术栈开发 OpenHarmony 应用,3.35.7 及以后的适配版本可基于本仓库源码构建支持 OpenHarmony 的 Flutter Engine。
Dart
1.04 K
272
本仓将收集和展示高质量的仓颉示例代码,欢迎大家投稿,让全世界看到您的妙趣设计,也让更多人通过您的编码理解和喜爱仓颉语言。
C
461
5.45 K
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.1 K
1.15 K