Miller工具中多条件过滤与空格处理的技巧
2025-05-25 16:53:55作者:廉彬冶Miranda
Miller是一个强大的命令行工具,用于处理结构化数据(如CSV、JSON等)。本文将详细介绍如何在Miller中实现多条件数据过滤,以及处理数据中常见的前后空格问题。
多条件过滤的基本语法
在Miller中,我们可以使用filter命令配合逻辑运算符来实现多条件过滤。基本语法结构如下:
mlr --csv filter '条件表达式' input.csv > output.csv
单列多值过滤
如果需要筛选某列等于多个特定值的记录,可以使用逻辑或(||)运算符:
mlr --csv filter '$COLUMN1 == "TEST1" || $COLUMN1 == "TEST2"' input.csv
多列多条件组合
当需要组合多个列的条件时,可以使用逻辑与(&&)和逻辑或(||)运算符。但需要注意运算符优先级问题:
# 方式1:先或后与
mlr --csv filter '$COLUMN1 == "TEST1" || $COLUMN1 == "TEST2" || ($COLUMN3 == "TEST3" && $COLUMN4 == "TEST4")' input.csv
# 方式2:先与后或
mlr --csv filter '($COLUMN1 == "TEST1" || $COLUMN1 == "TEST2" || $COLUMN3 == "TEST3") && $COLUMN4 == "TEST4"' input.csv
这两种写法的过滤逻辑完全不同,第一种会返回:
- COLUMN1等于TEST1的记录,或
- COLUMN1等于TEST2的记录,或
- COLUMN3等于TEST3且COLUMN4等于TEST4的记录
而第二种会返回:
- COLUMN1等于TEST1或COLUMN2等于TEST2或COLUMN3等于TEST3的记录,且
- 这些记录必须同时满足COLUMN4等于TEST4
处理数据中的空格问题
在实际数据处理中,经常会遇到字段值前后有空格的情况,这会导致精确匹配失败。例如:
COLUMN1,COLUMN2
TEST1 ,NOT
TEST2,NOT
解决方案1:使用clean-whitespace命令
Miller提供了专门的命令来清理字段值中的前后空格:
mlr --csv clean-whitespace input.csv > cleaned.csv
处理后的数据就可以正常进行精确匹配过滤了。
解决方案2:使用模式匹配
如果不想预处理数据,也可以在过滤条件中使用模式匹配:
mlr --csv filter '$COLUMN1 =~ "TEST1.*"' input.csv
这会匹配所有以"TEST1"开头的值,包括后面有空格的情况。
特殊字符处理
当字段值中包含点号(.)等特殊字符时,在模式匹配中需要进行转义:
mlr --csv filter '$COLUMN1 =~ "TEST\.1.*"' input.csv
最佳实践建议
- 优先使用clean-whitespace预处理数据,确保数据干净
- 复杂的多条件组合时,使用括号明确优先级
- 对于可能包含特殊字符的字段值,考虑使用模式匹配而非精确匹配
- 在处理前先用少量样本数据测试过滤条件,确保逻辑正确
通过合理运用这些技巧,可以高效地使用Miller处理各种复杂的数据过滤需求。
登录后查看全文
热门项目推荐
相关项目推荐
GLM-5智谱 AI 正式发布 GLM-5,旨在应对复杂系统工程和长时域智能体任务。Jinja00
GLM-5-w4a8GLM-5-w4a8基于混合专家架构,专为复杂系统工程与长周期智能体任务设计。支持单/多节点部署,适配Atlas 800T A3,采用w4a8量化技术,结合vLLM推理优化,高效平衡性能与精度,助力智能应用开发Jinja00
jiuwenclawJiuwenClaw 是一款基于openJiuwen开发的智能AI Agent,它能够将大语言模型的强大能力,通过你日常使用的各类通讯应用,直接延伸至你的指尖。Python0204- QQwen3.5-397B-A17BQwen3.5 实现了重大飞跃,整合了多模态学习、架构效率、强化学习规模以及全球可访问性等方面的突破性进展,旨在为开发者和企业赋予前所未有的能力与效率。Jinja00
AtomGit城市坐标计划AtomGit 城市坐标计划开启!让开源有坐标,让城市有星火。致力于与城市合伙人共同构建并长期运营一个健康、活跃的本地开发者生态。01
awesome-zig一个关于 Zig 优秀库及资源的协作列表。Makefile00
项目优选
收起
deepin linux kernel
C
27
12
OpenHarmony documentation | OpenHarmony开发者文档
Dockerfile
609
4.05 K
Ascend Extension for PyTorch
Python
447
534
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
924
774
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.47 K
829
暂无简介
Dart
853
205
React Native鸿蒙化仓库
JavaScript
322
377
🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer(第 2 版)》、《程序员面试金典(第 6 版)》题解
Java
69
21
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
373
251
昇腾LLM分布式训练框架
Python
131
158