Datatrove项目中使用Minhash进行文本去重的最佳实践
2025-07-02 00:54:05作者:滕妙奇
概述
在自然语言处理和大规模文本数据处理中,数据去重是一个至关重要的预处理步骤。Datatrove作为一个强大的数据处理工具库,提供了基于Minhash算法的文本去重功能。本文将详细介绍如何在Datatrove项目中正确配置和使用Minhash去重流程,特别是针对本地执行环境中的常见问题解决方案。
Minhash去重原理简介
Minhash是一种高效的近似文本相似度计算方法,特别适合大规模数据集。它通过将文本内容转化为固定长度的签名(signature),然后比较这些签名来估计文本之间的相似度。Datatrove实现了完整的Minhash去重流程,包括四个主要阶段:
- 签名计算阶段:为每个文本生成Minhash签名
- 桶处理阶段:将相似签名分组到桶中
- 聚类阶段:识别重复文本簇
- 过滤阶段:移除重复文本
本地执行环境配置
在本地环境中使用Datatrove进行Minhash去重时,需要注意Python多进程编程的特殊要求。特别是当使用LocalPipelineExecutor时,必须确保主模块的正确结构:
if __name__ == "__main__":
# 你的管道配置和执行代码
这种结构是必要的,因为Python的多进程模块需要在主程序中正确初始化。缺少这个保护会导致常见的"RuntimeError: An attempt has been made to start a new process..."错误。
完整配置示例
以下是一个完整的本地执行配置示例,包含了所有必要的参数和阶段配置:
from datatrove.executor import LocalPipelineExecutor
from datatrove.pipeline.dedup import MinhashDedupSignature
from datatrove.pipeline.readers import HuggingFaceDatasetReader
from datatrove.pipeline.dedup.minhash import (
MinhashConfig,
MinhashDedupBuckets,
MinhashDedupCluster,
MinhashDedupFilter,
)
from datatrove.pipeline.writers.jsonl import JsonlWriter
from datatrove.utils.hashing import HashConfig
from datatrove.utils.typeshelper import Languages
# Minhash算法配置
minhash_config = MinhashConfig(
hash_config=HashConfig(precision=64), # 哈希精度
num_buckets=14, # 桶数量
hashes_per_bucket=8, # 每个桶的哈希数量
)
# 本地路径配置
LOCAL_PATH = "数据存储路径"
LOCAL_LOGS_PATH = f"{LOCAL_PATH}/logs"
TOTAL_TASKS = 100 # 总任务数
if __name__ == "__main__":
# 第一阶段:计算签名
stage1 = LocalPipelineExecutor(
pipeline=[
HuggingFaceDatasetReader("数据集名称", {"split": "train"}, text_key="text"),
MinhashDedupSignature(
output_folder=f"{LOCAL_PATH}/signatures",
config=minhash_config,
language=Languages.english
),
],
tasks=TOTAL_TASKS,
workers=TOTAL_TASKS,
logging_dir=f"{LOCAL_LOGS_PATH}/signatures",
)
# 后续阶段配置...
# 执行管道
stage1.run()
关键配置参数解析
-
MinhashConfig:
hash_config.precision: 控制哈希精度,值越高碰撞概率越低num_buckets: 影响去重精度和性能的平衡hashes_per_bucket: 每个桶使用的哈希函数数量
-
执行器配置:
tasks: 控制并行处理的任务数量workers: 实际工作进程数logging_dir: 日志存储路径
性能优化建议
- 根据硬件资源合理设置
tasks和workers参数 - 对于大型数据集,适当增加
num_buckets可以提高去重精度 - 监控内存使用情况,必要时调整
hashes_per_bucket参数 - 使用高性能存储介质存放中间结果,特别是签名和桶数据
常见问题解决
-
多进程初始化错误:
- 确保主程序有
if __name__ == "__main__":保护 - 检查Python版本和依赖库兼容性
- 确保主程序有
-
内存不足:
- 减少
workers数量 - 降低
hashes_per_bucket值
- 减少
-
性能瓶颈:
- 考虑使用分布式执行器替代本地执行器
- 优化数据读取和存储路径的I/O性能
通过正确配置和使用Datatrove的Minhash去重功能,可以高效地处理大规模文本数据集,为后续的NLP任务提供更干净、更高质量的数据输入。
登录后查看全文
热门项目推荐
Kimi-K2.5Kimi K2.5 是一款开源的原生多模态智能体模型,它在 Kimi-K2-Base 的基础上,通过对约 15 万亿混合视觉和文本 tokens 进行持续预训练构建而成。该模型将视觉与语言理解、高级智能体能力、即时模式与思考模式,以及对话式与智能体范式无缝融合。Python00
PaddleOCR-VL-1.5PaddleOCR-VL-1.5 是 PaddleOCR-VL 的新一代进阶模型,在 OmniDocBench v1.5 上实现了 94.5% 的全新 state-of-the-art 准确率。 为了严格评估模型在真实物理畸变下的鲁棒性——包括扫描伪影、倾斜、扭曲、屏幕拍摄和光照变化——我们提出了 Real5-OmniDocBench 基准测试集。实验结果表明,该增强模型在新构建的基准测试集上达到了 SOTA 性能。此外,我们通过整合印章识别和文本检测识别(text spotting)任务扩展了模型的能力,同时保持 0.9B 的超紧凑 VLM 规模,具备高效率特性。Python00
xw-cli实现国产算力大模型零门槛部署,一键跑通 Qwen、GLM-4.7、Minimax-2.1、DeepSeek-OCR 等模型Go06
yuanrongopenYuanrong runtime:openYuanrong 多语言运行时提供函数分布式编程,支持 Python、Java、C++ 语言,实现类单机编程高性能分布式运行。Go051
pc-uishopTNT开源商城系统使用java语言开发,基于SpringBoot架构体系构建的一套b2b2c商城,商城是满足集平台自营和多商户入驻于一体的多商户运营服务系统。包含PC 端、手机端(H5\APP\小程序),系统架构以及实现案例中应满足和未来可能出现的业务系统进行对接。Vue00
项目优选
收起
deepin linux kernel
C
27
11
OpenHarmony documentation | OpenHarmony开发者文档
Dockerfile
540
3.77 K
Ascend Extension for PyTorch
Python
351
417
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
889
614
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
338
185
openJiuwen agent-studio提供零码、低码可视化开发和工作流编排,模型、知识库、插件等各资源管理能力
TSX
988
253
openGauss kernel ~ openGauss is an open source relational database management system
C++
169
233
暂无简介
Dart
778
193
华为昇腾面向大规模分布式训练的多模态大模型套件,支撑多模态生成、多模态理解。
Python
115
141
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.35 K
758