首页
/ Ditto 项目教程

Ditto 项目教程

2024-09-26 04:24:37作者:吴年前Myrtle

1. 项目介绍

Ditto 是一个基于预训练语言模型的实体匹配(Entity Matching, EM)解决方案。它利用预训练语言模型(如 BERT)的强大语言理解能力,通过微调来实现实体匹配任务。Ditto 将每个数据条目序列化为文本序列,并将实体匹配问题转化为序列对分类问题。此外,Ditto 还采用了多种优化技术,如摘要生成、领域知识注入和数据增强,以进一步提升匹配模型的性能。

2. 项目快速启动

2.1 环境准备

确保你的环境中安装了以下依赖:

  • Python 3.7.7
  • PyTorch 1.9
  • HuggingFace Transformers 4.9.2
  • Spacy 及其 en_core_web_lg 模型
  • NVIDIA Apex(用于 fp16 训练)

安装依赖:

conda install -c conda-forge nvidia-apex
pip install -r requirements.txt
python -m spacy download en_core_web_lg

2.2 数据准备

Ditto 的输入数据格式为序列化的数据条目对,每个条目包含多个属性和值。例如:

COL title VAL microsoft visio standard 2007 version upgrade COL manufacturer VAL microsoft COL price VAL 129.95

完整的输入对格式为:

<entry_1> \t <entry_2> \t <label>

其中 <label> 为 0(不匹配)或 1(匹配)。

2.3 训练模型

使用以下命令训练匹配模型:

CUDA_VISIBLE_DEVICES=0 python train_ditto.py \
  --task Structured/Beer \
  --batch_size 64 \
  --max_len 64 \
  --lr 3e-5 \
  --n_epochs 40 \
  --lm distilbert \
  --fp16 \
  --da del \
  --dk product \
  --summarize

2.4 运行匹配模型

使用以下命令运行匹配模型:

CUDA_VISIBLE_DEVICES=0 python matcher.py \
  --task wdc_all_small \
  --input_path input/input_small.jsonl \
  --output_path output/output_small.jsonl \
  --lm distilbert \
  --max_len 64 \
  --use_gpu \
  --fp16 \
  --checkpoint_path checkpoints/

3. 应用案例和最佳实践

3.1 电商产品匹配

Ditto 在电商产品匹配中表现出色,特别是在处理不同来源的产品数据时。通过序列化产品信息并利用预训练语言模型进行匹配,Ditto 能够高效地识别出相同或相似的产品。

3.2 学术出版物匹配

在学术领域,Ditto 可以用于匹配不同数据库中的学术出版物。通过提取出版物的关键信息并进行序列化,Ditto 能够准确地匹配出相同的出版物,从而帮助研究人员整合和分析数据。

4. 典型生态项目

4.1 DeepMatcher

DeepMatcher 是一个用于实体匹配的深度学习框架,与 Ditto 类似,它也利用了预训练语言模型来提升匹配性能。两者可以结合使用,进一步提升实体匹配的效果。

4.2 Transformers

HuggingFace 的 Transformers 库是 Ditto 的核心依赖之一。通过使用 Transformers 库中的预训练模型,Ditto 能够快速适应不同的实体匹配任务。

4.3 Spacy

Spacy 是一个强大的自然语言处理库,Ditto 利用 Spacy 进行文本序列化和预处理,从而提升模型的匹配精度。

通过以上模块的介绍和实践,你可以快速上手并应用 Ditto 项目,解决实际的实体匹配问题。

登录后查看全文
热门项目推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
22
6
docsdocs
OpenHarmony documentation | OpenHarmony开发者文档
Dockerfile
165
2.05 K
nop-entropynop-entropy
Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台,包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分,采用java语言实现,可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用
Java
8
0
openHiTLS-examplesopenHiTLS-examples
本仓将为广大高校开发者提供开源实践和创新开发平台,收集和展示openHiTLS示例代码及创新应用,欢迎大家投稿,让全世界看到您的精巧密码实现设计,也让更多人通过您的优秀成果,理解、喜爱上密码技术。
C
85
563
leetcodeleetcode
🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer(第 2 版)》、《程序员面试金典(第 6 版)》题解
Java
60
17
apintoapinto
基于golang开发的网关。具有各种插件,可以自行扩展,即插即用。此外,它可以快速帮助企业管理API服务,提高API服务的稳定性和安全性。
Go
22
0
cjoycjoy
一个高性能、可扩展、轻量、省心的仓颉应用开发框架。IoC,Rest,宏路由,Json,中间件,参数绑定与校验,文件上传下载,OAuth2,MCP......
Cangjie
94
15
ohos_react_nativeohos_react_native
React Native鸿蒙化仓库
C++
199
279
giteagitea
喝着茶写代码!最易用的自托管一站式代码托管平台,包含Git托管,代码审查,团队协作,软件包和CI/CD。
Go
17
0
RuoYi-Vue3RuoYi-Vue3
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
954
564