TweebankNLP:一揽子Twitter NLP解决方案
2024-09-26 10:05:14作者:冯爽妲Honey
项目介绍
TweebankNLP 是由MIT中心和媒体实验室共同开发的一个开源项目,旨在提供针对推文处理的现成自然语言处理工具包。该工具包在LREC 2022上发布,支持命名实体识别(NER)、分词(tokenization)、词干化(lemmatization)、词性标注(POS tagging)以及依存句法分析等任务。核心特性包括基于Tweebank V2训练的预训练模型,以及一个名为Twitter-Stanza的管道,这些模型在处理社交媒体文本时表现出色。
项目快速启动
安装
首先,确保你的系统已安装Python环境。接下来,通过pip从源安装TweebankNLP相关依赖:
pip install -e git+https://github.com/mit-ccc/TweebankNLP.git#egg=tweebanknlp
pip install pythainlp
下载必要的预训练模型和资源:
cd tweebanknlp
./download_twitter_resources.sh
使用Twitter-Stanza Pipeline示例
初始化配置,以使用仅基于Tweebank训练的模型:
import stanza
config = {
'processors': 'tokenize lemma pos depparse ner',
'lang': 'en',
'tokenize_pretokenized': True,
'tokenize_model_path': './saved_models/tokenize/en_tweet_tokenizer.pt',
'lemma_model_path': './saved_models/lemma/en_tweet_lemmatizer.pt',
'pos_model_path': './saved_models/pos/en_tweet_tagger.pt',
'depparse_model_path': './saved_models/depparse/en_tweet_parser.pt',
'ner_model_path': './saved_models/ner/en_tweet_nertagger.pt'
}
stanza.download('en')
nlp = stanza.Pipeline(**config)
doc = nlp("Oh, I actually prefer Messi over Ronaldo, but we all seem to like Ronaldo more.")
print(doc)
应用案例和最佳实践
命名实体识别案例:
假设你希望对一条推文进行命名实体识别。你可以使用已经在Tweebank数据集上训练的模型。例如,对于具有特定领域标签的数据,可以参考以下流程:
# 加载预先训练好的NER模型(以Bertweet为例)
model_to_load = "TweebankNLP/bertweet-tb2_wnut17-ner"
from transformers import AutoModelForTokenClassification, AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained(model_to_load)
model = AutoModelForTokenClassification.from_pretrained(model_to_load)
text = "Joining #AI Summit next week!"
inputs = tokenizer(text, return_tensors="pt")
outputs = model(**inputs)
然后解析输出获取实体。
典型生态项目
TweebankNLP的生态不仅仅限于其本身的GitHub仓库。它还在Hugging Face Model Hub上提供了易于使用的模型,使得开发者能够迅速集成到他们的应用程序中。例如,模型如TweebankNLP/bertweet-tb2_ewt-pos-tagging是专为Twitter数据设计的词性标注模型,达到了高精度,并且容易部署。
结合Hugging Face的实践
你可以通过以下方式直接利用Hugging Face中的模型:
from transformers import pipeline
nlp = pipeline("ner", model="TweebankNLP/bertweet-tb2_wnut17-ner", tokenizer="bert-base-multilingual-cased")
result = nlp("Ronaldo loves playing football!")
for res in result:
print(res)
在这个实践中,我们展示了如何结合Hugging Face的pipeline功能来轻松实现推文的命名实体识别。
以上即是对TweebankNLP项目的一个简要介绍及其快速上手指南,希望能够帮助您高效地使用这一强大的社交媒体NLP工具。
登录后查看全文
热门项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0187
cann-learning-hubCANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。Jupyter Notebook0112
Step-3.7-FlashStep-3.7-Flash是一个拥有 1980 亿参数的稀疏混合专家(MoE)视觉语言模型,由 1960 亿参数的语言主干网络和 18 亿参数的视觉编码器组合而成,具备原生图像理解能力。Python00
JoyAI-EchoJoyAI-Echo,这是一个独立的、仅用于推理的版本,旨在实现分钟级多镜头音视频生成。它采用了经过蒸馏的DMD生成器、配对的跨模态记忆以及故事级别的一致性。其性能的核心在于,一个跨模态视听记忆库能够在长达五分钟的视频中保持角色外观和语音音色的一致性。同时,一个训练后处理流程将基于记忆的强化学习与分布匹配蒸馏相结合,实现了7.5倍的速度提升,显著增强了视觉质量和对齐效果。00
omega-aiOmega-AI:基于java打造的深度学习框架,帮助你快速搭建神经网络,实现模型推理与训练,引擎支持自动求导,多线程与GPU运算,GPU支持CUDA,CUDNN。Java03
llm-universe本项目是一个面向小白开发者的大模型应用开发教程,在线阅读地址:https://datawhalechina.github.io/llm-universe/Jupyter Notebook08
项目优选
收起
deepin linux kernel
C
32
16
暂无描述
Dockerfile
759
4.94 K
Claude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed.
Get Started
Rust
1.78 K
187
暂无简介
Dart
1 K
259
Ascend Extension for PyTorch
Python
716
866
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
854
1.91 K
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.07 K
1.09 K
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.72 K
1.02 K
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
674
1.32 K
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
454
436