Spacy:尝试设置冲突的文档:一个令牌只能是一个实体的一部分,因此请确保您正在设置的实体不会重叠
问题描述
我正在尝试使用Spacy从文本中提取所需的自定义实体。
import spacy
from spacy_lookup import Entity
data = {0:["count"],1:["unique count","unique"]}
def processText(text):
nlp = spacy.blank('en')
for i,arr in data.items():
fLabel = "test:"+str(i)
fEntitty = Entity(keywords_list=list(set(arr)),label=fLabel)
fEntitty.name = fLabel
nlp.add_pipe(fEntitty)
match_doc = nlp(text)
print(match_doc.ents)
processText("unique count of city")
但上述代码抛出的错误与
类似ValueError: [E103] Trying to set conflicting doc.ents: '(1, 2, 'test:0')' and '(0, 2, 'test:1')'. A token can only be part of one entity, so make sure the entities you're setting don't overlap.
不仅是这种情况,人名也有同样的问题,比如Karthik vs Karthik Reddy,Jon vs Jon Allen
有谁能帮我解决这个问题吗?
提前谢谢!!
解决方案
在空格中,命名实体永远不能重叠。如果&Jon Allen&是一个名字,你就不应该把&John&也注释为一个名字。因此,在培训之前,您必须解决这些重叠/冲突的案例。
在评论中讨论后编辑:
您需要实现on_match
函数以筛选出非重叠集合的匹配项。
相关文章