基本概念
序列标注任务就是给一个序列,对序列中的每个位置预测一个标签
例如针对实体识别任务,需要抽取出一个句子中包含有哪些实体,实体通常指定义的一个特殊关键词,例如地点、人名、机构名称等,针对NER任务有多种标注方式,这里采用BIO进行标注进行说明,其中“B”表示实体开始,“I”表示实体内部,“O”表示其他不是实体的部分。
输入内容是“欢迎刘德华来深圳黑马学习AI大模型”,采用BIO进行标注,结果如下:
| 欢 | 迎 | 刘 | 德 | 华 | 来 | 深 | 圳 | 黑 | 马 | 学 | 习 | AI | 大 | 模 | 型 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| O | O | B-PER | I-PER | I-PER | O | B-LOC | I-LOC | B-ORG | I-ORG | O | O | O | O | O | O |
序列标注问题可以看成是基于token的分类任务。
例如分词任务
输入为:“南京市长江大桥”
输出为:“南京市/长江/大桥”,也可能分为“南京/市长/江大桥”
本质上就是确定当前token是否需要分割
| 南 | 京 | 市 | 长 | 江 | 大 | 桥 |
|---|---|---|---|---|---|---|
| 0 | 0 | 1 | 0 | 1 | 0 | 1 |