作者:
原文服务方: 计算机应用研究       
摘要:
基于统计的方法一般采用人工标注的句子级的标注语料进行训练,但是这种方法往往忽略了已有的经过多年积累的人工标注的词典信息.这些信息尤其是在面向跨领域时,由于目标领域句子级别的标注资源稀少,从而显得更加珍贵.因此,如何充分且有效地在基于统计的模型中利用词典信息是一个非常值得关注的工作.最近已有部分工作对它进行了研究,按照词典信息融入方式大致可以分为两类:一类是在基于字的序列标注模型中融入词典特征;另一类是在基于词的柱搜索模型中融入特征.对这两类方法进行比较,并进一步进行结合.实验表明,这两类方法结合之后,词典信息可以得到更充分的利用,最终无论是在同领域测试和还是在跨领域测试上都取得了更优的性能.
推荐文章
基于词典和词频的中文分词方法
中文分词
歧义消除
词频
基于字簇的多模型中文分词方法研究
中文分词
构词规律
模型参数
聚类
中文分词词典机制的研究
中文分词
词典机制
带词长整词二分词典
中文分词词典结构的研究与改进
中文分词
正向最大匹配
词典
三级索引
内容分析
关键词云
关键词热度
相关文献总数  
(/次)
(/年)
文献信息
篇名 中文分词模型词典融入方法比较
来源期刊 计算机应用研究 学科
关键词 中文分词 条件随机场 柱搜索 领域自适应
年,卷(期) 2019,(1) 所属期刊栏目 综述评论
研究方向 页码范围 8-10,17
页数 4页 分类号 TP391
字数 语种 中文
DOI 10.19734/j.issn.1001-3695.2017.05.0643
五维指标
作者信息
序号 姓名 单位 发文数 被引次数 H指数 G指数
1 冯雪 北京信息科技大学计算机学院 8 10 2.0 2.0
传播情况
(/次)
(/年)
引文网络
引文网络
二级参考文献  (11)
共引文献  (35)
参考文献  (4)
节点文献
引证文献  (4)
同被引文献  (14)
二级引证文献  (0)
1988(1)
  • 参考文献(0)
  • 二级参考文献(1)
1996(2)
  • 参考文献(0)
  • 二级参考文献(2)
2000(1)
  • 参考文献(0)
  • 二级参考文献(1)
2003(1)
  • 参考文献(0)
  • 二级参考文献(1)
2007(1)
  • 参考文献(0)
  • 二级参考文献(1)
2008(1)
  • 参考文献(0)
  • 二级参考文献(1)
2011(1)
  • 参考文献(1)
  • 二级参考文献(0)
2012(4)
  • 参考文献(1)
  • 二级参考文献(3)
2013(2)
  • 参考文献(1)
  • 二级参考文献(1)
2015(1)
  • 参考文献(1)
  • 二级参考文献(0)
2019(3)
  • 参考文献(0)
  • 二级参考文献(0)
  • 引证文献(3)
  • 二级引证文献(0)
2019(3)
  • 引证文献(3)
  • 二级引证文献(0)
2020(1)
  • 引证文献(1)
  • 二级引证文献(0)
研究主题发展历程
节点文献
中文分词
条件随机场
柱搜索
领域自适应
研究起点
研究来源
研究分支
研究去脉
引文网络交叉学科
相关学者/机构
期刊影响力
计算机应用研究
月刊
1001-3695
51-1196/TP
大16开
1984-01-01
chi
出版文献量(篇)
21004
总下载数(次)
0
总被引数(次)
238385
论文1v1指导