原文服务方: 信息与控制       
摘要:
针对现有的文本聚类算法难以取得满意结果的问题,以EM算法为基础,提出能分别描述相似、不相似聚类对的相似性分布以及重要、不重要文档的重要性分布的文本聚类优化模型(text clustering optimization model,TCOM).基于该模型,设计一种通过合并不同的文本聚类结果以获取最优性能的方法.实验结果表明,利用该方法同时改善了聚类精度和召回率,其性能优于单独使用现有的硬、软聚类算法.
推荐文章
基于GA优化QPSO算法的文本聚类
文本聚类
粒子群优化算法
量子行为粒子群优化算法
遗传算法
基于优化密度的耦合空间LDA文本聚类算法研究
文本聚类
耦合空间模型
LDA主题模型
密度
阈值
基于文本挖掘的聚类算法研究
文本挖掘
K-means
K-medoids
准确率
召回率
基于文本挖掘的聚类算法研究
文本挖掘
K-means
K-medoids
准确率
召回率
内容分析
关键词云
关键词热度
相关文献总数  
(/次)
(/年)
文献信息
篇名 基于EM算法的文本聚类优化研究
来源期刊 信息与控制 学科
关键词 硬聚类 软聚类 EM算法 文本聚类优化模型(TCOM)
年,卷(期) 2006,(5) 所属期刊栏目 实际问题研讨
研究方向 页码范围 657-661
页数 5页 分类号 TP18
字数 语种 中文
DOI 10.3969/j.issn.1002-0411.2006.05.022
五维指标
作者信息
序号 姓名 单位 发文数 被引次数 H指数 G指数
1 沈钧毅 西安交通大学电子与信息工程学院 211 4319 32.0 55.0
2 冯中慧 西安交通大学电子与信息工程学院 6 43 4.0 6.0
3 鲍军鹏 西安交通大学电子与信息工程学院 18 301 7.0 17.0
传播情况
(/次)
(/年)
引文网络
引文网络
二级参考文献  (0)
共引文献  (0)
参考文献  (2)
节点文献
引证文献  (6)
同被引文献  (1)
二级引证文献  (24)
1996(1)
  • 参考文献(1)
  • 二级参考文献(0)
1999(1)
  • 参考文献(1)
  • 二级参考文献(0)
2006(0)
  • 参考文献(0)
  • 二级参考文献(0)
  • 引证文献(0)
  • 二级引证文献(0)
2007(2)
  • 引证文献(2)
  • 二级引证文献(0)
2008(2)
  • 引证文献(1)
  • 二级引证文献(1)
2009(1)
  • 引证文献(1)
  • 二级引证文献(0)
2011(1)
  • 引证文献(0)
  • 二级引证文献(1)
2012(1)
  • 引证文献(0)
  • 二级引证文献(1)
2013(1)
  • 引证文献(0)
  • 二级引证文献(1)
2014(2)
  • 引证文献(1)
  • 二级引证文献(1)
2015(1)
  • 引证文献(1)
  • 二级引证文献(0)
2016(8)
  • 引证文献(0)
  • 二级引证文献(8)
2017(3)
  • 引证文献(0)
  • 二级引证文献(3)
2018(4)
  • 引证文献(0)
  • 二级引证文献(4)
2019(4)
  • 引证文献(0)
  • 二级引证文献(4)
研究主题发展历程
节点文献
硬聚类
软聚类
EM算法
文本聚类优化模型(TCOM)
研究起点
研究来源
研究分支
研究去脉
引文网络交叉学科
相关学者/机构
期刊影响力
信息与控制
双月刊
1002-0411
21-1138/TP
大16开
1972-01-01
chi
出版文献量(篇)
2891
总下载数(次)
0
相关基金
国家自然科学基金
英文译名:the National Natural Science Foundation of China
官方网址:http://www.nsfc.gov.cn/
项目类型:青年科学基金项目(面上项目)
学科类型:数理科学
论文1v1指导