基本信息来源于合作网站,原文需代理用户跳转至来源网站获取       
摘要:
重采样技术由于简单、直观,逐渐成为解决非平衡数据分类问题的一个重要方向.但是在数据集很小的情况下,重采样技术中的欠采样可能会丢失数据集的重要信息,因此过采样是非平衡数据分类问题的研究重点.现有的过采样方法虽然有效地解决了类间不平衡问题,但是有可能造成少数类的密集区域更加密集,甚至引起样本重叠.此外,由于少数类样本可能存在噪音,现有的过采样方法可能会在噪音周围生成新样本,从而造成少数类样本的分布更加混乱.针对这些问题,文中提出了一种基于样本分层的双向过采样方法,该方法首先基于最高密度点和类内平均距离将少数类样本划分成密集层和稀疏层,然后对密集层边界区样本和稀疏层的样本进行双向过采样.为了验证所提算法的有效性,在9个UCI数据集上将提出的算法和其他过采样算法进行了比较.实验结果和Friedman等检验结果显示,提出的算法在处理非平衡数据分类问题时具有一定优势.
推荐文章
一种简易的心电过采样系统
简易
心电采集
过采样
Labivew
DAQ
基于攻击树的脚本病毒样本分析方法
脚本病毒
样本分析
攻击树模型
Windows脚本宿主
一种基于过采样技术的非最小相位系统盲辨识方法
盲辨识
过采样
非最小相位系统
一种分层次B帧双向预测直接模式
可伸缩性视频编码
分层次B帧
运动补偿时域滤波
B帧预测模式
直接模式
双向预测
内容分析
关键词云
关键词热度
相关文献总数  
(/次)
(/年)
文献信息
篇名 一种基于样本分层的双向过采样方法
来源期刊 计算机科学 学科 工学
关键词 非平衡数据 分类 双向过采样 密集层 稀疏层
年,卷(期) 2019,(12) 所属期刊栏目 大数据与数据科学
研究方向 页码范围 83-88
页数 6页 分类号 TP311
字数 5349字 语种 中文
DOI 10.11896/jsjkx.190400053
五维指标
作者信息
序号 姓名 单位 发文数 被引次数 H指数 G指数
1 曹付元 山西大学计算智能与中文信息处理教育部重点实验室 34 322 8.0 17.0
2 余丽琴 山西大学计算机与信息技术学院 2 0 0.0 0.0
3 周晓敏 山西大学计算机与信息技术学院 1 0 0.0 0.0
传播情况
(/次)
(/年)
引文网络
引文网络
二级参考文献  (117)
共引文献  (72)
参考文献  (17)
节点文献
引证文献  (0)
同被引文献  (0)
二级引证文献  (0)
1967(1)
  • 参考文献(0)
  • 二级参考文献(1)
1976(1)
  • 参考文献(0)
  • 二级参考文献(1)
1979(1)
  • 参考文献(0)
  • 二级参考文献(1)
1986(1)
  • 参考文献(0)
  • 二级参考文献(1)
1991(1)
  • 参考文献(0)
  • 二级参考文献(1)
1992(1)
  • 参考文献(0)
  • 二级参考文献(1)
1994(1)
  • 参考文献(0)
  • 二级参考文献(1)
1995(2)
  • 参考文献(0)
  • 二级参考文献(2)
1997(4)
  • 参考文献(0)
  • 二级参考文献(4)
1998(2)
  • 参考文献(0)
  • 二级参考文献(2)
1999(1)
  • 参考文献(0)
  • 二级参考文献(1)
2000(2)
  • 参考文献(0)
  • 二级参考文献(2)
2001(1)
  • 参考文献(0)
  • 二级参考文献(1)
2002(8)
  • 参考文献(1)
  • 二级参考文献(7)
2004(2)
  • 参考文献(0)
  • 二级参考文献(2)
2005(3)
  • 参考文献(0)
  • 二级参考文献(3)
2006(7)
  • 参考文献(1)
  • 二级参考文献(6)
2007(7)
  • 参考文献(0)
  • 二级参考文献(7)
2008(4)
  • 参考文献(0)
  • 二级参考文献(4)
2009(12)
  • 参考文献(1)
  • 二级参考文献(11)
2010(5)
  • 参考文献(0)
  • 二级参考文献(5)
2011(4)
  • 参考文献(0)
  • 二级参考文献(4)
2012(17)
  • 参考文献(2)
  • 二级参考文献(15)
2013(7)
  • 参考文献(1)
  • 二级参考文献(6)
2014(11)
  • 参考文献(2)
  • 二级参考文献(9)
2015(14)
  • 参考文献(2)
  • 二级参考文献(12)
2016(8)
  • 参考文献(2)
  • 二级参考文献(6)
2017(2)
  • 参考文献(1)
  • 二级参考文献(1)
2018(3)
  • 参考文献(3)
  • 二级参考文献(0)
2019(1)
  • 参考文献(1)
  • 二级参考文献(0)
2019(1)
  • 参考文献(1)
  • 二级参考文献(0)
  • 引证文献(0)
  • 二级引证文献(0)
研究主题发展历程
节点文献
非平衡数据
分类
双向过采样
密集层
稀疏层
研究起点
研究来源
研究分支
研究去脉
引文网络交叉学科
相关学者/机构
期刊影响力
计算机科学
月刊
1002-137X
50-1075/TP
大16开
重庆市渝北区洪湖西路18号
78-68
1974
chi
出版文献量(篇)
18527
总下载数(次)
68
论文1v1指导