期刊文章详细信息
文献类型:期刊文章
Ma Ru xia;Wang Lu;Meng Xiaofeng;Shi Yingjie(School of Information,Renmin University of China,Beijing 100872;Department of Education Technology,Capital Normal University,Beijing 100048;School of Information Engineering,Beijing Institute of Fashion Technology,Beijing 100029)
机构地区:[1]中国人民大学信息学院,北京100872 [2]首都师范大学教育技术系,北京100048 [3]北京服装学院信息工程学院,北京100029
基 金:国家自然科学基金项目(61379050;91224008;61502279);国家"八六三"高技术研究发展计划基金项目(2013AA013204);高等学校博士学科点专项科研基金项目(20130004130001);中国人民大学科学研究基金项目(11XNL010)~~
年 份:2016
卷 号:53
期 号:12
起止页码:2858-2866
语 种:中文
收录情况:AJ、BDHX、BDHX2014、CSA-PROQEUST、CSCD、CSCD2015_2016、EI、IC、JST、RCCSE、SCOPUS、ZGKJHX、核心刊
摘 要:Web已成为一个浩瀚的信息海洋,其信息分散在不同的数据源中.不同数据源常常为同一对象实体提供冲突的属性值.如何从这些冲突属性值中找到真值被称为真值发现问题.根据属性值数量可将对象属性分为单值属性和多值属性,现有的多数真值发现算法对单值属性的真值发现比较有效.针对多值属性的真值发现问题,提出了一个多真值发现方法 MTruths,该方法将多真值发现问题转化为一个最优化问题,其目标是:各对象的真值与各数据源提供的观察值之间的相似性加权和达到最大.对象真值求解过程中,提出2种方法求真值列表的最优解:基于枚举的方法和贪心算法.与已有方法不同的是MTruths可以直接得到对象的多个真值.最后,通过图书和电影2个真实数据集上的实验表明,MTruths的2种实现方法的准确性以及贪心算法的效率优于现有真值发现方法.
关 键 词:真值发现 数据冲突 单值属性 多值属性 数据源质量
分 类 号:TP311]
参考文献:
正在载入数据...
二级参考文献:
正在载入数据...
耦合文献:
正在载入数据...
引证文献:
正在载入数据...
二级引证文献:
正在载入数据...
同被引文献:
正在载入数据...