期刊文章详细信息

一种通用HTML网页主题信息提取方法
A General Approach to Extracting Topical Information in HTML Pages

文献类型：期刊文章

作　　者：许文[1] 都云程[1] 李渝勤[1] 施水才[1]

机构地区：[1]北京信息科技大学中文信息处理研究中心,北京100101

出　　处：《现代图书情报技术》

基　　金：国家自然科学基金项目"Web数据挖掘技术研究"(项目编号:60272084);北京市教育委员会科技发展计划重点项目"面向大规模真实文本的数据挖掘技术"(项目编号:KZ200310772013);北京市教委项目"中文垃圾邮件过滤和追踪技术研究"(项目编号:KM200510772008);"数字内容的安全身份认证与版权保护技术研究"(项目编号:KM200610772008)的研究成果之一

年　　份：2007

期　　号：1

起止页码：40-43

语　　种：中文

收录情况：BDHX、BDHX2004、CSSCI、CSSCI2006_2007、RWSKHX、核心刊

摘　　要：采用DOM规范,把HTML网页表示成树结构,对不同模板的HTML页面“主题”信息提取进行研究和分析,提出一种新的结点主题相关性判定方法,依据此方法判定出要抽取的主题内容,并删除无关内容,结果输出只含主题信息的HTML文档。

关键词：DOM 信息提取分块相关度

分类号：TP393.092]

参考文献：

正在载入数据...

二级参考文献：

正在载入数据...

耦合文献：

正在载入数据...

引证文献：

正在载入数据...

二级引证文献：

正在载入数据...

同被引文献：

正在载入数据...

重庆科技学院机构知识库

期刊文章详细信息

一种通用HTML网页主题信息提取方法
A General Approach to Extracting Topical Information in HTML Pages

我的收藏

参考文献：

二级参考文献：

耦合文献：

引证文献：

二级引证文献：

同被引文献：

重庆科技学院机构知识库

期刊文章详细信息

一种通用HTML网页主题信息提取方法 A General Approach to Extracting Topical Information in HTML Pages

我的收藏

参考文献：

二级参考文献：

耦合文献：

引证文献：

二级引证文献：

同被引文献：

一种通用HTML网页主题信息提取方法
A General Approach to Extracting Topical Information in HTML Pages