公共文化服务平台

2025年3月4日星期二

|

欢迎来到贵州省图书馆•公共文化服务平台

登录 | 注册 | 进入后台

[APP下载]

[APP下载]

扫一扫,既下载

全民阅读
职业技能
专家智库
参考咨询

您的位置： 专家智库 > >

吴小莹: 作品数：2 被引量：4H指数：1; 供职机构：武汉大学计算机学院软件工程国家重点实验室更多>>; 发文基金：国家自然科学基金更多>>; 相关领域：自动化与计算机技术更多>>

合作作者

江俊彦武汉大学计算机学院软件工程国家...
彭智勇武汉大学计算机学院软件工程国家...
王敏武汉大学计算机学院

作品列表
供职机构
相关作者
所获基金
研究领域

文献类型

2篇中文期刊文章

领域

2篇自动化与计算...

主题

2篇深网
1篇数据库
1篇数据源
1篇数据源选择
1篇数据质量
1篇分层抽样
1篇TOP-K查...
1篇WEB数据库
1篇查询
1篇查询代价
1篇TOP

机构

2篇武汉大学

作者

2篇彭智勇
2篇江俊彦
2篇吴小莹
1篇王敏

传媒

1篇模式识别与人...
1篇软件学报

年份

2篇2017

共 2 条记录，以下是 1-2

全选清除导出

排序方式：

基于分层抽样的重叠深网数据源选择被引量：3: 2017年; 深网查询在Web上众多的应用,需要查询大量的数据源才能获得足够的数据,如多媒体数据搜索、团购网站信息聚合等.应用的成功,取决于查询多数据源的效率和效果.当前研究侧重查询与数据源的相关性而忽略数据源之间的重叠关系,使得不同数据源上相同结果的数据被重复查询,增加了查询开销及数据源的工作负载.为了提高深网查询的效率,提出一种元组水平的分层抽样方法来估计和利用查询在数据源上的统计数据,选择高相关、低重叠的数据源.该方法分为两个阶段:离线阶段,基于元组水平对数据源进行分层抽样,获得样本数据;在线阶段,基于样本数据迭代地估计查询在数据源上的覆盖率和重叠率,并采用一种启发式策略以高效地发现低重叠的数据源.实验结果表明,该方法能够显著提高重叠数据源选择的精度和效率.; 江俊彦彭智勇吴小莹彭承晨王敏; 关键词：数据源选择分层抽样

基于Top-k查询约束的深网增量爬取被引量：1: 2017年; 深网数据源的动态性、自治性和体量使第三方应用难以完全爬取所有Web数据.文中研究查询类型(仅允许Top-k查询)和查询资源约束下深网数据源爬取问题,提出基于Top-k查询约束的深网增量爬取方法,结合历史数据和领域知识,优化总体数据质量.首先基于查询树获得有效查询,利用历史数据和领域知识估计查询变化和查询代价.然后,基于估计的查询代价和数据质量,近似选择最优的查询子集最大化总体数据质量.实验表明文中方法较好地提高动态Web数据库爬取的效率和数据质量.; 江俊彦彭智勇吴小莹; 关键词：数据质量查询代价

全选清除导出

共1页<1>

执行隐藏清空

网站首页| 关于我们| 联系我们| 产品服务| 客服中心| 版权声明

版权所有©2014－2015 Chongqing VIP Information., Ltd., 客户热线：400-638-5550

渝B2-20050021-1　渝公网安备 50019002500403号　违法和不良信息举报中心　互联网出版许可证　新出网证(渝)字10号

用户登录

用户反馈

标题：

*标题长度不超过50

邮箱：

*

反馈意见：

反馈意见字数长度不超过255

验证码：

看不清楚？点击换一张