新书推介:《语义网技术体系》
作者:瞿裕忠,胡伟,程龚
   XML论坛     W3CHINA.ORG讨论区     >>计算机科学论坛<<     SOAChina论坛     Blog     开放翻译计划     新浪微博  
 
  • 首页
  • 登录
  • 注册
  • 软件下载
  • 资料下载
  • 核心成员
  • 帮助
  •   Add to Google

    >> 搜索引擎, 信息分类与检索, 语义搜索, Lucene, Nutch, GRUB, Larbin, Weka
    [返回] 计算机科学论坛计算机技术与应用『 Web挖掘技术 』 → 搜索引擎查询层的主要检索质量优化的方法,在参加完google的互联网大会后的总结 查看新帖用户列表

      发表一个新主题  发表一个新投票  回复主题  (订阅本版) 您是本帖的第 9161 个阅读者浏览上一篇主题  刷新本主题   平板显示贴子 浏览下一篇主题
     * 贴子主题: 搜索引擎查询层的主要检索质量优化的方法,在参加完google的互联网大会后的总结 举报  打印  推荐  IE收藏夹 
       本主题类别:     
     pennyliang 帅哥哟,离线,有人找我吗?白羊座1979-4-7
      
      
      威望:8
      等级:大二期末(C++考了100分!)
      文章:266
      积分:1911
      门派:Lilybbs.net
      注册:2005/3/11

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给pennyliang发送一个短消息 把pennyliang加入好友 查看pennyliang的个人资料 搜索pennyliang在『 Web挖掘技术 』 的所有贴子 引用回复这个贴子 回复这个贴子 查看pennyliang的博客楼主
    发贴心情 搜索引擎查询层的主要检索质量优化的方法,在参加完google的互联网大会后的总结


    从一个检索词,到得到检索结果,称为一次查询,那么这次查询的质量主要取决于

    1)是否检索到
    2)在搜索结果页第几页第几条检索到
    3)检索时间耗时

    很显然,最佳的结果是,首条命中,而且尽可能的快,假定不考虑检索耗时,仅从检索质量上讲,存在以下四类方法。

    优化查询结果:(文档空间)

    1)通过某种rank排名,比如page rank,expert rank,time rank,Hilltop等,然而不论什么方法,都不能保证让所有的用户满意,因为只有有限的条数可以排在前面。

    2)通过查询结果聚类,比如国外的vivisimo,国内的bbmao,通过查询结果聚类,让用户在选择一次类别,实现不同关注点的展示,然而类别的命名非常困难,通常很多类别没有具体的含义,用户选择存在困难,即便选择了类别,仍然存在排序问题。

    3)分类搜索,通过查询结果的类别,进行区分。



    引入用户空间:

    1)用户查询历史推测用户的搜索目的。

    2)用户的语言,地域,性别等推测用户的搜索目的。

    3)众多用户合作建设的搜索引擎,比如google co-op,swicki等

    4)通过历史用户使用该检索词的点击信息,推测那条为最佳用户选择链接。

    查询词优化:(关键词空间)

    1)相关搜索提示,提示用户其他的搜索,帮助用户选择最佳搜索词。

    2)查询纠错,可能用户输入的错别字而导致查询质量降低可以有效的通过这个方法解决。

    不存在理想检索结果

    1)允许用户主动创建,例如百度知道,新浪爱问。


    转自:http://blog.csdn.net/pennyliang/archive/2007/03/05/1520799.aspx


    [此贴子已经被作者于2007-3-5 13:53:02编辑过]

       收藏   分享  
    顶(0)
      




    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2007/3/5 11:13:00
     
     GoogleAdSense白羊座1979-4-7
      
      
      等级:大一新生
      文章:1
      积分:50
      门派:无门无派
      院校:未填写
      注册:2007-01-01
    给Google AdSense发送一个短消息 把Google AdSense加入好友 查看Google AdSense的个人资料 搜索Google AdSense在『 Web挖掘技术 』 的所有贴子 访问Google AdSense的主页 引用回复这个贴子 回复这个贴子 查看Google AdSense的博客广告
    2024/5/4 2:00:19

    本主题贴数1,分页: [1]

     *树形目录 (最近20个回帖) 顶端 
    主题:  搜索引擎查询层的主要检索质量优化的方法,在参加完google的互联网大会后的总结..(1385字) - pennyliang,2007年3月5日

    W3C Contributing Supporter! W 3 C h i n a ( since 2003 ) 旗 下 站 点
    苏ICP备05006046号《全国人大常委会关于维护互联网安全的决定》《计算机信息网络国际联网安全保护管理办法》
    102.051ms