新书推介:《语义网技术体系》
作者:瞿裕忠,胡伟,程龚
   XML论坛     W3CHINA.ORG讨论区     >>计算机科学论坛<<     SOAChina论坛     Blog     开放翻译计划     新浪微博  
 
  • 首页
  • 登录
  • 注册
  • 软件下载
  • 资料下载
  • 核心成员
  • 帮助
  •   Add to Google

    >> 搜索引擎, 信息分类与检索, 语义搜索, Lucene, Nutch, GRUB, Larbin, Weka
    [返回] 计算机科学论坛计算机技术与应用『 Web挖掘技术 』 → 挖潜无极限—数据挖掘技术与应用热点扫描[推荐] 查看新帖用户列表

      发表一个新主题  发表一个新投票  回复主题  (订阅本版) 您是本帖的第 9373 个阅读者浏览上一篇主题  刷新本主题   平板显示贴子 浏览下一篇主题
     * 贴子主题: 挖潜无极限—数据挖掘技术与应用热点扫描[推荐] 举报  打印  推荐  IE收藏夹 
       本主题类别: 数据挖掘    
     DMman 帅哥哟,离线,有人找我吗?魔羯座1984-1-11
      
      
      威望:1
      头衔:数据挖掘青年
      等级:研二(Pi-Calculus看得一头雾水)(版主)
      文章:803
      积分:5806
      门派:W3CHINA.ORG
      注册:2007/4/9

    姓名:(无权查看)
    城市:(无权查看)
    院校:(无权查看)
    给DMman发送一个短消息 把DMman加入好友 查看DMman的个人资料 搜索DMman在『 Web挖掘技术 』 的所有贴子 点击这里发送电邮给DMman 访问DMman的主页 引用回复这个贴子 回复这个贴子 查看DMman的博客楼主
    发贴心情 挖潜无极限—数据挖掘技术与应用热点扫描[推荐]

    挖潜无极限—数据挖掘技术与应用热点扫描
    转自:http://bbs.xml.org.cn/blog/more.asp?name=topcio&id=16699

       “我们把世界看成数学,并且把你也看成数学”——用这句话来说明数据挖掘技术的复合性和应用的广泛性似乎再好不过。如今,虽然一些行业在应用这一技术上仍然缺乏足够的主动,但一个不能阻挡的趋势是:已经有越来越多的人在快乐并有效地使用这一技术,同时不由自主地成为“挖掘”的对象。

             禽流感该如何更好地监控?今天你写Blog了吗?

             你是否觉得这两个问题连在一起问很无厘头?

             事实上,美国一家公司正在试图让这两个事件之间的关系日渐明了。
    这家公司目前正在通过从全球的Blog网页中挖掘出和禽流感相关的信息,从而建立一个预警机制。这一项目考虑到Blog已经成为新闻传播的重要途径,先从网上抓取有关禽流感的网页,存入到公司的数据仓库,再指定“国家”为关键目标词,然后利用关联分析技术,即可得到和禽流感关联最大的国家,由此可以判定该国的禽流感传染可能比较严重。

             就在此前,已经有很多人在抱怨,网上多如牛毛的Blog除了浪费人们数以十万年的阅读时间之外,还有多少用处?如今,数据挖掘技术正在力图从这些爆炸式增长的Blog中“挖”出更有价值的东西,同时它也在更多领域中展示其非凡的力量。

    工具篇:前方是岔路口

             数据挖掘其实并非单纯的IT技术,而是数学家和计算机科学家之间的合作产物。在过去十年中,高等数学和计算机建模的联姻改变了科学和工程技术,以至于有人认为这一合作已经开创了一个全新的商业领域。

             有关数据挖掘技术的定义有很多版本,综其要点,主要在于应用一系列统计与人工智能技术来发现以前并不了解的数据规律,并解决实际业务问题。如今,数据挖掘技术已经从最开始的一个简单的算法包,发展出通用挖掘平台和专业挖掘工具两大种类。其中,像IBM、NCR、SAS、微软、SPSS、StatSoft等厂商的数据挖掘产品(模块)基本都是通用型工具平台;而像美国的 Unica 公司、Fair Isaac 则主要专注于诸如营销自动化、信用卡积分等细分领域,属于后一种工具。具体来看,目前在数据挖掘领域声势颇大的大多是通用型工具平台。

             “现在IBM更侧重的是平台优势。”在采访中,IBM软件部中国区DB2信息管理技术经理刘晶炜明确表示。目前,IBM的DB2中包含Intelligent Miner for Data和Intelligent Miner for Text两个数据挖掘模块,将数据挖掘和数据仓库整合到一个平台之上。其中,前者主要针对结构化信息,分为建模、浏览、Scoring Service三个部分;后者则是针对文本的挖掘模块,其主要功能是特征抽取、文档聚集、文档分类和检索。

             NCR Teradata的数据挖掘工具同样也是与其数据仓库整合在一起的。具体来说,其数据挖掘工具可以按照挖掘的步骤主要分成Profiler、ADS Generator、Warehouse Miner和模型管理器四块。目前Teradata最新版的数据挖掘方案是Teradata Warehouse Miner 4.1。

             SAS 公司和SPSS公司作为两家从传统的统计分析技术发展而来的数据挖掘厂商,二者在业内的影响力可谓有目共睹。其中,SAS 公司提供了SAS Enterprise Miner 、SAS ETS(时间序列预测)、SAS OR(运筹学)、SAS STAT(统计分析)、SAS QC(质量控制)等一系列工具;SPSS公司也提供了Clementine和AnswerTree两项产品。

             微软的SQL Server 2005在数据挖掘方面的突破与创新曾被人看作是最令人惊艳的地方。Microsoft SQL Server 2005 Data Mining 平台的确引入了大量的数据挖掘功能,其本身就是一个开发智能应用程序的平台,而非一个独立应用程序。而且,这一平台与所有 SQL Server 产品实现了集成,包括 SQL Server、SQL Server Integration Services 和 Analysis Services。据称,SQL Server 2005 中最重要的数据挖掘功能就是其处理大型数据集的能力,它允许模型对整个数据集运行,从而消除了采样方面的挑战。

             总起来看,像IBM、NCR、Oracle、微软这些平台工具厂商基本上都是以提供“整车”为己任。一句话,只要用户不是很挑剔,基本上都可以在某一家那里即可买全包括数据挖掘工具在内的全套商业智能产品。而像SAS、SPSS、StatSoft等公司虽然也宣称提供工具平台,但提供“整车”的实力有限,其主要在统计分析和数据挖掘领域延伸提供尽可能多的工具组件。

             相对于这些挖掘工具平台,专业挖掘工具可能在市场的声势并不大,但是像Fair Isaac 公司、Unica 公司的发展却也相当不错。比如像Fair Isaac 公司就已经占据了全球信用卡积分市场70%~80%的份额,几乎达到垄断。该公司的创始人发明了一个信用评分卡(即费寇分数,FICO score),由此可以预测人的未来偿付行为,为信用卡消费提供一个有效的预测工具。同样,美国 Unica 公司的 Affinium Model 则是一款专注于市场营销自动化的数据挖掘工具软件。

             那么,面对这两种工具,用户该如何选择?换句话讲,哪种工具才是未来的发展方向呢?

             中国传媒大学调查统计研究所副所长、数据挖掘研究室主任沈浩认为,平台化肯定是将来的一个发展方向,而且,中国的市场足够广阔,也可以容得下一批这样的平台厂商。IBM软件部中国区DB2信息管理技术经理刘晶炜也表示,正与SAS进行更多的合作,以便进一步统一数据挖掘领域的技术标准。

             而Teradata数据仓库专家盛秋戬博士则认为,目前的平台工具虽多,但从根本上讲,都是在用横向的数据挖掘工具解决纵向的行业业务问题。他表示,如果从用户出发,用户应该更欢迎那些专业挖掘工具。

             北京瑞斯泰得数据技术开发公司苏立民总经理从事数据挖掘行业已有六年之久,他在采访中表示,现在数据挖掘领域的确存在平台化趋势,但专业工具也占领了一些市场。比如Unica 公司就是选出并优化某些算法,再加上行业经验,使建模过程更加优化。

             另据Sybase商务智能总监廖钢城介绍,其实在日本,就有公司专门销售一种类似“黑匣子”的专业工具,银行积累的数据在里面跑一遍,就直接出来结果。这种工具用得也很好。而在另一方面,他也认为,提供平台的厂商会越来越少。

             如此看来,业界对于工具的发展方向似乎并无太大异议,即平台工具会保持在一个适当的数量,而专业工具显然更得用户的宠爱。而现在,数据挖掘技术的发展刚好走到一个岔路口,一边指向通用型,一边指向专业型,就看企业要往哪个方向走了。

    此主题相关图片如下:
    按此在新窗口浏览图片


    [此贴子已经被作者于2007-7-3 15:33:04编辑过]

       收藏   分享  
    顶(0)
      




    ----------------------------------------------
    数据挖掘青年 http://blogger.org.cn/blog/blog.asp?name=DMman
    纪录片之家 (很多纪录片下载)http://www.jlpzj.com/?fromuid=137653

    点击查看用户来源及管理<br>发贴IP:*.*.*.* 2007/7/2 18:49:00
     
     GoogleAdSense魔羯座1984-1-11
      
      
      等级:大一新生
      文章:1
      积分:50
      门派:无门无派
      院校:未填写
      注册:2007-01-01
    给Google AdSense发送一个短消息 把Google AdSense加入好友 查看Google AdSense的个人资料 搜索Google AdSense在『 Web挖掘技术 』 的所有贴子 点击这里发送电邮给Google AdSense 访问Google AdSense的主页 引用回复这个贴子 回复这个贴子 查看Google AdSense的博客广告
    2024/5/12 1:15:53

    本主题贴数5,分页: [1]

     *树形目录 (最近20个回帖) 顶端 
    主题:  挖潜无极限—数据挖掘技术与应用热点扫描[推荐](5340字) - DMman,2007年7月2日
        回复:  分析的很透彻!!(16字) - lovezhou_2006,2007年7月7日
        回复:  应用篇:瓜熟蒂不落? 在采访中,笔者发现,无论厂商、集成商还是学术界,基本上都..(4465字) - DMman,2007年7月2日
        回复:  热点篇:文本挖掘与网络挖掘 算法和建模作为数据挖掘工具的核心技术,从它诞生之日..(3038字) - DMman,2007年7月2日
        回复:  技术篇:算法与模型 机关可曾“算”尽? 之所以说数据挖掘是高等数学和计算机..(4425字) - DMman,2007年7月2日

    W3C Contributing Supporter! W 3 C h i n a ( since 2003 ) 旗 下 站 点
    苏ICP备05006046号《全国人大常委会关于维护互联网安全的决定》《计算机信息网络国际联网安全保护管理办法》
    78.125ms