探析数据挖掘( Data Mining )和统计学的联系 |
|
|
| 更新时间 2009-3-19 11:36:42 点击数: |
|
|
,比方说科学和工程中大量存在的数据库。这些数据库通常和计算机自动收据数据联系在一起,比方说:
a) 天文的(天空图)
b) 气象的(气候,环境污染监测站)
c) 卫星遥感
d) 高能物理
e) 工业过程控制
这些数据也能得益于数据挖掘技术(原则上)
4 是数据挖掘还是智能训练?
当前对数据挖掘的兴趣在学术界引发了一些议题。数据挖掘作为一种商业事业看上去很可行,但它是否能被定为一种智能训练。当然它和计算机科学有极重要的联系。这些包括:
a) 集聚体(ROLAP)的高效计算
b) 快速的立体(X * X)查寻
c) 为提高在线查寻的速度的线下预查寻
d) 在线查寻的并行计算
e) 将DBMS方法转化为数据挖掘算法。
f) 基于磁盘而不是RAM的实现
g) 基本数据挖掘算法的并行实现
从统计数据分析的眼光我们可以问数据挖掘方法是否是智能训练。到目前为止,仍可以说它是,也可以说不是。数据挖掘包中广为人知的程序来自机器学习,模式识别,神经网络和数据可视化领域。它们强调`看和感觉`和感官性的存在。这样看上去并不是在意具体的表现,而是要迅速占领市场。在这个领域中目前大部分的研究集中在改进当前的机器学习方法和加速已存在的算法。
然而,在将来数据挖掘几乎可以肯定地说是一种智能训练。当一种技术的效率提高了十倍,人们总要认真地重新考虑怎样应用它。想一想人类从走到飞的历史进程,每一次提高都大约是以前的十倍,并且每一次量的提高都重新改变了我们队如何使用交通工具的想法。Chuck Dickens(前SLAC的计算指导)曾说到:`每次计算机的能力提高十倍,我们都应该从总体上重新思考一下我们应该怎样算,算什么的问题。一个相应的说法可能是`每次数据量增加十倍,我们就应该从总体上重新考虑一下怎样分析它。从当前几乎大多数使用的数据挖掘工具发明的那一段时间到现在,计算机的处理能力和数据量都增加了好几个数量级。新的数据挖掘方法在将来一定会更智能更有学术性(商业性)。
5 数据挖掘应该是统计的一部分吗?
我们过去曾给予数据挖掘方法智能的生命力,但统计学作为一个学科是否应该关心它的发展。我们是否应该将它看成统计的一部分?那意味作什么?最起码它表明我们应该:
在我们的杂志上发表这类文章。
在我们的本科课程中讲授一些这方面的内容 ?在我们的研究生中讲授一些相关的研究课题。
给那些这方面较优秀的人提供一些奖励(工作,任期,奖品)。
答案并不明显,在统计学的历史上就忽略了许多在其它数据处理相关领域发展的新方法。如下是一些相关领域的例子。其中带*的是那些在统计科学中萌芽,但随后绝大部分又被统计学忽略的方法领域。
. 模式识别* CS/工程
. 数据库管理 CS/图书馆科学
. 神经网络* 心理学/CS/工程
. 机器学习* -CS/AI
. 图形模型* (Beyes 网)-CS/AI <BR>
. 遗传工程 CS/工程
. 化学统计学* 化学
. 数据可视化** CS/科学计算
可以肯定地说,个别的统计学家已经致力于这些领域,但公平地说他们并未被我们的统计学领域拥抱(或者说热情地拥抱)。
6 什么是统计学?
既然象上面的一些从数据获取知识的课题和统计学的关系如此冷淡,我们不禁要问:什么不是统计学。如果和数据联系并不是一个课题成为统计学一部分的充分理由,那么什么才是充分的呢?到目前为止,统计学的定义好象依赖于一些工具,也就是我们在当前的研究生课程中讲授的那些东西。如下是一些例子:
概率理论、实分析、测度论、渐近理论、决策理论、马耳可夫链、遍历理论等
统计领域好象被定义成一族能提出如上或相关工具的问题。当然这些工具过去和将来都会很有用。就象Brad Efron提醒我们一样:统计是最成功的信息科学。那些忽略了统计的人将受到惩罚,他们将在实际中自己重新发现该统计方法。
有人认为在当前数据(及其相关应用)以指数方式增长,而统计学家的数量显然赶不上这种增长的情况下,我们统计学应该将精力集中于信息科学中我们作得最好的部分,也就是基于数学的概率推断。这是一种高度保守的观点,当然它也有可能是最好的一种战略。然而,如果我们接受这一种观点,我们统计学家在‘信息革命’浪潮中的作用肯定会逐渐消失殆尽(在这个舞台上的演员越来越少)。当然这种战略的一个很好的优点是它对我们创新的要求很少,我们只需要墨守成规就可以了。
另一种观点,早在1962年就由John Tukey[Tukey (1962)]提出来了,他认为统计应该关注数据分析。这个领域应该依据问题而不是工具定义,也就是那些和数据有关的问题。如果这种观点成为一种主流观点,那就要求对我们的实践和学术课题作较大的改变。
首先(最重要的),我们应该跟上计算的步伐。哪里有数据,哪里就有计算。一旦我们将计算方法看成是一个基本的统计工具(而不是一种方便地实现我们现成工具的方法),那么当前许多和数据密切相关的领域将不复存在。他们将成为我们领域的一部分。
认真对待计算工具而不是简单地使用统计包虽然这一点也很重要。如果计算成为我们的一个基本的研究工具,毫无疑问,我们的学生应该学习相关的计算科学知识。这将包括数值线性代数,数值和组合优化,数据结构,算法设计,机械体系,程序设计方法,数据库管理,并行体系,和程序设计等等。我们也将扩展我们的课程计划,它应该包括当前的计算机定向数据分析方法,它们大部分是在统计学科之外发展起来的。
如果我们想和其它的数据相关领域争夺学术和商业的市场空间,我们的某些基本模式将不得不改变,我们将不得不调节对数学的幻想。数学(象计算)只是统计的一个工具,虽然非常重要,但并不是唯一能证实统计方法有效性的工具。数学不等价于理论,反之亦然。理论本来是创造理解力和数学,虽然这很重要,但并不是作此的唯一方法。比如,在疾病的基因理论中数学内容很少,但它却使人们更好地理解许多医学现象。我们将承认经验确认方式,虽然有一定局限性,但的确是一种确认方式。
我们可能也不得不改变我们的文化。每一个参与其它数据相关领域的统计学家都被他们和统计学的‘文化差距’所震撼。在其它的一些领域,‘想法’比数学技术(基础)更重要。一个有启发的‘想法’就被认为是有价值的,若有更详细的确认(理论的或经验的)人们才去讨论它的最终价值。思维方式是‘如果没有证明是有罪的,那就是清白的’这和我们领域的思路是不一致的。过去如果一个新方法不是用数学证明是有效的,我们常常诋毁它,即使不这样,我们也不会接受它。这种思路在数据集比较小和信息噪声比较高时是合理的。特别地,我们应该改变我们诋毁那些表现很好(通常在其它领域),但却没被我们理解的方法的习惯。
7 Which Way To Go?
也许,现在的统计学正处在一个十字路口,我们可以决定是接受还是拒绝改变。如上所说,两种观点都极富说服力。虽然观点丰富,但谁也不能肯定哪一种战略能保持我们领域的健康发展和生命力。大多数统计学家好象认为统计学对信息科学的影响越来越小。它们也不太同意为此作些什么。站主导的观点认为我们有市场问题,我们在别的领域的顾客和同事不了解我们的价值和重要性。这也是我们的主要专业组织,美国统计协会的看法。在战略计划委员(Amstat News-Feb.1997)会所作的五年计划报告中有一节‘增强我们学科的声望和健康’。建议作三方面的工作:
(以下的内容意思是:统计学面临危机,市场的,人才的危机。统计学可以在数据挖掘科学中发挥作用,统计学应该和数据挖掘合作,而不是将它甩给计算机科学家。)
参考:Tukey,J.W.(1962).数据分析的未来 Ann.Statist.33,1-67
| 【设为主页】【收藏论文】【保存论文】【打印论文】【回到顶部】【关闭此页】 |
| 最新论文 |
|
统计师论文网为您提供:统计师论文范文 控制权私人利益的影响因素与经济后果研究 统计学中的一些矩阵理论及其相关应用 圣经人口统计学简述 心理统计学笔记下载 探析数据挖掘( Data Mining )和统计学的 数学建模中统计学的T检验与F检验 从统计应用探讨统计学发展 T检验、F检验和统计学意义(P值或sig值) 《西游记》中的妖精武器种类及运用的统计 |
| 热门论文 |
|
T检验、F检验和统计学意义(P值或sig值) 从统计应用探讨统计学发展 数学建模中统计学的T检验与F检验 探析数据挖掘( Data Mining )和统计学的 心理统计学笔记下载 圣经人口统计学简述 从统计学的发展趋势谈统计教育改革 加强企业统计工作 提高企业管理水平 ADF检验中滞后长度的选择——基于ARIMA( 旅游规划中的统计分析 |
|