以文本方式查看主题

-  中文XML论坛 - 专业的XML技术讨论区  (http://bbs.xml.org.cn/index.asp)
--  『 人工智能 :: 机器学习|数据挖掘|进化计算 』  (http://bbs.xml.org.cn/list.asp?boardid=62)
----  数据挖掘者与数据挖掘青年的对话(数据挖掘初学者共勉)  (http://bbs.xml.org.cn/dispbbs.asp?boardid=62&rootid=&id=47345)


--  作者:DMman
--  发布时间:5/22/2007 2:49:00 PM

--  数据挖掘者与数据挖掘青年的对话(数据挖掘初学者共勉)

说明:以下为数据挖掘者给我(数据挖掘青年)的回信,答复了我作为一个数据挖掘初学者对对数据挖掘的种种疑问。对数据挖掘者表示真诚的感谢!与大家共勉。
   
数据挖掘者 发表于 2007-5-21 22:22:59

DMman:

  我是一名研一生,专业是数据库。我想自己选择一门方向,认真的学习,作为终身职业。譬如 java程序员、数据挖掘人员、数据库管理人员等等。我比较喜欢数据挖掘,但是若干问题难以释惑。

问题1:现在选择数据挖掘作为终身职业是明智之举吗?

  现在网上对数据挖掘的前景讨论的很厉害,褒贬不一。但是至少可以确定的是数据挖掘已经越来越被重视了。如你所言,大家看到的只是表面,许多成功的案例企业没有对外公开。但不可否认的是,数据挖掘在中国的应用有屠龙之技的嫌疑,广大的企业还没有重视起来。
  总之,男怕投错行,这个问题总是敲击着我。如果我是您的弟弟,您会鼓励我走数据挖掘之路吗?还是推荐其他的IT职业?

IDMer:

  就我个人的观点,数据挖掘的发展还是前途很广阔的。说白了,数据挖掘就是一种分析问题的手段,问题一直会有,解决问题的手段也就一直有存在的必要。也许你听说过美国早期西部淘金热的时候,富起来的不是淘金者,而是为淘金者提供工具、水的人,甚至因为矿工需要结实耐磨的衣服,以致于牛仔裤风行起来并经久不衰。
  至于你提到“屠龙之技”之说,只是很多人因为不熟悉数据挖掘的内部技术而产生的莫测高深的感觉。其实,数据挖掘本身并不是新技术,它融合了来自于统计学、数据库和机器学习等多学科已经成熟的内容,冠上了一个看起来比较时髦的名字而已。
  组成数据挖掘的这三门支柱学科都已经发展了多年,也已得到了广泛的应用。那么我们也有理由相信它们的融合,能帮助我们解决更多的分析方面的问题。何况,业界还是有很多的成功案例,体现出数据挖掘所带了独特优势,而这些,是传统的BI(报表、OLAP等)无法支持的。

  以上说了不少数据挖掘的好话,下面再看看硬币的另一面。如果你是我的弟弟(呵呵,虽然我没有,但也和很多年轻的师弟师妹聊过择业的话题),我会建议你不做IT业,哈哈,一句半真半假的玩笑。因为在IT这个行业看起来还是满辛苦的,而且在很多项目中,常常需要重复一些没什么技术含量的任务,消耗的精力不少,获得的成就感却不多。

  Anyway,我的建议,其实也是我原来给自己的一句座右铭:认为对的就去做。找到自己的兴趣所在,并且感觉也有发展,那就尽力去做好了。

DMman:

问题2:如果我现在选择了数据挖掘,应该怎么做?

   您曾经在博客上回复一位北邮同学,建议熟悉学习各种算法;建立模型,创新思路改进算法撰写论文。

   我当前的计划是 学习各种算法的原理;学习java语言;研究weka源码,深入了解几种经典算法的步骤;学习了解ETL,数据仓库、OLAP等;通过使用的数据集建立挖掘模型;思考论文;有空的话 还得SPSS或其他一个流行软件的使用方法。其中,我觉得难点是对数据集的整理形成挖掘流程的输入。

   其中,我也有若干疑惑:掌握一门数据库是很重要的,但是没有时间一一了解SQL Server、Oracle、DB2等,但是在求职时,又说不定单位要求会哪门数据库!?我想就SQL Server单独进行深入的学习,包括学习在SQL Server中数据仓库的建立和数据挖掘的应用,其他的也就不管了。不知我这个选一而弃其他的打算可取不可取?

IDMer:

  从你的计划来看,还是对自己要掌握的知识和技能,划出了一个范围。看上去还不错,我只是从个人的经验出发,建议你不必苛求自己十八般武艺样样精通,很多方面只需基本了解,选择几个重点来练成自己的绝活。人的精力毕竟有限,目标越大就越难实现。
  至于选择那些作为重点,就需要在广泛了解的基础上,结合自己的兴趣进行筛选了。
  关于数据库的掌握,我觉得熟悉一种产品已经足够。SQL Server、Oracle、DB2都是关系数据库,在学生阶段把关系数据库的基础理论打牢,熟练运用SQL语句就可以了。这些主流数据库之间的差异,不是遵循的标准不同,而是产品的特性有别,以及在性能调优时的技巧。

DMman:

问题3:如何使学习阶段与行业应用靠拢?  
   有一位学长,建议我学技术的时候要和行业靠拢,否则,“没有行业背景的技术会很飘”。我觉得他说的有道理,技术是相当宽泛的,你不可能面面俱到;而且,当你实际工作后,也就专于一个行业,技术的需要面也就变窄了。这样,有利于学习重点,不至于在学习时,面面俱到,没有突出。

   但是,在数据挖掘方面,曾经请教过你,数据挖掘人员的工作性质。一种是在甲方做分析人员,利用所掌握的数据挖掘知识来解决一些业务问题。一种是在IT公司,为甲方实施DM、DW和BI等项目(前辈自己便属于此类?)。

   在这里,我不太明白作为甲方,日常具体做些什么?难道是类似于网管性质的?那样不更倾向于数据库管理人员?他们还算是专业的数据挖掘人员吗,怎么觉得公司不大会安排这样的职位呢?

   我比较倾向于做乙方,那样好像更专业似的。但是,乙方的话,都说数据挖掘在金融、电信、银行还是销售等方面主要应用。难道这意味着要学习或了解金融电信的背景、CRM、经济学、Excel……?

   还有,您曾提到,毕业后也可以做研究工作,我觉得提供研究工作的岗位毕竟是少的。而且,那样挣钱多吗(流汗中)?

   是否现在应该考虑以后进哪个(哪类)公司,现在根据它的要求来强化自己呢?

IDMer:

  你这位学长说得没错,脱离实际的纯理论大多会消散于无形。至于甲乙方的区别,实际上也没有想像中那么大,特别是对于刚刚参加工作的基层员工来说,可能差不多。
  先在乙方历练几年,然后跳到甲方,这种状况我看到不少。也许是因为在乙方接受的锻炼和学习到新知识经验的机会更多些吧,可以在年轻时有更多的积累。当然,如果有很好的在甲方工作的机会,也是不错的选择。
  到乙方工作,特别是对一直待在校园里的应届生来说,招聘方重点考察的大多是你的知识是否扎实、性格是否有利于融入团队等方面。至于对行业的了解,一般很少有过多的期望,除非你有多年在相关行业做项目的经验。
  国内的研究机构还是以科研院所和高校为主,待遇一般要比公司低,但也有很多人,包括我的师兄师姐以及同学,选择了继续做研究,因为他们会从研究中获得很多乐趣。另外一些研究机构是企业特别是外企的研究院,待遇也很好,但就要求你很出色才有机会加入。做研究还有一个很好的地方,就是国外的院校或研究所。

   
2007-5-13

博客原文:http://blogger.org.cn/blog/more.asp?name=idmer&id=24891


[此贴子已经被作者于2007-5-25 10:45:53编辑过]

--  作者:melon134
--  发布时间:5/24/2007 8:09:00 PM

--  
lz真厉害啊,说的真好
--  作者:roleplay
--  发布时间:5/25/2007 3:03:00 PM

--  
受教了,呵呵
--  作者:jay2jin
--  发布时间:5/27/2007 10:18:00 PM

--  
LZ  好佩服你    也许几年后的我就会像现在的你一样的    我现在正在学 java , sql server  
感觉学的东西还有好多好多    以前也有学长和我说过:没事的时候多去一些周边相关的企业跑跑,有机会就进去实践下,把自己学的理论知识实际化,并且可以调整自己未来要学习的方向      LZ     要是不介意就做我大哥吧     加我QQ     3 9 4 9 5 2 1 0 7
--  作者:DMman
--  发布时间:5/28/2007 8:37:00 AM

--  
多谢!
--  作者:zqpku
--  发布时间:6/17/2007 3:10:00 PM

--  
无语
--  作者:简装而行
--  发布时间:6/29/2007 6:18:00 PM

--  
讲得挺好的。
--  作者:teng_t1986
--  发布时间:7/1/2007 10:17:00 AM

--  
嗯,好文章!不介意的话,转走转走^-^
--  作者:teng_t1986
--  发布时间:7/1/2007 10:26:00 AM

--  
另外想问一下lz:你认为数学在数据挖掘这门学科中的地位如何?我看到那些问题基本都是讨论应用范畴,你认为数学在这门学科中要学到什么程度?谢谢!!
--  作者:DMman
--  发布时间:7/1/2007 9:59:00 PM

--  
1 随便转,前辈数据挖掘者对我们小生的教导,希望大家能多多受益.
2 数据挖掘的支撑学科之一就是统计学,它的若干算法及其算法的评估都用到了统计学的概念,如置信度等等.我个人觉得数学好固然有益,但是对于从事数据挖掘项目实施,而不是从事研究的话,对数学的要求不是很苛刻.因为在项目实施中,算法的应用是可以用机器代替人的.我觉得:能考上研究生了,程度就可以了(指学习的能力而不是当前的水平).
--  作者:teng_t1986
--  发布时间:7/3/2007 12:42:00 PM

--  
谢谢啦:)
但愿可以学好学精~~~
--  作者:DMman
--  发布时间:7/3/2007 2:34:00 PM

--  
说实话 数据挖掘好难啊
虽然看者那些算法倒是挺带劲的,但是应用起来真不容易啊.
一般那些成功应用数据挖掘的企业都是客户百万以上的大公司,公司小了数据少,数据少了挖掘出来的规律就可能不典型.想想吧,那么多的数据,等着你细致的处理,处理好了才能挖出宝,处理不好还不定挖出什么...
--  作者:lilang911
--  发布时间:7/4/2007 3:05:00 PM

--  
好东东,大家珍惜
--  作者:DMman
--  发布时间:7/4/2007 4:41:00 PM

--  
关于文中提到的 您曾经在博客上回复一位北邮同学,建议熟悉学习各种算法;建立模型,创新思路改进算法撰写论文。
鄙人认为,该文对所有的在读计算机研究生都有借鉴意义.
查看该文请到 http://www.ieee.org.cn/dispbbs.asp?boardID=69&ID=48189


--  作者:ycjjh
--  发布时间:7/7/2007 1:55:00 AM

--  
看看

--  作者:DMman
--  发布时间:9/10/2007 3:29:00 PM

--  
我把他顶上去
--  作者:chsffly
--  发布时间:9/22/2007 8:37:00 PM

--  
受益匪浅
--  作者:chsffly
--  发布时间:9/22/2007 8:38:00 PM

--  
支持
--  作者:sunny0311
--  发布时间:9/24/2007 11:11:00 AM

--  
了解很多东西,谢谢!
--  作者:Cat_Dim
--  发布时间:9/24/2007 2:19:00 PM

--  
很好!
不过要实现应用并非易事啊!
--  作者:fuwenjing111
--  发布时间:10/18/2007 3:51:00 PM

--  
有道理!
--  作者:decster
--  发布时间:10/19/2007 4:32:00 PM

--  
不错,收藏之
--  作者:zhenzixiong
--  发布时间:10/19/2007 7:11:00 PM

--  
我感觉到自己前途很渺茫啊
--  作者:shaoguow
--  发布时间:10/25/2007 9:32:00 AM

--  
有理,前段时间根据单位数据做了个数据挖掘模型,结果出来的时候,真的太开心了,可惜数据不全面,数据量也不大,没有起到很好的分析挖掘作用,结果道都在意料之中
--  作者:wl820609
--  发布时间:1/14/2008 4:01:00 PM

--  
受益非浅,谢谢楼主!!!
--  作者:netjian
--  发布时间:1/15/2008 12:18:00 PM

--  
学习了。
--  作者:fichellewff
--  发布时间:1/22/2008 3:35:00 PM

--  
甲方和乙方到底哪个更好?
--  作者:netjian
--  发布时间:2/14/2008 9:27:00 PM

--  
受用。
--  作者:linyungang
--  发布时间:2/22/2008 3:02:00 PM

--  
说的太好了,对我们这样刚毕业的大学生来说有很好的指导作用。我毕业后要到银行做研发,现在毕设就是做关于数据挖掘和垂直搜索方面的。谢了!
--  作者:leoleo2
--  发布时间:4/15/2008 12:43:00 AM

--  
我想做一个数据挖掘的工具,请问如何开始?
先谢了
--  作者:Doog
--  发布时间:7/5/2008 6:13:00 PM

--  
很好 很受用

--  作者:lxqneu
--  发布时间:7/7/2008 9:26:00 AM

--  
受益匪浅,学习
--  作者:xiaoyatou_00
--  发布时间:9/8/2008 5:01:00 PM

--  
看完后收益挺多的,至少知道自己现在应该干点什么!!有个努力的方向
--  作者:mylynn
--  发布时间:2/22/2009 4:07:00 PM

--  
谢谢
感觉很有用 不过还得自己坚持动手去学才行
--  作者:hongfei1014
--  发布时间:12/18/2009 4:13:00 PM

--  
厉害
受教了
W 3 C h i n a ( since 2003 ) 旗 下 站 点
苏ICP备05006046号《全国人大常委会关于维护互联网安全的决定》《计算机信息网络国际联网安全保护管理办法》
152.344ms