大数据挖掘4个月,记录@挖了什么,谈谈理解。

基本情况:
7.15入职,职位为数据分析,职能为数据挖掘,大致九月开始正式接触工作,到目前主要做了离线数仓与建模两个方面的东西,日常工作以数据挖掘,构建维护离线数仓标签体系为主,兼任为业务部门提供数据分析,开发特定标签(特征),做机器学习建模等多种工作内容,下列所谈不代表所有,因职能不同所使用能力必然也不尽相同。:

工具使用:
hiveSQL:主力使用,日常大数据代码工作绝大多数依靠它在hive on mr完成 。

python  :主要为爬虫库,科学计算库,机器学习库,获取网上的数据构建离线数仓的维表需要用到爬虫,对维表数据进行本地分析,对用户数据在服务器环境建模需要用到numpy pandas sklearn 等库,平时日常进行文件处理,分析也可以用到python。

linux 以及shell:hadoop集群归根结底是部署在服务器上的,你的维表入库hive,不能出库(服务器)的数据都只能在服务器上进行数据处理,这就要求会linux常见处理命令,有的服务器并不会为你布置python环境,因此shell脚本也要熟悉。


数据挖掘与数据开发的差异在哪?

按个人理解,数据挖掘需要你去了解有哪些业务数据,能做出什么标签(特征),这些标签质量如何,如何更好的让建模人员使用这些标签,如何储存并必要时快速产生衍生标签, 有些维表数据需要数据挖掘人员去爬虫获取,手动维护等,以及思考这些标签有什么利用价值,建模?精确营销?质量评价?都是需要去思考的,其次才是为业务取数,写数仓的SQL代码,这些数据开发的代码工作,当然,你也可以自己生产机器学习的标签,这就跟用机器学习算法筛选特征一样,不过工作量和效果得自己衡量。数据开发而已就相当于少了一些环节,他们也会评估需求,但是基本是在已有的数据基础上,爬虫以及业务偏离的数据获取不是他们的工作内容。

学大数据课程时候需要掌握hadoop集群的搭建,环境的配置吗?

作为数据开发或挖掘人员来说,不用太掌握集群的搭建,这些有专门的运维人员在处理,公司一般有平台让你直接写SQL,提交spark程序等等,相比于环境的搭建,更需要掌握一下SQL调优的一些hive设置,当你的yarn队列资源充足时你不需要考虑这个,能跑出来就行,但是当application多了的时候,设置一些临时参数让你的代码跑得更快就很舒服了。当然,跑得慢不是你的问题,跑得快也不见得是好事

有时候想一想自己能调用上千核的CPU,几个t的内存还是挺牛哄哄的,暂时想到这么多,先写下来吧。删表跑路。



#数据挖掘##大数据开发##大数据##总结和分享#
全部评论

相关推荐

06-13 17:33
门头沟学院 Java
顺序不记了,大致顺序是这样的,有的相同知识点写分开了1.基本数据类型2.基本数据类型和包装类型的区别3.==和equals区别4.ArrayList与LinkedList区别5.hashmap底层原理,put操作时会发生什么6.说出几种树型数据结构7.B树和B+树区别8.jvm加载类机制9.线程池核心参数10.创建线程池的几种方式11.callable与runnable区别12.线程池怎么回收线程13.redis三剑客14.布隆过滤器原理,不要背八股,说说真正使用时遇到了问题没有(我说没有,不知道该怎么回答了)15.堆的内存结构16.自己在写项目时有没有遇见过oom,如何处理,不要背八股,根据真实经验,我说不会17.redis死锁怎么办,watchdog机制如何发现是否锁过期18.如何避免redis红锁19.一个表性别与年龄如何加索引20.自己的项目的QPS怎么测的,有没有真正遇到大数量表21.说一说泛型22.springboot自动装配原理23.springmvc与springboot区别24.aop使用过嘛?动态代理与静态代理区别25.spring循环依赖怎么解决26.你说用过es,es如何分片,怎么存的数据,1000万条数据怎么写入库中27.你说用limit,那么在数据量大之后,如何优化28.rabbitmq如何批次发送,批量读取,答了延迟队列和线程池,都不对29.计网知不知道smtp协议,不知道写了对不对,完全听懵了30.springcloud知道嘛?只是了解反问1.做什么的?短信服务,信息量能到千万级2.对我的建议,基础不错,但是不要只背八股,多去实际开发中理解。面试官人不错,虽然没露脸,但是中间会引导我回答问题,不会的也只是说对我要求没那么高。面完问我在济宁生活有没有困难,最快什么时候到,让人事给我聊薪资了。下午人事打电话,问我27届的会不会跑路,还在想办法如何使我不跑路,不想扣我薪资等。之后我再联系吧,还挺想去的😭,我真不跑路哥😢附一张河科大幽默大专图,科大就是大专罢了
查看30道真题和解析
点赞 评论 收藏
分享
评论
5
8
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务