ITPub博客

首页 > 大数据 > Hadoop > 京东大数据R语言应用-笔记

京东大数据R语言应用-笔记

Hadoop 作者:alunxiaoai 时间:2014-02-28 01:12:02 0 删除 编辑

一:基础知识1:R的统计功能(已经实现现有及未来的统计模型)探索性语言?2:R的功能扩展包,基本覆盖了高级语言的功能,抽数,过滤,计算,图形,网络3:R与Hadoop的并行集群处理大数据,需要额外编程,实际运用少4:R自身的扩展包进行单机处理大数据,加速内核包,内存计算,向量化编程加速,GPU计算5:数据流:DB和log->清洗和预处理二:商业应用-电商分析1:广告位指标,特点分析,点击2:某品类下,评论突出指标(统计),识别出一些问题,算P值,求均值3:好评/差评分析4:兴趣模型,单个用户比较喜欢买哪几类商品。浏览次序矩阵化,X*P=Y,求P值5:评论的文本挖掘分析,新词识别6:价格弹性,促销,降价一块钱,销量变动情况,商品的性别色彩7:不良商品识别,从流失客户或者新加客户的行为,反推有问题的商品,有缺失的服务,水军识别8:分群模型,对用户分类分群9:购买模型10:搜索关键词模型11:销量预测模型12:促销兴趣度,全网计算,几百万级别计算13:潜在用户识别三:总结和思考1:抽样和全样的平衡2:数据挖掘的环境,集群和单机,集群编程的代价3:DM模型,业务导向还是模型导向?站在业务角度用一个简单模型搞定,一个模型搞不定所有问题。4:开源和闭源5:Hadoop好用,速度快6:回归数据的本质,数据和模型,有价值是背后业务和逻辑,数据是有时效性的。四:常用R语言包1、聚类常用的包: fpc,cluster,pvclust,mclust基于划分的方法: kmeans, pam, pamk, clara基于层次的方法: hclust, pvclust, agnes, diana基于模型的方法: mclust基于密度的方法: dbscan基于画图的方法: plotcluster, plot.hclust基于验证的方法: cluster.stats2、分类常用的包:rpart,party,randomForest,rpartOrdinal,tree,marginTree,maptree,survival决策树: rpart, ctree随机森林: cforest, randomForest回归, Logistic回归, Poisson回归: glm, predict, residuals生存分析: survfit, survdiff, coxph3、关联规则与频繁项集常用的包:arules:支持挖掘频繁项集,最大频繁项集,频繁闭项目集和关联规则DRM:回归和分类数据的重复关联模型APRIORI算法,广度RST算法:apriori, drmECLAT算法: 采用等价类,RST深度搜索和集合的交集: eclat4、序列模式常用的包: arulesSequencesSPADE算法: cSPADE5、时间序列常用的包: timsac时间序列构建函数: ts成分分解: decomp, decompose, stl, tsr6、统计常用的包: Base R, nlme方差分析: aov, anova密度分析: density假设检验: t.test, prop.test, anova, aov线性混合模型:lme主成分分析和因子分析:princomp7、图表条形图: barplot饼图: pie散点图: dotchart直方图: hist密度图: densityplot蜡烛图, 箱形图 boxplotQQ (quantile-quantile) 图: qqnorm, qqplot, qqlineBi-variate plot: coplot树: rpartParallel coordinates: parallel, paracoor, parcoord热图, contour: contour, filled.contour其他图: stripplot, sunflowerplot, interaction.plot, matplot, fourfoldplot,assocplot, mosaicplot保存的图表格式: pdf, postscript, win.metafile, jpeg, bmp, png8、数据操作缺失值:na.omit变量标准化:scale变量转置:t抽样:sample堆栈:stack, unstack其他:aggregate, merge, reshape9、与数据挖掘软件Weka做接口RWeka: 通过这个接口,可以在R中使用Weka的所有算法。  

 

<!-- 正文结束 -->

来自 “ ITPUB博客 ” ,链接:http://blog.itpub.net/7729084/viewspace-1119760/,如需转载,请注明出处,否则将追究法律责任。

上一篇: 没有了~
下一篇: 没有了~
请登录后发表评论 登录
全部评论