首页 → 技术方案

背景：

阅读新闻

可用于数据挖掘的R包和函数的集合

[日期：2015-01-19]

来源：CSDN博客作者：wide288

[字体：大中小]

数据挖掘

1、聚类

常用的包： fpc，cluster，pvclust，mclust
基于划分的方法: kmeans, pam, pamk, clara
基于层次的方法: hclust, pvclust, agnes, diana
基于模型的方法: mclust
基于密度的方法: dbscan
基于画图的方法: plotcluster, plot.hclust
基于验证的方法: cluster.stats

2、分类

常用的包：

rpart，party，randomForest，rpartOrdinal，tree，marginTree，

maptree，survival
决策树: rpart, ctree
随机森林: cforest, randomForest
回归, Logistic回归, Poisson回归: glm, predict, residuals
生存分析: survfit, survdiff, coxph

3、关联规则与频繁项集

常用的包：

arules：支持挖掘频繁项集，最大频繁项集，频繁闭项目集和关联规则

DRM：回归和分类数据的重复关联模型
APRIORI算法，广度RST算法：apriori, drm
ECLAT算法：采用等价类，RST深度搜索和集合的交集： eclat

4、序列模式

常用的包： arulesSequences
SPADE算法： cSPADE

5、时间序列

常用的包： timsac
时间序列构建函数： ts
成分分解: decomp, decompose, stl, tsr

6、统计

常用的包： Base R, nlme
方差分析: aov, anova
密度分析: density
假设检验: t.test, prop.test, anova, aov
线性混合模型：lme
主成分分析和因子分析：princomp

7、图表

条形图: barplot
饼图: pie
散点图: dotchart
直方图: hist
密度图: densityplot
蜡烛图, 箱形图 boxplot
QQ (quantile-quantile) 图: qqnorm, qqplot, qqline
Bi-variate plot: coplot
树: rpart
Parallel coordinates: parallel, paracoor, parcoord
热图, contour: contour, filled.contour
其他图: stripplot, sunflowerplot, interaction.plot, matplot, fourfoldplot,
assocplot, mosaicplot
保存的图表格式: pdf, postscript, win.metafile, jpeg, bmp, png

8、数据操作

缺失值：na.omit
变量标准化：scale
变量转置：t
抽样：sample
堆栈：stack, unstack
其他：aggregate, merge, reshape

9、与数据挖掘软件Weka做接口

RWeka: 通过这个接口，可以在R中使用Weka的所有算法。

0
顶一下

收藏推荐打印 | 录入： | 阅读：次

基于云的大数据解决方案的十大考虑因素

大数据分析之——k-means聚类中的坑

相关新闻数据挖掘数据

如何在分布式架构下完美实现“全局 (10月26日)
12种Python机器学习&数据挖掘工具 (10月24日)

本文评论　　查看全部评论 (4)

评论声明

尊重网上道德，遵守中华人民共和国的各项有关法律法规
承担一切因您的行为而直接或间接导致的民事或刑事法律责任
本站管理人员有权保留或删除其管辖留言中的任意内容
本站有权在网站内转载或引用您的评论
参与本评论即表明您已经阅读并接受上述条款

推荐阅读