机器学习的相关书籍

2021-11-21 09:10:53

《Introduction to Data Mining》

《Data Mining : Concepts and Techniques》

《Introduction to Machine Learning》

《机器学习：实用案例解析》

《Pattern Recognition and Machine Learning》

《The Elements of Statistical Learning》

《Machine Learning: A Probabilistic Perspective》

第一本比较偏Bayesian；第二本比较偏Frequentist；第三本在两者之间，但我觉得跟第一本差不多，不过

加了不少新内容。当然除了这几本大而全的，还有很多介绍不同领域的书，例如《Boosting Foundations and

Algorithms》，《Probabilistic Graphical Models Principles and

Techniques》；以及理论一些的《Foundations of Machine Learning》，《Optimization

for Machine Learning》等等。这些书的课后习题也非常有用，做了才会在自己写Paper的时候推公式。

论文

包括几个相关会议：KDD，ICML，NIPS，IJCAI，AAAI，WWW，SIGIR，ICDM；以及几个相关的期刊：TKDD，TKDE，JMLR，PAMI等。跟踪新技术跟新的热点问题。当然，如果做相关research，这一步是必须的。例如我们组的风格就是上半年读Paper，暑假找问题，秋天做实验，春节左右写/投论文。

经典算法。有几个部分：

a. 关联规则挖掘 (Apriori, FPTree, etc.)

b. 分类 (C4.5, KNN,

Logistic Regression, SVM, etc.)

c. 聚类 (Kmeans, DBScan, Spectral Clustering,

etc.)

d. 降维 (PCA, LDA, etc.)

e. 推荐系统

(基于内容的推荐，协同过滤，如矩阵分解等)

然后在公开数据集上测试，看实现的效果。可以在下面的网站找到大量的公开数据集：UCI Machine

Learning Repository/

3. 跟踪热点问题。例如最近几年的Recommendation System，Social Network，Behavior

Targeting等等，很多公司的业务都会涉及这些方面。以及一些热点技术，例如现在很火的Deep Learning。

学习大规模并行计算的技术，例如MapReduce、MPI，GPU

Computing。基本每个大公司都会用到这些技术，因为现实的数据量非常大，基本都是在计算集群上实现的。

参加实际的数据挖掘的竞赛，例如KDDCUP，或 Kaggle: Go from Big Data to Big Analytics/

上面的竞赛。这个过程会训练你如何在一个短的时间内解决一个实际的问题，并熟悉整个数据挖掘项目的全过程。

参与一个开源项目，如上面提到的Shogun或scikit-learn还有Apache的Mahout，或为一些流行算法提供更加有效快速的实现，例如实现一个Map/Reduce平台下的SVM。这也是锻炼Coding的能力。

机器学习的相关书籍

继续阅读

查找算法学习之二分查找（Python版本）——BinarySearch

CQ V1.0分词bates(基于双数组tire树)—应该是目前最快的中文分词算法

Command Network(POJ 3164)---定根最小树形图模板题题目描述输入格式输出格式输入样例输出样例分析源程序

开源低带宽语音编解码器

241 Different Ways to Add Parentheses（C代码版）

【趋高机器视觉】机器视觉技术原理解析及解决方案

(SpringBoot)日志种类：log、monitor、access、out、gc、backup

CSMA/CD1． CSMA/CD的概述2． CSMA 的工作原理3． CSMA/CD控制规程及特点4． CSMA/CD协议5． CSMA/CD的优点6．结束语

极大似然法(ML)与最大期望法(EM)

C++ 第十五周报告1--《冒泡法排序》

笔试面试题目：滑动窗口(二)

数据结构与算法（27）——排序（二）

Dijkstra--简易版（最短路径）

GitHub连夜封杀！这份阿里 10W 字内部 Java 字面试手册到底有多强？

Linux设备模型（中）之上层容器

hdu7108哈希