Collections of Tips for Machine Learning

收集了一些我觉得真的有用实战机器学习的文章。比如如何调参，比如会遇到什么真实数据带来的问题，如何 debug，如何 speed-up。长期更新。

Advice for applying Machine Learning

主要集中在如何观察数据来选择方法。

How to Debug Learning Algorithm for Regression Model

主要都是讲回归中遇到的各种“预期不符”的结果。配合 ESL 第二章和第三章内容看效果加成。

训练深度神经网络的时候需要注意的一些小技巧

这篇是综合翻译，没给出都从哪节选的。我收集的英文版在下面：

Training Tricks from Deeplearning4j

deeplearning4j 的 googlegroups 也很推荐。这篇其实干货不多，但是也有一些了。包括对于训练的理解，并不全是干货般的总结。

Suggestions for DL from Llya Sutskeve

Hinton 亲传弟子介绍深度学习的实际 tricks，包括data, preprocessing, minibatches, gradient normalization, learning rate, weight initialization, data augmentation, dropout和ensemble。

Efficient Training Strategies for Deep Neural Network Language Models

讨论了如何设置 batch-size, initial learning rate, network initialization，但最有趣的结论应该是：普通的 deep feed-forward architecture比recurrent NN 在 model long distance dependency 效果和效率都更好。

Neural Networks Best Practice

Uber 的 data scientist 写的。比如: Rectifier is becoming popular as an activation function. However, I find its theory dubious and my experiments have not shown that it is always better. That said, I’m experimenting with new activation functions. (Little trivia: I’m borrowing many ideas from my graduate work in computational wave propagation.)

Large-scale L-BFGS using MapReduce

NIPS’14 的论文，简单并行化 LBFGS里面的双循环（最耗时，计算量巨大）。

特征工程选择系列

特征工程系列文章：Part1.单变量选取 Part2.线性模型和正则化 Part3.随机森林 Part4.稳定性选择法、递归特征排除法(RFE)及综合比较。有 Python 代码。

机器学习代码心得之有监督学习的模块 机器学习代码心得之迭代器和流水处理

新一代大神陈天奇怪的系列文章，有兴趣的直接顺着看吧。

STOCHASTIC GRADIENT BOOSTING: CHOOSING THE BEST NUMBER OF ITERATIONS

Kaggle达人YANIR SEROUSSI告诉你如何选择Stochastic Gradient Boosting的训练最佳iteration超参数。不过我比较存疑，因为如果条件允许，当然迭代的越多越好……

Large-Scale High-Precision Topic Modeling on Twitter

Twitter 高级研究员的 KDD’14论文。有不少实用技巧，比如短文本特征，LR结果概率化修正，正样本抽样，PU学习后负样本选取。

How transferable are features in deep neural networks?

也是争议比较大的一篇文章，finetuning 有一定帮助，但是不够细致。