数据处理不等式：Data Processing Inequality

时间：2017-11-02 13:17:06 阅读：165 评论：0 收藏：0 [点我收藏+]

标签：ima font 处理统计量 log size 为什么 style process

我是在差分隐私下看到的，新解决方案的可用性肯定小于原有解决方案的可用性，也就是说信息的后续处理只会降低所拥有的信息量。

那么如果这么说的话为什么还要做特征工程呢，这是因为该不等式有一个巨大的前提就是数据处理方法无比的强大，比如很多的样本要分类，我们做特征提取后，SVM效果很好，但是如果用DNN之类的CNN、AuToEncoder，那么效果反而不如原来特征。这样就能理解了，DNN提取能力更强，那么原始就要有更多的信息，在新特征下无论怎么提取，信息就那么多。

信息量越多越好么？肯定不是，否则为什么PCA要做降噪和去冗余呢？我们的目的是有效的信息最大化。

另外一种理解就是从互信息不为0（信息损失）来解释。

技术分享

从而

技术分享

那么如何在处理过程中不丢失有效信息呢？这时候就需要数学上的充分统计量，也就是g是y的充分统计量。

数据处理不等式：Data Processing Inequality

标签：ima font 处理统计量 log size 为什么 style process

原文地址：http://www.cnblogs.com/hxsyl/p/7771486.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行