“我回去洗澡的时候仔细一想才发现你说的不对啊。”
“啥?”
“你先别开腔,我脑子很乱。我说话你别插嘴,等我说完你再说。第一,你说在公共办公楼给每个人安一个门,这当然不合理,为什么不安一个三米高的门,这样不管是谁,比姚明高的都能进;第二,你在混淆概念,之前你说测量有误差,后来怎么会到统计有差异了?第三,你说身高小于均值加上两倍$\sigma$的概率是95%,其实不止,是97%还要多。第四,你用简简单单的轻松口气就把5%的数据给扔了,是谁给你的权利?第五,如果资源不够,那是不是也可以直接把95%的人给扔了?…”
“好了吗?你先别急,你只不过是我幻想出来的对立面,你那么多问题,倒难到我了。你是要我一个一个的答,然后你一个一个的再问,还是让我一口气也回怼给你啊?”
“一个一个来。遇到问题我还要问。首先就说你有没有搞混?”
“确实,说错了就要认。我的确把测量误差和统计差异混为一谈了。在指标这一项来说,其实他们是并列的,没有什么递进关系。我又不是AI,我的知识、逻辑很有限,文字输出也不怎么行。诶,是不是至少说明我还是自己在敲字,而不是AI在代替我写东西啊?不过要是我让AI学了我所有的狗屁不同的东西,然后让他学到了我的不通的逻辑和语言习惯,那你还分得清吗?”
“等等,别岔开话题。我们聊的是指标。回头你有空自己再写关于AI替代你的博客吧。”
“好,第二个话题。你问为啥不修一个门。这个问题我也想问啊。事实上就是修的一个门啊。各家各户一般也就一个大门。”
“哈哈,尴尬了吧。”
“但,我的意思是,你进门得有个先后啊。虽然修了一个门,但一个门一般一次只能进一个人,最多两三个吧。那怎么做到公平?你说是不是?然后不就滑到我们之前的话题了。”
“等等,门不够宽,那就修宽点嘛。比如修一个可以10多亿人同时通过的门。”
“那跟没有门有区别吗?我们设置门的目的是啥?不就是防止想乱进的人进,并且让能进的按顺序进。”
“啊哈。那谁来定进门的顺序?要是门里面有啥好东西,谁都想排前面。”
“这是个好问题。所以我们就要定指标了啊,然后就和你最后一个问题绕到一起了。就是谁来定这个指标,这个指标定多少?”
“你还挺会绕啊。行吧,说吧,这个指标谁来定,怎么定?有人为被排除在外面的人主持公道吗?”
“这个问题很好。我真答不了,回头咱再思考思考。我现在只能用数据误差,反演误差来类比一下。”
“怎么讲?”
“之前我讲有些数据有误差,误差太大的就给删掉。主要目的就是为了获得稳定的可以解释大部分数据的关系。你叫规律也行,叫公式都可以。”
“不对劲,你的意思是为了公式,可以舍弃那些你想舍弃的吗?那你的公式也是基于你舍弃后的数据得到的,那你的公式也就只能解释你选的数据了啊。那对于我们以后的观测有什么指示和参考意义呢?”
“你说的很对,都是筛选过的。我们也不能否认那些误差很大的数据的意义。因为他们也可以提供非常多的信息。把他们都囊括进来,我们才可能得到完美准确的公式。但是,现实还是有限制条件的啊。第一,你要去拟合这些所有的异常点,你需要更多的参数。异常点越多,需要的参数越多,从而就需要更大的计算量。第二,存在过拟合的情况,就算你可以拟合上当前的误差,你得到的公式不过是用来解释当前的观测,用来一预测那就立马显原形。”
“你的意思是,删掉一些数据是我们不得已而为之咯。”
“没错。随着算力提升,我们也许可以囊括更多的数据,拟合出更完美的公式。”
Comments