“你说的指标是指什么?”
“有点像标准、准则,主要是用来筛选数据的。”
“我倒是很好奇,你不单只想说数据吧。行,你先说说数据里面的指标。”
“你知道吧,做过简单物理实验,测过物体长度吧?”
“那还用说?”
”你知道我们测量会有误差吧。由于空气波动、光线、手抖等各种问题,你测量出的结果往往存在误差,也可以说精度存在限制,例如一般的尺子,在亚毫米级的时候就已经需要估计,需要猜了。而猜的部分是很大的误差来源了,且不是唯一误差或干扰来源。“
“误差和这个指标有什么关系,脑子别乱跑啊,你。”
“误差或着干扰是天然存在的,你不能把这些包含巨大干扰的数据拿来拟合吧。拟合出来就真的是说不清楚了,甚至可能没有意义。有些时候用这些数据来进行下一步科学研究时,我们就会对其进行筛选和剔除。筛选和剔除是需要一个准则的。这就是我说的指标。”
“哦,你的意思是,你喜欢的数据留下,不喜欢的就扔了是吧?”
“你这么说是不是不太相信科研学者的道德标准啊。当然,我们不能排除有些学者就是这样。这叫先射箭再画靶。你先预设有一个结论,然后根据结论反推,符合结论的数据留下,不符合的删掉。这不是科研,这是做菜。我说的指标是要一刀切的。例如你定义一个信噪比,也就是信号和噪声强度的比值。你说经过统计,信噪比大于5的数据占到95%。因此我们对数据进行信噪比为5的一刀切。信噪比小于5的就不要了。做科研需要做到对你使用的参数,指标给出合理的解释。例如你有理论支撑,或者你经过了大量的测试又或者你说,别人都是那么用的。”
“啊哈,那你说为什么是95%?”
“很好,这也是一个标准,是个指标。一般我们在现实当中的观测都符合高斯分布。高斯分布中的$\sigma$是标准差,用来描述这些测量的差异。例如测量值在均值的正负两个$\sigma$值内的概率就是95%。”
“为什么是两个$\sigma$?”
“刚才说了,测量总会有误差。你不可能拿到pure,也就是真正干净的数据。就像人和人之间是有差异的。我们只筛除掉和平均值差异很大的数据。这样得出的结论才是符合大多数观测的。例如我们要设计一个门的高度的时候,我们肯定把全国成年人的身高数据拿来进行分析。我们会得到一个平均身高,然后还有一个标准差$\sigma$,我们就把门的高度设计为平局值加两倍$\sigma$。这个时候我们其实已经排除了像姚明那些超过两个标准差以外的人。如果我们把他们都考虑进来,那做出来的门就不实用。例如我们的门都定在2米5,那很多时候这最后的半米都用不上。这不就浪费了吗?至于姚明的话,进某些门就只能屈尊弯腰了。”
“你举的门这个例子挺有意思,我听懂了。但是我有个疑问。为什么要整这么一个标准。为什么不每家每户,或者每个人都按照家庭成员给安一个门。各自走各自的门不就行了吗?”
“你说得很对。这叫做公平。但有两个问题你没有考虑到。第一,家里会有小朋友和老人。小朋友的身高会变,老人会过世,那你的门怎么办?第二,现在的资源也难以满足这种情况。例如我们都要去同一个部门办公,那这个办公楼就应该修他个几千万上亿个门,适合不同身高的人走。不说你钱财、物料够不够,只说这个办公楼占地恐怕也是问题。”
“哦,我懂了,你是说由于资源和能力的限制以及效率的均衡考虑,我们没有办法照顾到每一个人。因此才需要搞标准。”
“你说的对。但是又出现了问题。当一个指标变成目标以后,它往往就不再是一个好指标了。”
“你说的这个我就不懂了。回头再向你请教吧。”
“诶,不留下来吃个饭再走吗?”
Comments