欧科云链研究院:美国大选尘埃落定,拜登选票造假了吗?
美国大选几经反转,终于尘埃落定,拜登目前以290票击败232票的特朗普,将成为下一任美国总统。然而拜登选举欺诈的传闻也甚嚣尘上,最初拜登选票造假的质疑基于本福特定律,后来陆续有重复计票等消息传出。本福特定律是宇宙中许多数据都适用的规律,虽不能作为直接证据,但常被用于探测数据造假。本文介绍了本福特定律,并且应用到区块链行业,找出满足本福特定律的数据指标,并从本福特定律的视角考察链上数据的合理性。
一、本福特定律:广泛存在的数据规律
1. 广泛存在的自然规律
就像牛顿因苹果落地发现了万有引力定律,西蒙·纽康和弗兰克·本福特因翻对数表发现了本福特定律。根据本福特定律,对于许多数据样本,第一位数字是1的概率远远大于其他数字,并且数字越大,出现的概率越小。具体而言,对于最常用的10进制数字,首位数字出现的概率如下:
人口、GDP、面积等数据被验证符合本福特定律,甚至斐波那锲数组、放射性元素半衰期等绝对自然的数据也满足本福特定律。但本福特定律是一个经验性的自然规律,没有严格的证明推导。通常来讲,本福特定律的适用条件如下:
(1)样本数量和数量级跨度尽可能大。如跨度小的身高数据不适用,但实践表明,对一些较小样本数据也适用;
(2)数据不能有人为操控的痕迹。人为规定的数字如电话号码、邮编等不满足本福特定律。当数据被人为篡改后,很可能不符合本福特定律,也正因此,本福特定律可以被用来探测数据造假;
(3)对于随着时间呈指数型增长的数据,本福特定律一定契合。这一点是可以从数学上严格证明的,在b进制中数字n出现的概率即P=〖log〗_b (n+1)/n。这类数据的特点是早期增长迟缓,后来增长得越来越快;数据本身有自己的分布规律则很可能不符合本福特定律。如收益率不满足本福特定律。
人口、GDP、营业收入、播放量、交易量等数据由于规模效应或者网络效应,早期从1到2很艰难,但发展到一定规模后,从8增长到9相对容易,所以在较小数字停留时间长,在较大数字停留时间短,最终数字首位分布呈现出本福特定律。
2. 用于探测数据造假
本福特定律常用于探测数据造假,尤其是财务数据中。2003年美国华盛顿州诈骗案中,最初是会计师Darrell Dorrell用本福特定律发现了支票汇款数据的不合理性,通过进一步调查发现了涉案金额高达1亿美元的诈骗。无独有偶,安然公司2000-2001年的每股盈利也与本福特定律相去甚远。事实上,自20世界70年代以来,本福特定律被广泛用于挖掘会计欺诈性行为。
除了金融财务领域,本福特定律也被用于其他领域的数据,如2009年的伊朗大选、希腊政府的宏观经济数据、公共计划经济数据,比尔·克林顿的纳税申报数据……
但值得注意的是,本福特定律不能作为呈堂供证,只能作为数据造假的推测,需要后续的取证调查。即使是在华盛顿州诈骗案这一成功应用案例中,会计师Darrell用本福特定律的检验只是开始,历经多方努力和3年的搜证才将主犯凯文·劳伦斯(Kevin Lawrence)送进监狱,判处20年徒刑。加之,本福特定律在某些领域的适用性存在争议,如哈佛大学一份研究表明本福特定律不适用于选票数据。基于以上原因,网友对拜登选票进行本福特定律检验,在适用性和说服力上存在问题,不能作为选票造假的直接有力证据。
二、本福特定律在区块链领域的应用
上文讲述了本福特定律的一般性应用,下文立足于区块链行业,挖掘哪些指标满足本福特定律,并结合区块链技术的特性探讨链上数据的合理性。
1. 区块链行业中适用本福特定律的数据
由前文可知,一些宏观数据如人口、GDP、面积等符合本福特定律。在区块链行业,区块链专利数量、企业数量等宏观数据也满足本福特定律。下图展示了2020年至今各省市的区块链专利数量和Wind全球企业库中的区块链企业数量,其首位分布均较符合本福特定律。
除此之外,区块链行业中的财务数据也是本福特定律的典型适用场景,下文的数据来自区块链指数成分股。
2. 从本福特定律视角看链上数据的合理性
版权保护: 本文由 沃派博客-沃派网 编辑,转载请保留链接: http://www.bdice.cn/html/96967.html