排名用的成交量是平台自己报的,一篇论文用 3 种检验查过 2019 年 29 家平台的刷量
排名页上那个「24 小时成交量」,源头是各家平台自己的系统。买卖都在平台内部撮合,数据站通过平台开放的接口把数字取回来,再加总、排序。数据站不在撮合现场,拿到的是平台报出来的数。
这件事有人拿数据查过。Cong、Li、Tang、Yang 四位作者的论文《Crypto Wash Trading》用 3 种统计检验去看 29 家平台 2019 年的逐笔成交记录,估出其中未受监管的平台平均有七成以上的报告成交量是对敲出来的。这个数字只对应那一年、那一批平台。
这篇讲什么
01成交量排名上的数是谁报的,为什么会失真
拿一家数据站的说明来看。CoinGecko 的 Methodology 页上,数据的来路是一句话:收集已接入的各家平台上全部交易对的价格、成交量和流动性数据。一家平台的成交量,就是它所有交易对成交量的总和。论文用的逐笔记录也是同一个来路,每一笔都通过平台的官方 API 取得。衍生品平台在这一页上更直接:没有评分,按「as reported」的持仓量和成交量排名。
也就是说,数据站是汇总的一方,原始数字出在平台手里。
刷量的做法叫对敲(wash trading):同一方既当买家又当卖家,自己和自己成交。账面上多了一笔成交量,实际没有资产换手。对敲的如果是平台自己,手续费也是付给自己的。
动机在论文里有交代:平台有很强的经济动机把成交量做大,用来提高知名度,以及在第三方聚合网站和媒体上的排名。论文对照的那家行情网站,当时的平台排名由成交量决定。作者还估了一个数:报告成交量里有 70% 是对敲的话,能让一家平台的名次往前挪 46 位。
02论文查刷量的 3 种检验,各自看什么
3 种检验用的都是同一份材料:每家平台每一笔成交的数量。思路是先找出真实交易普遍会有的统计特征,再看哪家平台的数据没有这些特征。
一、首位数字的分布
看的是每笔成交数量的第一位有效数字。大量自然产生的数据里,首位是 1 的约占三成,往后逐个减少,首位是 9 的不到 5%,这条规律叫本福特定律。论文把每家平台的首位数字比例统计出来,和这条规律对照。
为什么交易数据该符合它,作者举的例子是一位把收益全部再投进去的资金管理人:赚了,每笔的数量跟着变大,亏了就变小,资金是一轮一轮乘出来的,这类过程产生的数字符合本福特定律。程序批量造出来的成交数量,如果没有照着这个分布去造,首位数字的比例就会走样。
二、成交数量取整
人下单时习惯拿整数当参照(论文引的是认知心理学的研究),比如买 0.5 个、买 100 个。所以把真实成交的数量画成柱状图,整齐的数量上会冒出一根根高柱。
论文的判断是,对敲靠自动交易程序完成,程序没有这种习惯,取整的成交占比偏低的平台就可疑。这一项同时是论文估算刷量比例的基础:拿受监管平台当基准,估出一家平台正常情况下该有多少不取整的成交,多出来的部分算作对敲量。
三、大单那一段的分布
看的是数量特别大的那部分成交。传统金融市场里,单子越大越少见,而且少得有规律,统计上叫幂律分布,俗称「肥尾」。论文的解释是这和大资金的做法有关:大户为了少推动价格,会控制每一笔的大小。作者把每家平台大单那一段拿出来,看它贴不贴合这种形状,贴合不上的记为异常。
| 检验 | 看哪个数 | 真实交易里的样子 | 论文记为异常的情形 |
|---|---|---|---|
| 首位数字 | 每笔成交数量的第一位有效数字 | 1 开头的多,9 开头的少 | 各个数字的占比偏离本福特定律 |
| 数量取整 | 整齐数量的成交占多少 | 整齐的数量上有明显的高柱 | 高柱不明显,不取整的成交偏多 |
| 尾部分布 | 大单的数量怎么分布 | 越大越少,符合幂律 | 大单那一段贴合不上幂律 |
03「七成以上是假量」说的是哪一年、哪批平台
样本是这样的:时间从 2019 年 7 月 9 日到 11 月 3 日,不到四个月;对象是 29 家平台上比特币、以太坊、莱特币、瑞波币四种币对美元的交易(以 USDT 计价的交易对,论文当作对美元一并算入),共约 4.48 亿笔成交;数据来自第三方评级机构 TokenInsight。
29 家平台分成三组。持有纽约州金融服务部 BitLicense 的 3 家算「受监管」。其余 26 家算「未受监管」,再按网站访问量排名分成两档:第一档 10 家,第二档 16 家。所以这里的「受监管」含义很窄,只指纽约州这一张牌照。
结果是:3 家受监管平台的成交记录带着金融市场里常见的那些统计特征,论文的判断是看不出对敲的迹象。未受监管的平台上,对敲量平均占报告成交量的七成以上,其中访问量靠前的第一档是 53.4%,第二档超过 80%。
这套估法有一个前提:真实的程序化交易也会产生不取整的成交,估算时和对敲量分不开;作者自己写明,混进了这类成交的话,这个估计更该看作上限。作者另外说明,这几种检验没有穷尽所有手法。
论文里按平台列出的结果是 2019 年的数据,拿来给今天的平台下判断不合适。
这篇论文的摘要和发表信息在 NBER 第 30783 号工作论文页,样本和检验的细节在 arXiv 上的全文,正式版 2023 年刊于《Management Science》;数据站的内容来自 CoinGecko 的 Methodology 页。几处页面都是 2026 年 10 月打开时的版本。
04不会跑统计,普通人能核对成交量的哪几处
论文那 3 种检验要拿到几亿笔逐笔记录才能做,个人做不了。能做的是换几个不依赖成交额的角度去看。
看数据站怎么算分
数据站自己也没有只用成交额。CoinGecko 的 Methodology 页列了它给交易对算 Trust Score 时考虑的几项:平台网站的访问量(用 SimilarWeb 的数据)、盘口价差和 ±2% 深度、总成交量、成交频率、异常值检查。给现货平台整体算分时,列的项目有流动性、监管、网络安全、过往事故和储备金证明。分数在列表里用绿、黄、红标出来。同一页还提到,算平台成交量时会剔除因数据不一致被拉黑的交易对,以及超过 3 小时没有更新的交易对。
建议的做法:打开你常看的那家数据站,找到它的方法说明页,确认你眼前这张榜是按什么排的。按原始成交额排的榜,和按综合评分排的榜,名次可以差很多。再找第二家数据站对一遍,两边名次差得远的平台,先去看它的盘口。
看盘口,不看成交额
成交额是已经发生的事,你没法验证。盘口是此刻挂在那里的单子,你下单时面对的就是它。打开你打算买的那个交易对,做三件事:
- 看买一和卖一差多少。卖一价减买一价就是价差。主流币的交易对上,这个差如果占价格的比例明显比别家大,说明挂单的人少。
- 拿你打算下的金额去比。把卖盘从卖一往上加,看要吃掉几档才够你的金额。一档就够,这个盘口对你这笔单子来说够深。
- 换一个时段再看一次。挂单量在不同时段会变,只看一眼不够。
成交额很大而盘口很薄,这两件事放在一起是对不上的,我会把它当成一个要多留心的信号。盘口浅对成交价的影响,在模拟盘练不到的那几样里的滑点一段讲过。
访问量可以当旁证
论文给未受监管平台分档,用的就是网站访问量排名;数据站的评分里也有这一项。访问量和成交量差得太悬殊的平台,值得多看一眼。它只能当旁证用,单凭这一项下不了结论。
05成交量排名高低,和第一笔小额试水有多大关系
关系很小。
一笔小额的单子能不能按你看到的价格成交,取决于那个交易对盘口最上面几档有多少挂单,这个你下单前自己就能看到。平台全站一天成交多少亿,回答不了这个问题。
小额试水真正要验证的是另外几件事:钱能不能充进去、费用是不是和页面上写的一样、能不能原路提出来。成交量排名对这三件事都没有说法。金额怎么定、先做哪一步,在第一笔钱该投多少、按什么顺序试里。这一笔按可能全亏来定金额。
排名高也推不出平台安全。成交量讲的是交易有多活跃,用户资产怎么托管、平台出了事怎么办,是另一套要核对的东西,办法在账户、托管、平台风险分三层核对里。
排名在一个地方还用得上:筛掉盘口明显没人的平台。我的建议是把它当成第一道粗筛,筛完就放下,后面的判断交给盘口和那一笔小额的实际结果。