八字 · 博客

为什么有时辰名人样本不宜过度统计

Deep Oracle 编辑部 · 2026-08-12 · 约 4 分钟

有明确出生时辰的名人样本不是“可以排行”的大样本,而是一个很小的高质量子集。本次复核 2,223 个名人 JSON,只有 53 个文件有 0-23 的小时字段;其中 39 个页面标为 verified=true,14 个仍未通过完整校验。这个规模足够做完整盘案例和资料边界教学,不足以推出“某个时辰更容易成名”。

先看子集本身

53 个已知时辰样本里,男性 40 个,女性 13 个;年代分布也不均匀,1940s 与 1980s 各 6 个,是最大的两个十年桶,1920s、1960s、2010s 各 4 个。再往下很多年代只有一两个样本,还混有古代、近代与现代人物。

这说明它不是一个随机人口样本,而是公开资料更完整的人物集合。王室出生公告、出生证明、传记记录、地方档案、书信或宫廷档案,都可能让时辰留下来;普通公众人物即使日期可靠,小时也常常缺失。

小时分布不能被写成规律

按 0-23 小时看,最高的几个小时也只有 4 个样本:07、10、11 各 4 个;02、03、16、19、20 各 3 个;许多小时只有 1-2 个。这样的数值不支持做排行榜,更不支持把某个时辰说成“更容易出名”。

如果把这些数字画成图,读者很容易被柱状图误导。4 与 1 的差距在 53 个样本里看似明显,但只要新增几条资料就会改变排序。这里的正确读法是:已知时辰样本稀少,分布目前只能作为资料质量提示,不能作为命理结论。

来源等级比时辰排行更重要

这个子集真正有价值的地方,是提醒编辑先看来源类型。出生证明、官方公告、王室记录、地方登记、传记记录、宫廷档案的可信度不同;同样写“上午十点”,一条可能来自民事登记,另一条可能来自后人转述。

因此有时辰页面应优先标注三件事:时辰来自哪里,是否精确到分钟,页面是否已经 verified。若来源只给“约某时”或“某时辰”,就应该在正文里降低权重,把它当作候选时柱,而不是把它写成确定事实。

这些样本适合做什么

53 个样本适合做完整盘示范。因为时柱存在,页面可以展示年、月、日、时四柱如何一起进入判断,也可以说明为什么缺时辰页面不能随便补时柱。它还适合训练编辑规则:什么时候能谈时柱、什么时候只能谈三柱、什么时候必须写“时辰不详”。

它不适合做三类内容:时辰成就排行、时辰性格断语、某小时名人更多的结论。即使 07、10、11 小时现在各有 4 个样本,这也只是当前站内资料形态,不是人群规律。

与完整语料的关系

完整名人库的价值在于日期、职业、年代、性别、来源字段可以做较稳定的资料质量审计;已知时辰子集的价值在于案例深读。两者不能混用。用 2,223 个文件谈公开名人资料的缺时辰现象是合理的;用 53 个文件谈全体名人的出生时辰倾向就越界了。

更稳的写法是:“站内可用时辰样本目前只有 53 个,适合四柱案例,不适合统计断言。”这句话比任何时辰排行都更有信息量,因为它告诉读者该相信什么、不该相信什么。

后续怎样提高结论强度

如果未来已知时辰样本显著增加,应先分层再判断:verified 与未 verified 分开,出生证明与传记转述分开,现代与古代分开,职业标签分开。只有在这些分层后仍然出现稳定现象,才可以写成研究假设。

即便如此,结论也只能限定在“站内公开名人语料”之内。它不能外推到普通人群,不能替代个人命盘,也不能变成某个时辰优劣的说法。现阶段,这一页的核心任务就是把 53 个样本的边界说清楚。

为什么有时辰名人样本不宜过度统计