八字 · 部落格
為什麼有時辰名人樣本不宜過度統計
Deep Oracle 編輯部 · 2026-08-12 · 約 4 分鐘
有明確出生時辰的名人樣本不是“可以排行”的大樣本,而是一個很小的高質量子集。本次複核 2,223 個名人 JSON,只有 53 個檔案有 0-23 的小時欄位;其中 39 個頁面標為 verified=true,14 個仍未通過完整校驗。這個規模足夠做完整盤案例和資料邊界教學,不足以推出“某個時辰更容易成名”。
先看子集本身
53 個已知時辰樣本里,男性 40 個,女性 13 個;年代分佈也不均勻,1940s 與 1980s 各 6 個,是最大的兩個十年桶,1920s、1960s、2010s 各 4 個。再往下很多年代只有一兩個樣本,還混有古代、近代與現代人物。
這說明它不是一個隨機人口樣本,而是公開資料更完整的人物集合。王室出生公告、出生證明、傳記記錄、地方檔案、書信或宮廷檔案,都可能讓時辰留下來;普通公眾人物即使日期可靠,小時也常常缺失。
小時分佈不能被寫成規律
按 0-23 小時看,最高的幾個小時也只有 4 個樣本:07、10、11 各 4 個;02、03、16、19、20 各 3 個;許多小時只有 1-2 個。這樣的數值不支援做排行榜,更不支援把某個時辰說成“更容易出名”。
如果把這些數字畫成圖,讀者很容易被柱狀圖誤導。4 與 1 的差距在 53 個樣本里看似明顯,但只要新增幾條資料就會改變排序。這裡的正確讀法是:已知時辰樣本稀少,分佈目前只能作為資料質量提示,不能作為命理結論。
來源等級比時辰排行更重要
這個子集真正有價值的地方,是提醒編輯先看來源類型。出生證明、官方公告、王室記錄、地方登記、傳記記錄、宮廷檔案的可信度不同;同樣寫“上午十點”,一條可能來自民事登記,另一條可能來自後人轉述。
因此有時辰頁面應優先標註三件事:時辰來自哪裡,是否精確到分鐘,頁面是否已經 verified。若來源只給“約某時”或“某時辰”,就應該在正文裡降低權重,把它當作候選時柱,而不是把它寫成確定事實。
這些樣本適合做什麼
53 個樣本適合做完整盤示範。因為時柱存在,頁面可以展示年、月、日、時四柱如何一起進入判斷,也可以說明為什麼缺時辰頁面不能隨便補時柱。它還適合訓練編輯規則:什麼時候能談時柱、什麼時候只能談三柱、什麼時候必須寫“時辰不詳”。
它不適合做三類內容:時辰成就排行、時辰性格斷語、某小時名人更多的結論。即使 07、10、11 小時現在各有 4 個樣本,這也只是當前站內資料形態,不是人群規律。
與完整語料的關係
完整名人庫的價值在於日期、職業、年代、性別、來源欄位可以做較穩定的資料質量審計;已知時辰子集的價值在於案例深讀。兩者不能混用。用 2,223 個檔案談公開名人資料的缺時辰現象是合理的;用 53 個檔案談全體名人的出生時辰傾向就越界了。
更穩的寫法是:“站內可用時辰樣本目前只有 53 個,適合四柱案例,不適合統計斷言。”這句話比任何時辰排行都更有資訊量,因為它告訴讀者該相信什麼、不該相信什麼。
後續怎樣提高結論強度
如果未來已知時辰樣本顯著增加,應先分層再判斷:verified 與未 verified 分開,出生證明與傳記轉述分開,現代與古代分開,職業標籤分開。只有在這些分層後仍然出現穩定現象,才可以寫成研究假設。
即便如此,結論也只能限定在“站內公開名人語料”之內。它不能外推到普通人群,不能替代個人命盤,也不能變成某個時辰優劣的說法。現階段,這一頁的核心任務就是把 53 個樣本的邊界說清楚。