在充斥著不確定性的金融市場中,隨機雜訊往往會偽裝成高獲利的交易策略。每一天,都有無數的計量分析師 (Quantitative Analysts) 聲稱他們發現了能夠擊敗市場的聖杯。然而,這其中有多少是真正的超額報酬 (Alpha),又有多少只是倖存者偏差下的隨機漫步?
要剝開這層迷霧,我們必須回到統計學的第一性原理。假說檢定 (Hypothesis Testing) 正是計量金融中最冷酷無情的篩選器,它用嚴格的機率法則,將市場敘事中的運氣成分徹底剝離。
主流的量化敘事往往過度迷信模型的回測績效與顯著性,卻忽略了現實市場的摩擦力與動態機制。
假說檢定的本質,並非為了「證明」某個交易策略有效,而是為了評估在「策略無效」的假設下,出現當前回測結果的機率有多微乎其微。真正的量化投資人清楚明白:統計顯著性不等於實務上的經濟顯著性 (Economic Significance);如果忽略了交易成本 (Transaction Costs) 與風險調整 (Risk Adjustment),再完美的檢定結果也只是實驗室裡的數字遊戲。
任何嚴謹的假說檢定都建立在六大基石之上,而其核心邏輯是設立一個我們試圖推翻的虛無假說 (Null Hypothesis)。
檢定統計量是我們將樣本數據標準化後的產物,用於衡量樣本結果與假說參數之間的偏離程度。其基礎公式為:
當樣本統計量為樣本平均數 (Sample Mean) 時,標準誤 (Standard Error) 的計算取決於母體標準差 (Population Standard Deviation, ) 是否已知。若母體標準差已知:
若母體標準差未知,則必須使用樣本標準差 (Sample Standard Deviation, ) 進行估計:
在決策邊界上,我們無可避免地會面臨兩種誤判的風險:
檢定力 (Power of a Test) 則被定義為正確拒絕錯誤虛無假說的機率:
在給定樣本數 (Sample Size) 的情況下,降低型一錯誤的機率,必定會增加型二錯誤的機率。這是一場風險與報酬的極致妥協。
在評估策略時,我們常使用 p值 (p-Value) 來衡量證據的強度。p值代表在虛無假說為真的前提下,獲得當前檢定統計量 (或更極端數值) 的機率。若 p值小於我們設定的顯著水準 ,我們便有充分的統計證據拒絕虛無假說。
信賴區間 (Confidence Interval) 則是與假說檢定一體兩面的工具。它提供了一個範圍,表明在特定的信心水準 (Level of Confidence, ) 下,母體參數可能落入的區間。
如果虛無假說中的參數值落於信賴區間之外,其數學意涵等同於我們在該顯著水準下拒絕了虛無假說。
在選擇檢定模型時,母體變異數 (Population Variance) 是否已知與樣本大小,決定了我們該使用何種分佈:
當母體為常態分佈且變異數已知,或是樣本數足夠大 (通常 ) 時,我們採用 z-檢定。其檢定統計量為:
現實的金融數據中,真實的母體變異數往往是未知的。這時,我們必須依賴 t-分佈 (t-Distribution)。t-分佈具有較厚的尾部 (Fatter Tails),能更保守地處理小樣本帶來的不確定性。其統計量需考量 個自由度 (Degrees of Freedom):
這正是許多量化機構最容易跌入的深淵。當我們在同一個資料集上反覆測試無數個策略,直到找出一個「統計顯著」的結果時,我們已經無形中放大了型一錯誤的機率。
看似嚴謹的 顯著水準,僅對「單一」檢定有效。如果對同一組數據進行十次、百次的策略回測 (Backtesting),總會有幾個策略純粹因為隨機性而突破臨界值 (Critical Value)。這種資料探勘 (Data Snooping) 偏誤,解釋了為何許多在實驗室裡夏普值 (Sharpe Ratio) 極高的模型,一進入實盤 (Live Trading) 就會面臨崩潰。
數學定律不會因為複雜的演算法而彎曲。假說檢定為量化分析提供了剔除雜訊的剃刀,但它無法取代對市場微觀結構與經濟基本面的深刻洞察。
所有超出優勢的下注,最終的結局都是被市場清算。面對歷史數據,我們必須承認統計顯著性只是策略上線的最低門檻,唯有將假說檢定與現實的經濟顯著性、嚴格的風險管理相結合,才能在非理性的市場中,捕捉到真正可持續的 Alpha。
延伸閱讀 —— 更多精選文章與深度解析。
Reading 23 - Measuring Returns Volatility and Correlation
Reading 15 - Multivariate Random Variables
Reading 19 - Regression with Multiple Explanatory Variables