在量化金融的實務中,我們經常需要在無序的市場雜訊中尋找資產價格的驅動因子。無論是探索避險基金報酬與閉鎖期 (Lockup Periods) 之間的關聯,還是量化大盤表現對單一股票的影響力,線性迴歸 (Linear Regression) 都是我們剝絲抽繭的核心工具。然而,模型並非現實的完美倒影,過度迷信迴歸結果而忽略其背後的統計假設,往往是量化交易災難的開端。本文將深入解構線性迴歸的核心理論,從最小平方法 (Ordinary Least Squares) 的數學本質出發,並探討各種可能導致模型失效的偏誤 (Biases),還原迴歸分析在金融實務中的真實面貌。
線性迴歸旨在衡量一個應變數 (Dependent Variable) 如何被一個或多個自變數 (Independent Variables) 的變動所解釋。在單一解釋變數的情況下,其基礎模型可表示為:
其中, 為截距項 (Intercept),代表當自變數為零時應變數的預期值; 為斜率係數 (Slope Coefficient),衡量自變數每變動一單位時,應變數的預期變動量。然而,現實數據總伴隨著無法被模型解釋的雜訊,這便引入了誤差項 (Error Term)。
為了找出最適配的迴歸線,我們通常採用普通最小平方法 (Ordinary Least Squares, OLS)。OLS 的優化目標是最小化所有樣本觀測值與模型預測值之間誤差平方和 (Sum of Squared Residuals)。透過一階導數求極值,我們可以推導出斜率與截距的估計式:
從上述公式可知,迴歸線必定會穿過自變數與應變數的樣本平均數座標點。此外,判定係數 (Coefficient of Determination, R-squared) 則量化了模型的解釋力,即應變數的變異中有多少比例能被自變數所解釋。在單元迴歸中,判定係數恰等於自變數與應變數相關係數 (Correlation Coefficient) 的平方。有時我們亦會引入虛擬變數 (Dummy Variables) 來量化質性資料 (Qualitative Variables) 的影響,例如標示特定月份以檢定日曆效應。
OLS 估計式具備不偏性 (Unbiasedness) 與一致性 (Consistency) 的優良統計性質,但這些性質建立在一系列嚴格的假設之上。一旦市場數據違反這些前提,迴歸結果將變得極具誤導性。
首先,誤差項的條件期望值必須為零,這意味著自變數不應包含任何關於誤差項位置的資訊。在金融實務中,此假設常因以下四種偏誤遭到破壞:
其次,模型要求所有的觀察值必須是獨立且同分配的 (Independent and Identically Distributed, i.i.d.),且誤差項需具備同質系異變性 (Homoskedasticity),即變異數為常數。最後,OLS 對極端值 (Outliers) 極度敏感,金融市場中常見的黑天鵝事件往往會劇烈扭曲迴歸線的斜率。
為了確保模型的可靠性,我們必須對迴歸係數進行假說檢定 (Hypothesis Testing)。透過計算標準誤 (Standard Error) 與 t 統計量 (t-statistic):
我們可以構建信賴區間 (Confidence Interval),並利用 p 值 (p-value) 判斷斜率是否顯著異於零。若假設的係數值落在信賴區間外,或 p 值小於顯著水準 (Level of Significance),我們即可拒絕虛無假說,確認該因子的統計顯著性。
線性迴歸並非單純的數據擬合遊戲,而是一套嚴謹的邏輯推演框架。在量化金融領域,尋求一個極高判定係數的模型並不困難,真正的挑戰在於該模型是否經得起嚴格假設的考驗,以及是否避開了存活者偏誤與遺漏變數等數據陷阱。唯有深刻理解 OLS 估計式的數學邊界與失效條件,我們才能在雜訊充斥的市場中,淬鍊出真正具有預測價值的量化因子。
延伸閱讀 —— 更多精選文章與深度解析。
Reading 23 - Measuring Returns Volatility and Correlation
Reading 15 - Multivariate Random Variables