在量化投資與演算法交易的世界裡,尋找能解釋資產報酬的因子(Factor)始終是核心命題。市場上充斥著一種直覺式的迷思:若單一變數無法精準預測市場,那麼將總體經濟指標、基本面數據與技術面訊號全數丟入模型中,預測能力必定提升。這種「參數越多越好」的擴張邏輯,催生了無數看似完美的迴測(Backtest)曲線。然而,這些在歷史數據中表現優異的複雜模型,一旦進入實盤(Live Trading),往往迅速崩潰。
這背後的本質矛盾在於:擴充解釋變數確實能機械性地提高模型對歷史的擬合程度,但這不等於提升了對未來的預測力。 當我們跨入多元迴歸(Multiple Regression)的領域,模型的維度增加帶來了資訊,卻也同時引入了雜訊與共線性風險。
多元迴歸的本質不是無限制地堆疊變數,而是透過嚴謹的統計檢定與懲罰機制,篩選出具備獨立解釋能力的真正因子。單純依賴決定係數(Coefficient of Determination)來評估多變數模型,將導致嚴重的過度擬合(Overfitting);真正的競爭壁壘在於理解變數間的邊際貢獻,並運用聯合假設檢定(Joint Hypothesis Tests)來界定模型的有效邊界。
多元迴歸模型將單一變數的線性框架擴展至多個獨立變數(Independent Variables)。其數學表達式為:
在多變數環境下,斜率係數(Slope Coefficient)被稱為偏斜率係數(Partial Slope Coefficients)。其物理意義為:在保持其他所有變數不變(Holding other independent variables constant)的條件下,單一變數 變動一單位對應變數 的預期變化。
然而,要確保普通最小平方法(Ordinary Least Squares, OLS)的估計具備有效性,多元迴歸必須建立在嚴格的假設之上。除了單一迴歸的誤差項期望值為零、變異數同質性(Homoskedasticity)等條件外,多元迴歸引入了最關鍵的第六項假設:解釋變數之間不存在完全共線性(No Perfect Multicollinearity)。
若變數間存在完全線性相依,模型將無法分離個別變數的獨立貢獻。這揭示了第一性原理:市場中的有效資訊必須是正交的(Orthogonal),重複的資訊無法創造額外的價值。
在傳統視角中,決定係數 是衡量模型配適度(Goodness-of-Fit)的黃金標準:
其中 為解釋變異數(Explained Sum of Squares), 為總變異數(Total Sum of Squares)。
看似完美的假說在實證環境中迅速失效:只要在模型中加入任何新的獨立變數,無論該變數是否具有統計顯著性, 幾乎必定會上升。 這種數學必然性導致了「模型過度估計」(Overestimating the regression)的陷阱。量化策略工廠若僅以 作為優化目標,最終將產出充滿雜訊的偽預測模型。
為解決此問題,統計學引入了調整後決定係數(Adjusted ),強制對模型複雜度進行邊際成本(Marginal Cost)的懲罰:
當新加入的變數無法提供足夠的邊際解釋力來抵消自由度(Degrees of Freedom)的損失時,調整後 不增反降。這清晰地劃定了模型的邊界:資訊的增加必須超過維度擴張帶來的懲罰,否則增加參數就是規模不經濟(Diseconomies of Scale)。
面對複雜的多元變數模型,單一變數的 t 檢定(t-test)已不足以評估整體架構的有效性。這不是單純計算工具的升級,而是檢驗維度擴張是否符合統計定律的嚴謹過程。
為比較完整模型(Full Model)與移除部分變數的縮減模型(Partial Model),我們必須依賴 F 檢定(F-Test)。F 檢定的本質在於衡量「新增變數所減少的殘差變異」是否具有統計顯著意義:
針對模型整體的有效性(測試所有斜率係數是否同時為零),F 統計量則簡化為:
若計算出的 F 統計量大於臨界值(Critical Value),我們才能拒絕虛無假說(Null Hypothesis),確認這組因子確實為解釋變數的變異提供了有意義的貢獻。工具的升級(引入更多資料庫或運算力)並未撼動檢定的底層邏輯:沒有通過嚴格聯合檢定的變數群,終究只是隨機漫步中的雜訊。
將無數變數塞入多元迴歸模型,看似掌握了市場的全局,實則往往陷入了維度的詛咒。模型評估的標準,從來就不是不斷膨脹的 ,而是通過 F 檢定與調整後 考驗下的真實邊際貢獻。
在量化模型的構建中,所有未能提供獨立資訊的冗餘變數,最終的結局都是在實盤中被市場無情清算。真正的預測力,永遠建立在嚴謹的邏輯刪減與對第一性原理的敬畏之上。
延伸閱讀 —— 更多精選文章與深度解析。
Reading 23 - Measuring Returns Volatility and Correlation
Reading 15 - Multivariate Random Variables