在量化投資與金融市場預測中,我們常面臨一個核心矛盾:市場究竟是純粹的隨機漫步(Random Walk),還是隱藏著可被捕捉的記憶(Memory)?主流敘事往往熱衷於尋找各種複雜的機器學習黑盒子來捕捉市場規律,卻忽略了時間序列分析的第一性原理。事實上,若無法區分系統中的持續性結構(Persistence)與隨機衝擊(Shocks),再先進的演算法也只是在雜訊中尋找虛幻的規律。本文將從時間序列的定態性出發,深入拆解自我迴歸(Autoregressive)、移動平均(Moving Average)及二者結合的 ARMA 過程,還原量化預測的底層數學法則。
時間序列模型試圖透過歷史數據來預測未來,但此邏輯成立的先決條件,是歷史與未來的「關係」必須保持穩定。這種穩定性在數學上被定義為共變異數定態(Covariance Stationary)。
若要滿足共變異數定態,時間序列必須具備三個嚴格條件:
唯有建立在定態性的基礎上,自我相關函數(Autocorrelation Function, ACF)才能夠真正反映變數與其過去數值之間的連動強度,預測模型才具備統計學上的意義。
要捕捉定態時間序列的特徵,量化模型主要仰賴對兩種核心機制的數學建模:自身的歷史記憶,以及對外部隨機衝擊的吸收。
白雜訊(White Noise)是所有時間序列分析的基準。一個純粹的白雜訊過程具備零期望值、常數變異數,且序列之間完全不存在自我相關性(Serially Uncorrelated)。
若模型完美捕捉了市場規律,其預測誤差(Residuals)應當退化為獨立的白雜訊。沃爾德定理(Wold's Theorem)指出,任何共變異數定態過程皆可被表述為無限期白雜訊過程的分配滯後(Distributed Lag)。
AR 過程假設當前變數的值由其過去的歷史值線性決定。這反映了市場的「動能」或「均值回歸」特性。一階自我迴歸模型 AR(1) 的數學表達式如下:
在此公式中, 代表當期的白雜訊衝擊。為了確保 AR(1) 模型具備共變異數定態性,滯後係數的絕對值必須小於一()。這種機制會產生一個無條件的均值回歸水平(Mean Reverting Level),使得時間序列在受到衝擊後,隨著時間推移被拉回長期平均值:
有別於 AR 模型依賴可觀測的過去數值,MA 模型認為當前變數是由當期與過去未被觀測到的隨機衝擊(Random Shocks)所驅動。這在金融上可理解為市場對新資訊的吸收過程。一階移動平均模型 MA(1) 的定義為:
MA 過程必定是共變異數定態的。其最顯著的特徵在於自我相關性的「截斷(Cutoff)」。對於 MA(1) 而言,滯後期大於一的自我相關係數必定為零,這與 AR 過程呈現指數型衰減的自我相關結構截然不同。
在真實的金融市場中,資產價格的波動往往同時受到歷史記憶(AR)與短期隨機衝擊(MA)的交互影響。結合兩者的自我迴歸移動平均模型 ARMA(p,q) 提供了更強大的擬合能力。
然而,這類模型並非萬能。我們必須透過嚴格的殘差檢驗來界定其適用邊界。若模型配適良好,其殘差的自我相關應趨近於零。在小樣本檢定中,我們常使用 Ljung-Box (LB) 統計量來檢定殘差是否仍存在顯著的自我相關:
此外,對於具備週期性特徵的數據(如每季財報公佈帶來的波動),我們可以擴充至包含季節性(Seasonality)的 ARMA 模型。透過引入對應季節長度的滯後項,我們得以將這類重複性的週期從隨機波動中剝離。
許多現代量化策略試圖利用深層神經網路來挖掘時間序列中的非線性特徵,但無論工具如何升級,都無法撼動時間序列分析的底層定律。如果一組數據本身不具備共變異數定態性,再複雜的模型也只是在對歷史雜訊進行過度擬合(Overfitting)。
真正的競爭壁壘,不在於使用多龐大的參數去暴力破解市場,而在於能否深刻理解定態性、均值回歸與隨機衝擊的數學本質。所有建立在非定態沙堆上的預測,最終的結局都是被市場無情地清算。
延伸閱讀 —— 更多精選文章與深度解析。
Reading 23 - Measuring Returns Volatility and Correlation
Reading 15 - Multivariate Random Variables
Reading 19 - Regression with Multiple Explanatory Variables