在當今的量化金融(Quantitative Finance)領域,市場參與者無不渴望尋找能穩定產生超額報酬的聖杯。然而,市場現實是殘酷的:傳統的線性模型在面對高維度、非線性的金融數據時,往往顯得捉襟見肘。這正是機器學習(Machine Learning)與預測模型(Prediction Models)在當代風險管理與量化交易中崛起的根本原因。本篇文章將基於 GARP FRM 的核心知識體系,深度解構機器學習在預測上的應用,從基礎的類別變數處理、正則化技術,到邏輯斯迴歸,乃至決策樹、集成學習與神經網路。我們將遵循「論點-論證-論據」的嚴謹架構,帶你一窺黑盒子底下的量化邏輯。
在將資料輸入演算法之前,數據的本質決定了模型的上限。金融市場充斥著定性數據(例如:信用評級、產業分類),如何將這些非數值資料轉化為模型可讀的語言,是預測的第一步。
對於沒有自然排序順序的類別,我們採用獨熱編碼(One-hot encoding),為每個類別建立獨立的虛擬變數(Dummy variable),以 0 或 1 表示。對於具有自然順序(Ordinal)的類別,如收入區間,則可賦予連續的整數值(例如 0, 1, 2, 3)。
量化模型最忌諱過度配適(Overfitting)。為了解決這個問題,正則化透過在損失函數(Loss function)中加入懲罰項,強迫模型變得精簡,從而降低運用於測試集時的變異。
金融領域充滿了二元決策:客戶是否違約?公司是否達到財務目標?傳統的線性迴歸無法處理這類輸出域在 0 與 1 之間的問題。
邏輯斯模型(Logit model)透過對數累積函數(Sigmoid curve)將線性特徵映射至機率空間。
因為該模型非線性,我們無法使用一般最小平方法(OLS),而是採用最大概似估計法(Maximum Likelihood Estimation)或對數概似函數來求解最佳參數。判定最終分類的門檻值(Threshold Z)之設定,取決於兩方誤判成本的權衡。
預測模型的優劣需要多維度的評估。透過混淆矩陣(Confusion Matrix),我們可以拆解出真陽性(True Positive)、假陽性(False Positive)等四種結果,並計算出精確度(Precision)與召回率(Recall)。更進一步,接收者操作特徵曲線(ROC Curve)描繪了真陽性率與假陽性率的權衡關係,而曲線下面積(AUC)越接近 1,代表模型的預測力越強。
當市場特徵間存在複雜的交互作用時,樹狀模型提供了一種直觀的「白盒(White-box)」解決方案,以別於神經網路的黑盒屬性。
分類與迴歸樹(CARTs)的核心在於尋找能使「資訊增益(Information Gain)」最大化的特徵節點。衡量數據集無序程度的指標主要有二:
為防止決策樹深度過大導致過度配適,必須設定停止規則,或進行事前剪枝(Pre-pruning)與事後剪枝(Post-pruning)。
單一模型容易產生高變異,集成學習透過組合多個預測模型來提升穩健性(Wisdom of crowds):
神經網路透過隱藏層與激勵函數(Activation function)捕捉極端複雜的非線性關係。最常見的前饋神經網路利用反向傳播(Backpropagation)搭配梯度下降演算法(Gradient Descent Algorithm)來不斷更新權重(Weights)與偏差(Biases)。
學習率(Learning rate)決定了優化步伐的大小:過大會導致越過谷底,過小則尋優過程漫長。為了對抗神經網路容易過度配適的天性,實務上會同步計算訓練集與驗證集(Validation set)的目標函數,並在驗證集誤差開始上升的那一刻(即不再改善時)停止算法。
從懲罰收斂的正則化迴歸到錯綜複雜的神經網絡,沒有任何單一機器學習演算法是金融預測的絕對解藥。高維度模型的精準度往往伴隨著過度配適的致命風險與解釋性的喪失。真正的量化研究者,並非一味追求堆疊最複雜的網絡架構,而是能根據市場特徵、數據維度與決策成本,在偏差與變異的權衡中,靈活運用群眾智慧(集成學習)與降維懲罰(正則化),精準鍛造出具備實戰防禦力與穩健預測力的決策利器。
延伸閱讀 —— 更多精選文章與深度解析。
Reading 23 - Measuring Returns Volatility and Correlation
Reading 15 - Multivariate Random Variables