在傳統的量化投資與風險管理中,分析師往往依賴古典計量經濟學的線性模型來捕捉市場動態。然而,真實的金融市場充滿了高度的非線性互動與巨量且雜訊充斥的數據。當古典統計學在面對龐大特徵空間與複雜變數關聯時顯得捉襟見肘,機器學習 (Machine Learning) 便成為了解構市場隱含結構的關鍵利器。本質上,機器的演進並未推翻數學與經濟學的底層法則,而是大幅擴展了我們處理數據、發掘非線性 alpha 以及在動態賽局中尋找最佳決策邊界的能力。
傳統統計學與機器學習在哲學與實務上有著根本的分歧。古典計量經濟學 (Classical Econometrics) 是一種「理論驅動」的過程:分析師基於經濟學或金融假說選擇變數,建立嚴格的線性模型,並透過統計顯著性 (Statistical Significance)、常態分配假設與誤差項檢定來驗證理論是否成立。
相對地,機器學習是一種「數據驅動」的典範。它不預設特定的理論假說,而是讓龐大的數據集自行決定模型的結構與參數。機器學習的核心目標不再是追求參數的統計顯著性或完美的模型配適度,而是極致的預測準確度 (Prediction Accuracy)。在變數獨立性不明確或非線性關係錯綜複雜的環境下,機器學習展現出古典模型難以企及的靈活性。
在量化金融領域,機器學習方法可依據其處理數據的目標與方式,嚴格劃分為三大流派:
任何機器學習模型的成敗,皆取決於輸入數據的品質。在建立模型前,數據清洗 (Data Cleaning) 必須解決遺漏值 (Missing Data)、極端值 (Outliers)、重複紀錄與不一致性等問題。
此外,由於機器學習演算法對特徵的數值範圍極為敏感,特徵縮放 (Rescaling) 是不可或缺的步驟。實務上最常使用的兩種方法為:
標準化 (Standardization):將數據轉換為平均值為零、變異數為一的分布,特別適用於包含極端值的寬廣數據範圍。
正規化 (Normalization):又稱最大最小轉換 (Min-max Transformation),強制將數值壓縮至零與一之間。
金融數據往往具備高維度特徵,而過多的關聯變數會導致維度災難。非監督式學習提供了兩種經典的降維與分群工具。
PCA 是一種強大的降維技術,旨在將大量高度相關的變數,轉換為少數幾個彼此不相關的「主成分」,同時盡可能保留原始數據的資訊。在固定收益領域,PCA 常被用來解析殖利率曲線 (Yield Curve) 的變動。實證研究表明,殖利率曲線的變動絕大部分可由前幾個主成分解釋,例如平移 (Parallel Shift) 與扭曲 (Twist)。
若要在數據中尋找結構,K-平均演算法可將觀察值劃分為 K 個不同的叢集 (Clusters)。演算法透過最小化每個資料點與其所屬叢集中心 (Centroid) 的距離來進行優化。距離的計算常採用歐幾里得距離 (Euclidean Distance) 或曼哈頓距離 (Manhattan Distance):
模型配適度的衡量指標為慣性 (Inertia),即所有資料點與其叢集中心距離的平方和。為了決定最佳的 K 值,分析師通常利用碎石圖 (Scree Plot) 尋找慣性下降速度開始趨緩的「轉折點 (Elbow)」,或利用輪廓係數 (Silhouette Coefficient) 進行評估。
機器學習模型最大的風險在於其強大的擬合能力所帶來的副作用。
為了克服這些陷阱,嚴謹的樣本分割是必要的。數據集通常被劃分為三部分:
當數據量有限時,分析師會採用 K-折交叉驗證 (K-fold Cross-Validation),將訓練集與驗證集結合并切割為 K 等分,藉由輪流抽換驗證集來取得更穩健的效能評估。
強化學習 (Reinforcement Learning) 是一套透過最大化累積獎勵 (Rewards) 來制定決策策略 (Policy) 的機制。它由三個核心元素構成:狀態 (States)、行動 (Actions) 以及獎勵 (Rewards)。
在給定的狀態下,採取特定行動的期望價值被稱為 Q 值 (Q-value)。演算法必須在「開發 (Exploitation)」(選擇目前已知最優的行動)與「探索 (Exploration)」(嘗試新行動以發掘潛在更高回報)之間取得平衡。隨著訓練次數的增加,開發的機率通常會逐漸提高。
更新 Q 值的經典方法之一為蒙地卡羅方法 (Monte Carlo Method):
另一種方法則是時間差分學習 (Temporal Difference Learning),它假設未來的最佳策略已定,僅向後看一步來更新當前預期:
當傳統的 Q 表格無法負荷極高維度的狀態空間時,便會引入神經網路 (Neural Networks),形成深度強化學習 (Deep Reinforcement Learning)。
市場中大量的 alpha 潛藏於非結構化的文本數據中,如財報、新聞稿與社群輿情。自然語言處理 (Natural Language Processing, NLP) 透過演算法解析這些人類語言,消除了人工審閱的偏見與速度瓶頸。
在將文本轉化為模型可讀的「詞袋 (Bag of Words)」之前,必須經歷嚴謹的預處理流程:
隨後,透過與預先定義的情感詞典比對,NLP 能夠客觀量化文本的正負向情感 (Sentiment),為量化交易策略提供有力的輔助訊號。
機器學習與自然語言處理無疑地為我們裝備了更強大的雷達與運算引擎,讓我們得以在浩瀚的雜訊中提取微弱的訊號。然而,工具的升級並未改變金融市場的核心定律。所有完美的樣本內迴測,若脫離了經濟學理的支撐與嚴謹的交叉驗證,終將淪為過度擬合的數字遊戲。在量化投資的戰場上,演算法決定了運算的極限,但對第一性原理的敬畏與嚴謹的模型紀律,才是決定最終勝負的真正壁壘。
延伸閱讀 —— 更多精選文章與深度解析。
Reading 23 - Measuring Returns Volatility and Correlation
Reading 15 - Multivariate Random Variables