【CFA®︎ L2 Quants LM7】Big Data Projects を要点解説|データ前処理・テキスト分析・特徴量エンジニアリング・モデル評価

Learning Module 7「Big Data Projects(ビッグデータ・プロジェクト)」は、ビッグデータを使った機械学習プロジェクトの手順、構造化データとテキスト・データの準備・整形・探索、特徴量の抽出と選択、そして混同行列・ROC 曲線・RMSE によるモデルの訓練と評価を扱う単元です。
本記事では、最新版カリキュラムのLOS(Learning Outcome Statement)と、この単元の重要論点を日本語で整理しました。
LM7のLOS(学習目標)
LOSは、この単元で「できるようになるべきこと」として示されている学習目標です。LM7には7つのLOSがあります。
- LOS 1:データ分析プロジェクトの手順を特定・説明するidentify and explain steps in a data analysis project
- LOS 2:データの準備・整形(ラングリング)の目的、手順、事例を説明するdescribe objectives, steps, and examples of preparing and wrangling data
- LOS 3:機械学習アルゴリズムの当てはまりを評価するevaluate the fit of a machine learning algorithm
- LOS 4:データ探索の目的、方法、事例を説明するdescribe objectives, methods, and examples of data exploration
- LOS 5:テキスト・データから特徴量を抽出・選択・作成(エンジニアリング)する方法を説明するdescribe methods for extracting, selecting and engineering features from textual data
- LOS 6:モデル訓練の目的、手順、手法を説明するdescribe objectives, steps, and techniques in model training
- LOS 7:金融予測のためのテキスト・データの準備・整形・探索を説明するdescribe preparing, wrangling, and exploring text-based data for financial forecasting
LM7のまとめ
この単元の要点をまとめると、次のとおりです。
- ビッグデータは量(volume)・速度(velocity)・多様性(variety)に加え、正確性(veracity)が低い可能性をもつデータで、投資運用でも活用が進む
- 従来型の機械学習モデル構築は、問題の概念化、データ収集、データの準備と整形、データ探索、モデル訓練の順に進む
- テキストを扱う場合は、テキスト問題の定式化、テキストの収集(キュレーション)、テキストの準備と整形、テキスト探索が前段の手順になる
- 構造化データの整形はデータ・クレンジングと前処理から成り、テキストではタグ・句読点・数字・空白の除去と正規化を行う
- データ探索は探索的データ分析・特徴量選択・特徴量エンジニアリングから成り、テキストではワード・クラウドなどで全体像をつかむ
- モデル訓練は手法の選択・性能評価・チューニングから成り、構造化・非構造化データで大きな違いはない
- 性能評価には混同行列による誤差分析、ROC 分析、RMSE を用いる
- チューニングではバイアス誤差(過少適合)と分散誤差(過学習)のトレードオフを適合曲線で管理する
以下、LOSごとに重要論点を整理します。
LOS 1:データ分析プロジェクトの手順
ビッグデータ・プロジェクトは、問題の概念化→データ収集→データの準備と整形→データ探索→モデル訓練の流れで進みます。テキスト・データの場合は前段が、テキスト問題の定式化・テキストの収集・テキストの準備と整形・テキスト探索に置き換わります。
- 概念化:出力、利用者、既存業務への組み込み方を定義
- データ収集:内部・外部データ、API やウェブ・スクレイピング
- 構造化データと非構造化データ(テキスト)で前段の手順が異なる
- 最終的にテキストは構造化データ(DTM)に変換してモデルに入力
LOS 2:データの準備と整形(ラングリング)
データの準備は、誤りを取り除くデータ・クレンジングと、分析に適した形に変える前処理(preprocessing)から成ります。データの質がモデルの質を左右するため、プロジェクトで最も時間のかかる工程の一つです。
- クレンジングで扱う誤り:不完全・無効・不正確・不整合・不統一・重複
- 前処理:抽出・集約・フィルタリング・選択・変換
- 外れ値の処理:トリミング、ウィンザー化
- スケーリング:正規化(0〜1)、標準化(平均0・標準偏差1)
LOS 3:機械学習アルゴリズムの当てはまりの評価
モデルの性能は、混同行列から計算する各指標、ROC 曲線と AUC、連続値の予測ではRMSEで評価します。正解率(accuracy)や F1 スコアが高く、AUC が大きいほど性能が良いと判断します。
- 適合率(precision)= TP/(TP+FP)
- 再現率(recall)= TP/(TP+FN)
- 正解率(accuracy)= (TP+TN)/全体
- F1 = 2 × 適合率 × 再現率 /(適合率 + 再現率)
- ROC:偽陽性率を横軸、真陽性率を縦軸にとり、凸で AUC が大きいほど良い
- RMSE:回帰型の予測誤差
LOS 4:データ探索の目的と方法
データ探索は、探索的データ分析(EDA)・特徴量選択・特徴量エンジニアリングの3つから成ります。データの特徴や関係を把握し、モデルに使う特徴量を絞り込んだり新たに作ったりします。
- EDA:要約統計量、ヒストグラム、箱ひげ図、散布図
- テキストの EDA:単語頻度、ワード・クラウド
- 特徴量選択:目的に役立つ特徴量だけを残し次元を減らす
- 特徴量エンジニアリング:既存の特徴量から新しい特徴量を作る(ワンホット・エンコーディングなど)
- 可視化はチーム内の知見共有にも役立つ
LOS 5:テキスト・データの特徴量の抽出・選択・作成
テキストの特徴量選択では、ノイズとなる頻出語やまれな語を除き、分類に役立つ語を残します。特徴量エンジニアリングでは、数字のトークン化や n-gram、固有表現抽出、品詞タグ付けで新たな特徴量を作ります。
- 選択の指標:単語頻度(TF)、文書頻度(DF)、カイ二乗検定、相互情報量
- DF = その語を含む文書数 ÷ 全文書数
- 極端に高頻度・低頻度の語はノイズになりやすい
- エンジニアリング:数字のトークン化、n-gram、固有表現抽出(NER)、品詞(POS)
LOS 6:モデル訓練の目的・手順・手法
モデル訓練は手法の選択→性能評価→チューニングの順に進みます。手法の選択は、ラベルの有無(教師あり・なし)、データの種類、データ量で決まり、チューニングではバイアス誤差と分散誤差のバランスを取ります。
- 手法選択の要因:教師あり/なし、データの種類(数値・テキスト・画像など)、データ量
- クラスの不均衡への対処:アンダーサンプリング、オーバーサンプリング
- チューニング:ハイパーパラメータの調整(グリッド・サーチなど)
- 適合曲線:横軸にモデルの複雑さ、縦軸に訓練誤差と交差検証誤差
- 過少適合=高バイアス誤差、過学習=高分散誤差
LOS 7:金融予測のためのテキスト・データの準備と探索
金融テキスト(ニュースや開示文書など)のセンチメントを予測に使うには、テキストを整形して文書・単語行列(DTM)という構造化データに変換します。単語の出現頻度や TF–IDF を DTM の値として使います。
- クレンジング:HTML タグ、句読点、数字(注釈への置換を含む)、余分な空白の除去
- 正規化:小文字化、ストップワードの除去、ステミング、レンマ化
- トークン化と BOW(bag-of-words)、n-gram の作成
- DTM:行が文書(文)、列がトークン
- IDF は多くの文書に出る語ほど小さくなる
効率よく学ぶには FA-Academy
CFA®︎の協会テキストは英語で分量も多く、1つひとつの単元を英語だけで理解していくのは大きな負担です。
FA-Academy(Financial Analyst Academy)は、日本語で学べる数少ないCFA®︎試験サポートです。これまで Level 1 から Level 3 まで多くの合格者を輩出しており、合格者の方々との対談も数多く公開しています。どんな方が、どのように合格されたのかは合格者対談・合格体験談の一覧からご覧いただけます。
















