CFA®︎ Level 2「Quantitative Methods(数量分析)」で使われる重要用語を、学習単元(Learning Module)ごとに英語・日本語訳・意味の3点セットで整理しました。全7単元・66語を収録しています。英語の協会テキストを読むときの辞書代わりにお使いください。
Leveraged Support Course をご利用の方へFA-Academy の Leveraged Support Course(LSC)をご利用の方には、この用語集と公式集をレベル別に整理した資料(PDF)をお渡ししています。オフラインでの確認や試験直前の見直しにご活用ください。Level 2 Leveraged Support Course の詳細を見る

単元(LM)一覧

Quants の重要用語(LM別)

LM1 Basics of Multiple Regression and Underlying Assumptions(重回帰の基礎と前提条件)

この単元の要点解説:LM1 重回帰の基礎と前提条件
Multiple Linear Regression
重回帰(重回帰分析)
1つの従属変数と2つ以上の独立変数の線形関係を推定する手法。変数間の関係の説明、理論の検証、予測に用いる。
Dependent Variable
従属変数(被説明変数)
回帰モデルで説明・予測の対象となる変数。独立変数の値によってその変動が説明されると想定し、式の左辺に置く。
Independent Variable
独立変数(説明変数)
従属変数の変動を説明するために回帰式の右辺に置く変数。重回帰では複数の独立変数を同時にモデルに含める。
Intercept
切片
回帰式の定数項で、すべての独立変数がゼロのときの従属変数の期待値を表す。記号では b0 と書く。
Partial Regression Coefficient
偏回帰係数
重回帰の傾き係数。他の独立変数を一定に保ったまま、その変数が1単位変化したときの従属変数の変化量を表す。
Homoskedasticity
等分散性
誤差項の分散がすべての観測値で一定であるという重回帰の前提条件。成り立たない状態を不均一分散と呼ぶ。
Residual Plot
残差プロット
回帰の残差を予測値や独立変数、時間に対して描いた図。扇形の広がりや規則的なパターンがあれば前提条件の違反が疑われる。
Q-Q Plot
Q-Qプロット
残差の分位点を正規分布の理論分位点と対比して描いた図。点が直線に沿っていれば誤差項の正規性が成り立つと判断できる。

LM2 Evaluating Regression Model Fit and Interpreting Model Results(回帰モデルの当てはまりと結果の解釈)

Coefficient of Determination (R²)
決定係数(R²)
従属変数の総変動のうち回帰モデルで説明される割合。回帰平方和 ÷ 総平方和で求め、変数を追加すると必ず上昇する。
Adjusted R²
自由度修正済み決定係数(修正R²)
独立変数の数と標本数で自由度を調整した決定係数。説明力の低い変数を加えると低下し、R²以下の値で負にもなり得る。
Akaike’s Information Criterion (AIC)
赤池情報量規準(AIC)
同じ従属変数をもつ複数モデルを比較する指標で、値が小さいほど良い。予測を目的とするモデル選択に適する。
Schwarz’s Bayesian Information Criterion (BIC)
ベイズ情報量規準(BIC)
モデル比較の指標で、値が小さいほど良い。変数追加へのペナルティがAICより大きく、当てはまりを重視する選択に向く。
Sum of Squared Errors (SSE)
残差平方和(SSE)
実績値と回帰による予測値の差(残差)を2乗して合計したもの。モデルで説明できなかった変動の大きさを表す。
Restricted and Unrestricted Models
制約付きモデルと制約なしモデル
一部の係数をゼロと置いて変数を除いたのが制約付き、すべての変数を含むのが制約なしモデル。前者は後者に入れ子になる。
Joint F-Test
結合F検定
複数の係数が同時にゼロかを検定する手法。制約付きと制約なしモデルのSSEの差を用い、変数群をまとめて除けるかを判断する。
General Linear F-Test
一般線形F検定
すべての傾き係数が同時にゼロという帰無仮説の検定。モデル全体に説明力があるかを判断し、自由度は k と n−k−1。

LM3 Model Misspecification(モデルの誤特定)

この単元の要点解説:LM3 モデルの誤特定
Model Misspecification
モデルの誤特定
変数の選択や関数形が不適切な状態。変数の欠落、不適切な変数の形・スケーリング、データの不適切なプーリングなどから生じる。
Omitted Variable Bias
欠落変数バイアス
重要な変数をモデルから除いたために生じる推定値の偏り。欠落変数が残った独立変数と相関している場合、係数が一致性を失う。
Conditional Heteroskedasticity
条件付き不均一分散
誤差項の分散が独立変数の値と相関して変化する状態。標準誤差が過小評価され、t値が過大になって推論を誤らせる。
Unconditional Heteroskedasticity
無条件付き不均一分散
誤差項の分散は一定でないが、その変化が独立変数と無関係な状態。統計的推論に大きな問題は生じない。
Breusch–Pagan (BP) Test
ブロイシュ・ペイガン検定(BP検定)
残差の2乗を独立変数に回帰し、n × R² をカイ二乗分布で評価して条件付き不均一分散の有無を調べる検定。
Robust Standard Errors
ロバスト標準誤差
不均一分散や系列相関を考慮して修正した係数の標準誤差。White の標準誤差や Newey–West の標準誤差がこれにあたる。
Serial Correlation
系列相関(自己相関)
誤差項が観測値間で相関している状態で、時系列データで起きやすい。標準誤差をゆがめ、ラグ付き従属変数があれば係数も一致性を失う。
Breusch–Godfrey (BG) Test
ブロイシュ・ゴドフリー検定(BG検定)
残差を元の独立変数と残差のラグに回帰し、ラグ付き残差の係数がすべてゼロかを調べる系列相関の検定。
Multicollinearity
多重共線性
独立変数どうしの相関が高い状態。係数は不偏のままだが標準誤差が膨らみ、個々の係数が有意になりにくくなる。
Variance Inflation Factor (VIF)
分散拡大要因(VIF)
多重共線性の程度を測る指標で、1 ÷(1 − その変数を他の独立変数に回帰したR²)で求める。値が大きいほど共線性が強い。

LM4 Extensions of Multiple Regression(重回帰の拡張)

この単元の要点解説:LM4 重回帰の拡張
High-Leverage Point
高レバレッジ点
独立変数の値が他の観測値から大きく離れた観測値。レバレッジが 3(k+1)/n を超えると回帰結果への影響が大きい可能性がある。
Outlier
外れ値
従属変数の値が回帰の予測から大きく外れた観測値。スチューデント化残差で測り、t分布の臨界値を超えるかで判断する。
Studentized Residual
スチューデント化残差
ある観測値を除いて推定したモデルによるその観測値の残差を、標準誤差で割って基準化したもの。外れ値の判定に用いる。
Cook’s Distance (Cook’s D)
クックの距離
レバレッジと残差の両方を反映し、ある観測値が回帰全体の推定結果にどれだけ影響するかを測る指標。
Dummy Variable
ダミー変数
条件に当てはまれば1、そうでなければ0をとる変数。業種や時期などの定性的要因を回帰に組み込む。n個のカテゴリーにはn−1個を使う。
Intercept Dummy
切片ダミー
切片に作用するダミー変数。条件に当てはまる観測値の回帰直線を平行移動させ、その係数は基準カテゴリーとの切片の差を表す。
Slope Dummy
傾きダミー
ダミー変数と連続変数の積として加える交差項。条件に当てはまる観測値について、その連続変数の傾きを変化させる。
Logistic Regression (Logit Model)
ロジスティック回帰(ロジット・モデル)
二値の従属変数について、事象の確率のログ・オッズを独立変数の線形関数で表すモデル。予測確率は0〜1に収まる。
Log Odds
ログ・オッズ
事象の確率Pについて ln[P ÷ (1 − P)] で表した値。確率を実数全体に変換し、独立変数との関係を線形化するために使う。
Maximum Likelihood Estimation (MLE)
最尤推定法
観測されたデータが得られる確率(尤度)を最大にするようにパラメータを推定する手法。ロジスティック回帰の係数推定に用いる。

LM5 Time-Series Analysis(時系列分析)

この単元の要点解説:LM5 時系列分析
Log-Linear Trend Model
対数線形トレンド・モデル
時系列の自然対数を時間 t に回帰するモデル。一定の率で成長する系列に適し、予測値は推定式の指数をとって元の水準に戻す。
Covariance Stationary
共分散定常
期待値、分散、一定ラグの自己共分散がいずれも時間を通じて一定かつ有限である時系列の性質。ARモデルを回帰で推定する前提となる。
Autoregressive (AR) Model
自己回帰モデル(ARモデル)
時系列の現在の値を、その系列自身の過去の値で説明するモデル。p期前までのラグを使うものをAR(p)と表す。
Mean Reversion
平均回帰
時系列が長期平均より高ければ下落し、低ければ上昇する傾向。AR(1)では平均回帰水準が b0 ÷ (1 − b1) で表される。
Root Mean Squared Error (RMSE)
平均二乗誤差の平方根(RMSE)
予測誤差を2乗して平均し平方根をとった値。サンプル外予測の精度をモデル間で比べる基準で、小さいほど精度が高い。
Random Walk
ランダム・ウォーク
今期の値が前期の値に予測不能な誤差を加えたものとなる時系列。AR(1)で b1 = 1 の場合にあたり、共分散定常ではない。
Unit Root
単位根
AR(1)の係数 b1 が1となる性質。単位根をもつ系列は非定常で、通常の回帰推定や t 検定が信頼できない。1階の階差で定常化できる場合がある。
Dickey–Fuller Test
ディッキー・フラー検定
AR(1)を変形した式で g1 = b1 − 1 がゼロかを調べる単位根の検定。帰無仮説は単位根ありで、修正された臨界値を用いる。
Autoregressive Conditional Heteroskedasticity (ARCH)
自己回帰条件付き不均一分散(ARCH)
誤差項の分散が過去の誤差の大きさに依存する状態。残差2乗を1期前の残差2乗に回帰して検出し、分散の予測にも使える。
Cointegration
共和分
単位根をもつ2つの時系列の間に長期的に安定した関係がある状態。両系列に単位根がある場合、共和分していれば回帰が有効となる。

LM6 Machine Learning(機械学習)

この単元の要点解説:LM6 機械学習
Supervised Learning
教師あり学習
特徴量と目標変数の組からなるラベル付きデータで関係を学習する機械学習。目標変数が連続なら回帰、カテゴリーなら分類の問題となる。
Unsupervised Learning
教師なし学習
ラベルのないデータから構造やパターンを見いだす機械学習。次元削減やクラスタリングに用いる。
Overfitting
過学習(オーバーフィッティング)
モデルが訓練データのノイズまで学習し、新しいデータへの汎化力を失う状態。分散誤差が大きくなり、サンプル外の予測精度が低下する。
k-Fold Cross-Validation
k分割交差検証
データをk個に分け、1つを検証用、残りを訓練用とする推定をk回繰り返して誤差を評価する手法。訓練データの減少を緩和する。
Least Absolute Shrinkage and Selection Operator (LASSO)
LASSO回帰
係数の絶対値の合計にペナルティを課すペナルティ付き回帰。重要でない特徴量の係数をゼロにし、特徴量の選択と過学習の抑制を行う。
Support Vector Machine (SVM)
サポート・ベクター・マシン(SVM)
2つのグループをマージンが最大となる境界(超平面)で分ける分類手法。ソフト・マージンにより一部の誤分類を許容できる。
Classification and Regression Tree (CART)
分類・回帰木(CART)
特徴量とカットオフ値による2分岐を繰り返して観測値を分ける決定木。目標変数がカテゴリーなら分類木、連続なら回帰木となる。
Random Forest
ランダム・フォレスト
バギングと特徴量のランダムな抽出で多数の決定木を作り、その予測を組み合わせるアンサンブル学習。過学習を抑え精度を高める。
Principal Components Analysis (PCA)
主成分分析(PCA)
相関の高い多数の特徴量を、互いに無相関な少数の合成変数(主成分)に要約する次元削減の手法。主成分の意味は解釈しにくい。
k-Means Clustering
k平均法クラスタリング
観測値を事前に決めたk個の重複しないクラスターに分け、各観測値を最も近い重心のクラスターに割り当てる手法。

LM7 Big Data Projects(ビッグデータ・プロジェクト)

この単元の要点解説:LM7 ビッグデータ・プロジェクト
Big Data
ビッグデータ
量(volume)・速度(velocity)・多様性(variety)が大きく、正確性(veracity)に課題があり得るデータ。投資運用でも活用が進む。
Data Wrangling
データ整形(ラングリング)
収集したデータを分析可能な形に整える工程。誤りを除くデータ・クレンジングと、抽出・集約・変換などの前処理から成る。
Feature Engineering
特徴量エンジニアリング
既存の特徴量を加工・組み合わせて新しい特徴量を作る工程。ワンホット・エンコーディングやテキストのn-gram作成などがある。
Confusion Matrix
混同行列
分類モデルの予測と実際のクラスを、真陽性・偽陽性・真陰性・偽陰性の4区分で集計した表。適合率などの評価指標の基礎となる。
Precision
適合率
陽性と予測したもののうち実際に陽性だった割合で、TP ÷ (TP + FP) で求める。偽陽性を抑えたい場面で重視する。
Recall
再現率(感度)
実際に陽性のもののうち陽性と正しく予測できた割合で、TP ÷ (TP + FN) で求める。偽陰性を抑えたい場面で重視する。
F1 Score
F1スコア
適合率と再現率の調和平均。両者のバランスを1つの数値で表し、クラスが不均衡なデータの評価に適する。
Receiver Operating Characteristic (ROC) Curve
ROC曲線
横軸に偽陽性率、縦軸に真陽性率をとり分類の閾値を変えて描いた曲線。曲線下の面積(AUC)が大きいほど性能が高い。
Document Term Matrix (DTM)
文書・単語行列(DTM)
行に文書(文)、列にトークンをとり、各語の出現数やTF–IDFを値とした行列。テキストを構造化データに変換したもの。
Term Frequency–Inverse Document Frequency (TF–IDF)
TF–IDF
語の出現頻度(TF)に逆文書頻度(IDF)を掛けた値。多くの文書に共通する語の重みを下げ、特定の文書を特徴づける語を重視する。

あわせて使いたいページ

効率よく学ぶには FA-Academy

CFA®︎の協会テキストは英語で分量も多く、用語や公式を英語だけで理解していくのは大きな負担です。

FA-Academy(Financial Analyst Academy)は、日本語で学べる数少ないCFA®︎試験サポートです。これまで Level 1 から Level 3 まで多くの合格者を輩出しており、合格者の方々との対談も数多く公開しています。どんな方が、どのように合格されたのかは合格者対談・合格体験談の一覧からご覧いただけます。