混同行列の基本
混同行列とは何か
混同行列は、分類モデルの予測結果と正解ラベルの対応を、表形式で集計したものです。各セルには、特定の正解クラスに対して、モデルがどの予測クラスを割り当てたかの件数、または割合が示されます。これにより、正答・誤答の総量だけでなく、どの種類の誤りが起きやすいかを俯瞰できます。
表の見方(行と列)
正解ラベル
行には正解ラベルを配置します。行ごとに「その正解クラスに属するサンプルが、予測上どのように振り分けられたか」が読み取れます。たとえば、特定の行で主に対角成分(同一クラスの位置)が大きければ、その正解クラスは概ね適切に認識されていると解釈できます。
予測ラベル
列には予測ラベルを配置します。列ごとに「モデルがあるクラスだと判断したサンプルのうち、実際には何の正解だったか」を把握できます。誤りの構造を理解する際、列の広がり(どの行からその列に点が入っているか)は、誤判定の傾向を示す手がかりになります。
セルの意味(件数・割合)
セルには、対応する正解クラスと予測クラスの組み合わせに該当するサンプル数、あるいはサンプル数を正規化した割合が入ります。件数のまま表示すると実データの規模差が見え、割合にするとクラスごとの内訳が比較しやすくなります。どちらを採用しているかで、読み取りの主眼(絶対量か、比率か)が変わります。
クラス分類における読み取り
正しく分類された割合の把握
正しく分類されたケースは、典型的には対角成分として表れます。対角成分が大きいクラスは、そのクラスのサンプルに対してモデルが一貫して正しい判断をしていることを意味します。逆に、対角成分が小さいクラスは、識別の難しさ、特徴の類似、学習データの偏りなどにより誤りが増えている可能性があります。
誤分類パターンの特定
どのクラスに混同しやすいか
誤分類の手掛かりは、対角成分以外のセルの大きさです。たとえば、ある正解クラスの行で特定の予測クラス列への集中が見られる場合、その正解クラスが別のクラスとして誤認されやすいことが示されます。混同が一方向に強いのか、複数方向に散っているのかも観察対象です。
対称性や偏りの観察
混同の関係が対称に見えるかどうかは、モデルが同じ程度の誤りを相互に起こしているかを示す材料になります。対称性が崩れている場合、例えば一方のクラスが他方に吸い寄せられるような誤判定が起きている可能性があります。また、特定の予測クラスの列で広く誤りが集まるなら、そのクラスに過度に割り当てるバイアスが存在することが疑われます。
指標との関係(簡潔に)
正確さに代わる情報
正解率(全体の正答割合)だけでは、どの種類の誤りが多いのかが分かりにくい場合があります。混同行列は、クラス単位の誤判定の方向と強さを提示するため、単純な精度指標が見落としやすい弱点を補完します。結果として、改良方針(データ収集、前処理、クラス重み付けなど)を立てやすくなります。
適合率・再現率・F値へのつながり
混同行列のセル数は、適合率(予測したクラスが正しい割合)、再現率(正解クラスを取りこぼさない割合)といったクラス別指標の計算材料になります。具体的には、各クラスを「正例」とみなしたときの真陽性、偽陽性、偽陰性が混同行列の各セルから整理できます。そのため、混同行列を見て誤りのパターンを把握した後に、指標で数値化して比較する流れが取りやすくなります。F値は適合率と再現率のバランスを要約する点で、混同行列の特徴(取りこぼしの多さ、誤割当の多さ)を総合的に確認する助けになります。
実務での使いどころ
どんな場面で有用か
混同行列は、診断支援、検査、需要予測のように「誤りの種類」が意味を持つ場面で有用です。たとえば、医療では取りこぼしと誤検出の影響が異なることが多く、モデルの改善優先度を議論する材料になります。不良品検査では、特定の欠陥が別の欠陥として扱われると工程上の手戻りにつながるため、混同の方向性が重要情報になります。
データ不均衡への注意
クラス数が偏っている場合、全体の見栄えや対角成分の大きさだけでは評価を誤る恐れがあります。割合表示にするとクラスごとの内訳が見やすくなる一方、もとのサンプルが少ないクラスでは統計的な揺らぎが大きくなるため注意が必要です。混同行列は有用ですが、クラス分布やサンプル数の背景を合わせて解釈し、指標や追加の検証で補強することが望まれます。