1 補完モデルの概観
1.1 定義と目的
補完モデルとは、観測できなかった要素や欠けたデータを、利用可能な情報にもとづいて推定し、データ集合の不完全性を埋めるための手法・モデルを指す。目的は、統計解析や学習、意思決定を実行可能にすることにある。さらに、単に欠損を埋めるだけでなく、欠損がもたらす不確実性や偏りを管理し、再現性のある運用につなげる点も重視される。
補完は推定問題として扱われることが多い。推定は確率的に行われて不確実性を表現する場合もあれば、決定論的に一点推定して欠損値を置換する場合もある。対象データの構造(時系列、グラフ、行列、テーブル、埋め込み表現など)や、欠損の生じ方(ランダムか系統的か)によって適切な方針が変わる。
1.2 補完対象の種類
1.2.1 欠損値補完
欠損値補完は、表形式データや埋め込み特徴において、特定の変数の値が観測されない状態を復元する枠組みである。代表例として、医療データの検査項目の未記入、センサーログの欠測、顧客属性の収集漏れなどが挙げられる。実務では欠損のパターンが多様であり、単一列のみ欠ける場合だけでなく、多変量の同時欠損や、時間方向に欠けるケースもある。
補完の基本目標は、欠けた成分の推定値を得ることに加え、どの程度の信頼性があるかを見積もること、そして補完後に学習モデルへ悪影響(リーク、過大適合、誤った補完方針の固定化)を与えないことにある。
1.2.2 未来・潜在要素の推定
未来・潜在要素の推定は、観測範囲外にある値や、観測されないが構造的に影響を与える潜在変数を推定する考え方である。たとえば時系列では、未来時刻の値を予測することが補完の一種として扱われることがある。推薦では、ユーザとアイテムの相互作用を直接観測できない場合、潜在嗜好を推定して欠けた評価や選好を補う。
このタイプでは、「欠損」という語が必ずしも物理的欠測を意味しない。むしろ利用可能な観測が部分的であり、残りを埋める推定として定式化される点が特徴である。
1.2.3 不完全観測の復元
不完全観測の復元は、観測の欠落が時間・空間・測定チャンネルにまたがっている状況で用いられる。例として、画像や音声の一部領域が欠けた状態の復元、通信の途切れに伴う信号補完、マルチセンサーデータで一部センサのみ不稼働のときの統合推定などがある。ここでは欠損が局所的である場合もあれば、測定プロセス自体が部分的な情報しか含まない場合もある。
復元では補完誤差の評価だけでなく、復元によって導入されるアーティファクトや周波数成分の歪みなど、品質指標の選定が重要になる。
1.3 関連概念との違い
1.3.1 補間・平滑化との関係
補間や平滑化は、観測点の間を埋める、あるいは変動を抑えるといった目的で用いられるが、補完モデルはそれらを包含する場合が多い。補間が典型的に「既知の点の近傍に基づく」決定論的な埋め方に寄るのに対し、補完は欠損の生成機構や共変量との関係を踏まえ、確率的推定や学習ベースの推定を行う方向に拡張される。
平滑化との関係でも、単にノイズを抑えて滑らかにすることに留まらず、欠損位置の推定に不確実性を持たせる設計が補完の焦点となる。両者は目的と前提が重なるため、実装上の境界は曖昧になりやすいが、評価と定式化の観点で整理できる。
1.3.2 予測・生成との関係
予測は未来の値や未観測の出力を推定する問題として捉えられる。補完は欠けた入力側を埋めるという意味合いが強いが、時系列や推薦では、欠損の埋め直しが将来予測やランキング推定に連動することがある。生成は、データ分布から新しいサンプルを作る概念であり、補完は条件付き生成として理解できる場合が多い。たとえば欠損部分だけをマスクして、その周辺情報から整合的なサンプルを生成する枠組みは補完に直結する。
したがって、予測・生成は補完の周辺概念であり、ターゲット(欠損成分か、未来出力か、全体サンプルか)と条件(観測済み成分か、過去系列か、ラベルか)で違いを区別するのが実用的である。
2 数学的・統計的基礎
2.1 欠損のメカニズム
2.1.1 欠損が無作為である場合
欠損が無作為である場合、観測されない事象が本質的な値と独立に生じると仮定する。統計的には「欠損が起きる確率が欠損値そのものに依存しない」状況として扱われることが多い。このとき、利用可能なデータだけで推定してもバイアスが抑えられる見通しが得やすい。
ただし無作為性は実データでは検証が難しい。実装では、欠損パターンと観測可能特徴の関係から欠損の妥当性を点検し、仮定が崩れる可能性も考慮する必要がある。
2.1.2 欠損が条件付きで生じる場合
条件付きで欠損が生じる場合、欠損の発生確率は観測されている変数に依存するが、欠損している値そのものには直接依存しないとみなす。たとえばある検査項目は年齢や既往歴によって測定されるが、測定されない患者群の中で当該検査値がどれほど大きいかまでは観測されない、という状況が該当しうる。
この設定では、観測済み共変量をモデルに組み込むことで欠損メカニズムを補正しやすくなる。欠損指標(欠損フラグ)を入力に加えるなどの設計が合理的になる。
2.1.3 欠損が非ランダムな場合
非ランダムな欠損では、欠損の起きやすさが欠損値そのものに依存する可能性がある。たとえば極端な値を検出したときに記録が失われる、あるいは自己申告で特定の値が意図的に省略されるなどが考えられる。こうした場合、観測されるデータだけでは本来の分布を復元しにくく、推定に追加の仮定や感度分析が求められる。
補完モデルを構築する際には、欠損機構モデル(欠損が生じる確率を推定する要素)を明示的に扱うか、頑健性の観点から複数方針を比較する必要がある。
2.2 推定の枠組み
2.2.1 最尤推定
最尤推定は、欠損のあるデータの尤度を最大化することで未知パラメータを推定する枠組みである。欠損値があると尤度は周辺化を含むため、計算上は潜在変数の積分・和を扱う必要が生じる。実務では期待値最大化(EM)などの手続きが使われることが多い。
補完としての最尤推定は、推定されたパラメータにもとづいて欠損部を代入する決定論的な置換を行う場合と、確率的にサンプルして埋める場合に分かれる。どちらを選ぶかで、下流タスクの不確実性伝播が変わる。
2.2.2 事後推定とベイズ推論
ベイズ推論は、未知パラメータや欠損値に対して事前分布を置き、観測にもとづいて事後分布を得る。欠損部分の補完は、事後分布からの平均(期待値)や中央値、あるいは分布からのサンプリングとして実現できる。
この枠組みの利点は、不確実性を形式的に扱える点にある。欠損メカニズムの仮定が難しい場合でも、事前分布の妥当性や感度を比較することで推定の頑健性を検討できる。
2.2.3 最小二乗・損失関数の設計
損失関数を設計することで、欠損補完の目的に沿った最適化が可能になる。連続値なら最小二乗誤差、外れ値に頑健にしたいならロバスト損失(絶対誤差やHuberなど)が選択される。分類や順位に関わる補完なら、交差エントロピーやランキング損失が用いられる。
損失設計では、欠損セルに対する寄与の重み付け、欠損パターンの不均衡への対処、補完後の評価指標との整合も重要になる。過度に単純な損失は、モデルが「欠損しないケース」に最適化される偏りを生むことがある。
2.3 不確実性の扱い
2.3.1 予測区間と信頼度
一点推定では値の誤差しか見えず、補完により埋められた箇所の信頼性が曖昧になりやすい。予測区間や信頼区間は、欠損部の推定に対するばらつきを示す手段であり、下流の意思決定でリスクを定量化するのに役立つ。
区間推定は、仮定(誤差分布)、推定手続き(ベイズか頻度論か)、および推定誤差の伝播の扱いで結果が変わりうる。実務では経験的な較正(キャリブレーション)を加えて信頼度の整合を取ることがある。
2.3.2 単一値推定と確率分布推定
単一値推定は計算と解釈が簡単な一方、補完によって生じる分布の不確実性を捨てがちである。確率分布推定では、条件付き分布(平均と分散、混合分布、あるいはサンプル集合)として欠損部を表し、複数の補完案を生成できる。
多重代入法や分布ベースの生成モデルは、確率分布推定の代表的な実装に近い。下流で統計量を算出する際には、複数補完を組み合わせて分散を推定するなどの枠組みが適用できる。
3 代表的な補完手法
3.1 低次元・行列分解系
3.1.1 行列補完と潜在因子
行列補完は、ユーザ×アイテムや特徴×サンプルのようにデータを行列として捉え、欠けた要素を潜在因子の積で復元する考え方である。観測されないセルは、潜在因子により推定されるため、推薦や多変量補完で広く使われてきた。
潜在因子の導入により、直接の欠損値を推定するよりも、因子空間での整合性を保ちながら補完できる。過学習を抑えるために正則化を組み合わせるのが一般的である。
1.1.2 低ランク近似
低ランク近似は、データが本質的に少数の自由度で表せるという仮定に基づく。欠損セルを含む場合でも、推定された低ランク構造に沿って欠損を埋めることで復元が可能になる。
この系統は、行列の完全観測や疎観測の比率、ノイズの強さに影響される。欠損が多い場合や構造が複雑な場合、単純な低ランクでは表現力が不足するため、拡張(非線形化、センサ特性の反映など)が検討される。
3.2 近傍・類似度ベース
3.2.1 k近傍による補完
k近傍による補完は、欠損があるデータ点に対して類似したサンプルを探し、その統計量(平均、中央値、重み付き平均など)を欠損部の推定に用いる方法である。テーブルデータでの簡便な実装が可能で、特徴空間の設計が鍵になる。
類似度の定義は欠損問題に直結する。欠損部分をどのように扱い、距離計算をどの成分に基づいて行うかにより結果が大きく変わる。距離の較正や欠損に対応した距離尺度を使うことが重要になる。
3.2.2 類似度学習と重み付け
類似度学習と重み付けは、単なる距離に頼らず、補完がうまくいく方向へ類似度関数を学習する発想である。重みが適切に学習されると、欠損部に有用な近傍だけが強く反映される。
学習型の重み付けでは、損失関数や正則化、学習データの欠損状況をどう扱うかが性能を左右する。単純な近傍法より柔軟だが、データ量が少ないと不安定になりやすい。
3.3 統計的手法
3.3.1 平均・中央値補完の基礎
平均・中央値補完は、欠損した変数に対して集団統計を代入する基本手法である。計算が容易で、ベースラインとしてよく用いられる。欠損率が低い場合や解析の初期段階では実用になることもある。
ただしこの方法は分散を縮めやすい。補完値が多くのデータに同じ値として入り、相関構造が歪むことで下流モデルの性能が落ちる場合がある。そのため、評価と組み合わせ戦略(後段での学習調整、指標特徴の導入など)が必要になる。
3.3.2 多重代入法
多重代入法は、欠損値を複数の plausible(ありうる)候補としてサンプルし、それらを用いて推定結果の分散や信頼性を評価する手続きである。確率的補完を明示的に扱うため、不確実性を比較的きれいに反映できる。
手続きのポイントは、各代入において欠損の生成機構を反映した推定を行うこと、そして複数結果を統合する際の分散推定(内的・外的なばらつき)を適切に行うことにある。実務ではサンプル数や収束性が運用上の制約になる。
3.4 機械学習・深層学習系
3.4.1 回帰モデルによる補完
回帰モデルによる補完は、欠損している変数を目的として、観測済みの変数から推定する方針である。線形回帰、決定木、勾配ブースティング、ニューラルネットワークなど多様な回帰器が適用できる。
重要なのは、欠損の有無を入力に含めるかどうか、そして欠損パターンに応じて学習データを切り分けるかという設計である。単に欠損箇所を教師で補正しないと、学習時のデータ分布と推定時の分布がずれて性能低下が生じる。
3.4.2 生成モデルによる補完
生成モデルによる補完は、観測済み成分を条件として、欠損部を整合的に生成する枠組みである。自己回帰モデル、変分オートエンコーダ、条件付き拡散など、データ分布を学ぶ手法がここに含まれる。
生成型は、複数の候補を出せるため、確率分布推定に向く。反面、学習の安定性、サンプリングの計算コスト、欠損マスクに対する頑健性などの課題がある。品質は、欠損領域がどれだけ文脈情報で定まるかに依存する。
3.4.3 拡散系・逐次生成の考え方
拡散系・逐次生成は、ノイズからデータへ段階的に復元する過程を学習し、条件付きで欠損部を生成する考え方である。欠損セルだけをマスクし、既知部分は固定しながら更新していく設計が一般的である。
逐次生成は、精細な復元に強みがある一方、反復回数が多くなるほど推論コストが増える。運用では高速化(少数ステップ化、蒸留、サンプリング戦略の改善など)が検討されることが多い。
3.5 自己教師あり・表現学習の活用
3.5.1 マスク学習の基本
マスク学習は、学習時に入力の一部を意図的に隠し、隠した箇所を予測することで表現を獲得する方法である。補完タスクと整合的で、データの潜在構造を捉えやすい。
欠損位置のマスク戦略は性能に影響する。ランダムマスクだけでなく、欠損の現れ方に近いマスクを用いると、実運用に近い挙動になる。評価では補完誤差だけでなく、表現がどの程度下流タスクに寄与するかを確認する。
3.5.2 表現の再利用と転移
表現学習で得た埋め込みは、補完以外のタスクにも再利用できる。自己教師あり学習で獲得した特徴は、欠損補完においても汎化性能を高めることがある。たとえば別ドメインのデータで学んだ埋め込みを微調整して、別種類の欠測パターンに適応するような転移が行われる。
転移の際は、データ分布の差と欠損機構の変化に注意が必要である。単純な微調整だけでなく、補完に関わる損失や正則化を調整することで、過適合を抑えつつ適応する設計が求められる。
4 評価と実務上の論点
4.1 評価指標
4.1.1 連続値の誤差指標
連続値の補完では、平均二乗誤差や平均絶対誤差、残差の分位点に基づく指標などが用いられる。欠損値のスケールが異なる場合には正規化した指標が好ましい。
また、分布形状のずれを考慮する評価として、相関の保存度や分散の推定誤差を併用することもある。単に平均誤差が小さくても、上位・下位の極端値が崩れると意思決定に支障が出る。
4.1.2 分類の性能指標
分類目的で補完する場合、補完後の特徴を用いた分類精度、再現率、F1などの指標で評価できる。補完そのものの誤りだけでなく、分類境界への影響をみる点が重要である。
欠損が特定のクラスに偏っていると、補完モデルがクラス分布を歪めるリスクがある。誤差指標はマクロ・マイクロ平均などで偏りの影響を点検する。
4.1.3 ランキング・推薦の評価
推薦領域では、欠けた評価を補うことがランキング品質に直結する。そこでNDCG、MAP、MRR、順位相関などが評価に利用される。候補集合の作り方や負例サンプリングの設定が指標に影響するため、評価手順の固定が重要になる。
補完がランキングに与える影響は、一般に「観測されていない事実」を推定して並べる性質を持つ。従ってランダムな欠損仮定だけで測ると現実から乖離する可能性があり、サンプリング設計の妥当性確認が欠かせない。
4.2 実験設計
4.2.1 欠損のシミュレーション
現実の欠測が未知な場合、研究・検証では欠損を人工的に発生させて評価することが多い。ランダム欠損、条件付き欠損、ブロック欠損など、仮定したメカニズムに応じてシミュレーションを変える。
ただし人工欠損は現実を完全に模倣できない。現場の欠損率や時系列の連続欠測、センサ稼働条件などを反映し、検証の外挿可能性を高める工夫が求められる。
4.2.2 後処理とリーク対策
欠損補完は前処理として扱われることが多いが、リークが起きると評価が不当に良く見える。たとえばテストデータを含めて補完の統計量を計算したり、欠損位置の情報が学習時に混入したりすると、性能が過大評価される。
対策として、分割ごとに補完器を学習し、欠損推定に必要な統計・モデルを訓練側だけで構築する。さらに欠損マスク自体が予測に有用な情報である場合は、その扱いを慎重に定義する必要がある。
4.3 バイアス・公正性・安全性
4.3.1 欠損に由来する偏り
欠損はサンプリングの偏りを生むため、補完の結果が特定集団に不利・不公平に作用する可能性がある。たとえば測定されにくい集団ほど不確実性が高く、補完値がその傾向を強めることがある。
バイアス検討では、欠損率と属性の関係、補完後の分布変化、下流意思決定の差分指標などを多面的に測る。改善策として欠損機構の補正、再重み付け、モデルの不確実性反映が検討される。
4.3.2 ドメイン外データへの頑健性
補完モデルは学習時の分布に強く依存し、ドメインが変わると推定品質が落ちる。環境変化や計測機器の仕様更新により、欠損の出方や特徴量の分布が変わることがある。
対処として、分布シフト検出、キャリブレーションの更新、頑健学習、複数モデルのアンサンブルなどが用いられる。安全性の観点では、信頼度が低いときに補完を強制せず、確認手順へ誘導する運用設計が有効である。
4.4 計算資源と運用
4.4.1 学習・推論の計算量
補完器の種類により計算負荷は大きく異なる。単純な統計代入は軽いが、生成型や逐次生成は推論回数が増えるため計算コストが支配的になる。さらに欠損パターンごとの最適化が必要な場合、実装上のオーバーヘッドも増える。
運用では処理時間の制約、同時アクセス数、再学習頻度を踏まえ、モデル選択と最適化(軽量化、蒸留、キャッシュ)が必要になる。計算量と品質のトレードオフを明確化することが実務上の要件となる。
4.4.2 モデル更新と監視の方法
モデル更新では、データ分布の変化や欠損機構の変化に追随する必要がある。監視では、補完誤差の代理指標(観測可能部分の再現、下流タスクの変化、信頼度の偏り)を用いることが多い。
また、欠損率の急増や新しい欠損パターンの出現は重要なアラートになる。更新頻度と安全に関する承認フローを組み合わせ、品質劣化が長期間にわたり継続しない仕組みを整える。
4.5 典型的な失敗例
4.5.1 過学習による見かけの改善
過学習は、欠損補完器が訓練データの欠損パターンに強く適合し、検証では一見良好に見えても本番で崩れる原因になる。特に高次元特徴と欠損率が高い場合に起きやすい。
兆候として、欠損率が変化したときの性能急落、特定セグメントでのみ誤差が増えること、信頼度のキャリブレーションが崩れることが挙げられる。正則化、データ拡張、分割設計の見直しが対策になる。
4.5.2 不自然な復元と外れ値への脆弱性
補完結果がデータ分布に整合せず、不自然な値が混入することがある。外れ値に強くない手法では、欠損セルの周辺にある稀なパターンが異常値として広がり、復元が破綻する。
対策として、外れ値検出やロバスト損失、確率分布推定による不確実性の表現が有効である。さらに、復元品質を人手確認できるサンプリング運用や、信頼度が低い場合の抑制(再計測・問い合わせ・保守的推定)も実務上の安全策となる。