分析モデルを継続的に運用するための仕組み、MLOpsとデータガバナンス。実務で必須。
モデルを作って終わり、じゃないんでしょ?
そうそう、その通りなのよ。 デプロイ後の運用・監視・再学習までを管理する考え方がMLOps。 DevOpsのML版ね。
MLOpsの主要要素は (1)データ管理(版数・品質)、(2)モデル管理(版数・実験記録)、(3)パイプライン自動化、(4)継続学習・継続デプロイ、(5)モニタリング(データドリフト・モデルドリフト)。
データドリフトって、なぁに?
本番データが訓練データから分布的に逸脱していく現象。 例えばコロナ前のデータで学習した需要予測モデルが、コロナ後の購買行動の変化で精度が落ちる、というケース。
じゃあ、どう対策するの?
(1)入力データの分布を継続監視、(2)精度劣化を検出したら再学習、(3)定期的にモデルを更新、というサイクルを回す。 これが MLOps の要諦。
データガバナンスは『組織内のデータ管理体制』。 データの責任者・利用ルール・品質基準・セキュリティ・コンプライアンスを定める仕組み全般。
個人情報保護とは違うんですかぁ?
個人情報保護はガバナンスの一要素。 ガバナンスはもっと広く、『誰がどのデータをどう使えるか』『データの正確性をどう担保するか』『データ提供契約はどう結ぶか』まで含む。
データ提供契約って、何のこと?
他社や個人からデータの提供を受けるときに結ぶ契約のことね。 利用範囲・期間・再提供制限・損害賠償などを定める。 経産省の『データ取引契約ガイドライン』が参考になるわよ。
プライバシー・バイ・デザインという考え方も重要。 システム設計の最初からプライバシー保護を組み込む、というGDPR推奨の原則。
DS検定★では、MLOpsの『継続的監視・再学習』と、ガバナンスの『データの責任者・利用ルール・品質』を押さえておきましょう。
確認クイズ
MLOpsで『データドリフト』に対処する最も適切な対応はどれか。
- モデルを一度作ったら変更しない
- 入力データ分布を継続監視し、精度劣化時に再学習する
- 全データを毎日全部破棄する
- デプロイをやめる
こたえを見る
正解: 2. 入力データ分布を継続監視し、精度劣化時に再学習する
入力データ分布を継続監視し、精度劣化時に再学習するのがMLOpsのデータドリフト対策。 データドリフトは現代MLの最大の運用リスクの1つで、継続監視と再学習サイクルが必須です。