この記事の要点
- 第3章はデータ処理方式、データ分析方法、データ活用技術、ロボットとIoTを扱う、範囲の広い章です。
- 教師あり/なし、分類/回帰、適合率/再現率のように 対になる言葉の区別 が得点の分かれ目になりやすい分野です。
- 学習時間の目安は 当サイトの目安 で、合計8〜10時間です。
第3章の全体像
押さえる用語と対比
| 対になる用語 | 違い |
|---|---|
| 教師あり学習 / 教師なし学習 | 正解ラベル付きデータで学ぶか、ラベルなしで構造(クラスタなど)を見つけるか |
| 分類 / 回帰 | カテゴリを当てるか、連続値を予測するか |
| 適合率 / 再現率 | 陽性と予測した中の正解の割合か、本当の陽性のうち見つけた割合か |
| 過学習 / 汎化 | 訓練データに合わせすぎて未知データで外すか、未知データでも当たるか |
| 相関 / 因果 | 一緒に動くだけか、一方が原因で他方が変わるか |
| 正規化 / 標準化 | 値を0〜1などの範囲に収めるか、平均0・分散1にそろえるか |
← 表は横にスクロールできます →
ビッグデータの特徴は NIST のビッグデータ参照アーキテクチャ(SP 1500シリーズ)でも整理されています。基本は ビッグデータの3V を参照してください。
第3章を読むときの視点
第3章は範囲が広く、用語の数も多い章です。すべてを同じ深さで覚えようとすると時間が足りなくなるため、当サイトでは「データの流れ」に沿って整理することをすすめています。収集したデータを前処理し、蓄積し、分析して、結果を現場に戻すという流れの中で、各用語がどこで使われるかを確かめます。
分析手法は、目的から逆算して選ぶ練習が有効です。「グループに分けたい」ならクラスタリング、「数値を予測したい」なら回帰、「異常を見つけたい」なら外れ値検知、というように、目的と手法を一組で覚えます。問題文に目的が書かれていれば、手法の名前を知らなくても消去法で絞り込めます。
評価指標は、混同行列(真陽性・偽陽性・偽陰性・真陰性)を毎回自分で書いてから計算すると、適合率と再現率の取り違えを防げます。見逃しを減らしたいのか、誤報を減らしたいのかという目的とセットで覚えてください。
ロボットとIoTの節は、センサで状態を捉えて制御に返すという点で、第5章のアクチュエータとつながります。
間違えやすい点
| よくある誤解 | 正しい理解 |
|---|---|
| 正解率が高ければ良いモデル | 陽性がまれなデータでは、全部陰性と答えても正解率は高くなる |
| 相関係数が0なら無関係 | 直線的な関係がないだけで、曲線的な関係はありうる |
| データは多いほど前処理は不要 | 欠損・外れ値・単位のずれは量が増えるほど影響が大きい |
| 深層学習は常に機械学習より優れる | データが少ない場合や説明性が必要な場合は従来手法が向く |
← 表は横にスクロールできます →
具体例で確かめる:混同行列から指標を計算する
設備1,000台のうち実際に故障の予兆があったのが20台で、モデルが「予兆あり」と判定したのが25台、そのうち本当に予兆があったのが16台だったとします。これを混同行列にすると次のとおりです。
| 予兆ありと判定 | 予兆なしと判定 | 合計 | |
|---|---|---|---|
| 実際に予兆あり | 16(真陽性TP) | 4(偽陰性FN) | 20 |
| 実際に予兆なし | 9(偽陽性FP) | 971(真陰性TN) | 980 |
| 合計 | 25 | 975 | 1,000 |
← 表は横にスクロールできます →
再現率=TP÷(TP+FN)=16÷20=80%、適合率=TP÷(TP+FP)=16÷25=64%、正解率=(TP+TN)÷全体=987÷1,000=98.7%です。一方、全台を「予兆なし」と答えるだけのモデルでも正解率は980÷1,000=98%になります。正解率だけで評価すると、見逃しだらけのモデルを良いと判断してしまう理由がこの数字から分かります。
よくあるミスは、適合率と再現率の分母を取り違えることです。適合率の分母は「予兆ありと判定した数(列の合計)」、再現率の分母は「実際に予兆があった数(行の合計)」と、表のどちらの合計かで覚えると間違えにくくなります。見逃しの損失が大きい予知保全では再現率を、誤報の対応コストが大きい場面では適合率を重視します。
他の章とのつながり
第3章は、IoTで集めたデータを価値に変える部分を扱うため、第1章の「サービス」の要素と直結しています。データを集めるだけでは価値は生まれず、分析して判断や制御に生かして初めて意味を持つ、という流れを意識してください。
前処理の重要性も押さえておきたい点です。センサのデータには欠損、外れ値、時刻のずれ、単位の違いが含まれることが多く、そのまま分析すると誤った結論を導きます。前処理の手法(補完、平滑化、正規化、標準化など)は、目的とセットで覚えると選択肢の判断に使えます。
予知保全は、第3章の分析手法と第5章のセンサの知識を組み合わせた代表的な応用です。振動や温度の変化から故障の兆しを見つけるという具体例で、手法の使いどころを確認しておくとよいでしょう。
学習の順番と時間の目安
以下は 当サイトの目安 です。範囲が広いので、2〜3回に分けて進めます。
- 処理方式と前処理(1.5時間)
- 統計の基本と評価指標。混同行列を自分で書いて計算する(2時間)
- 機械学習・深層学習の分類(2時間)
- ロボットとIoT(1時間)
- 問題演習と誤答の分類(2〜3時間)
本番形式の問題は IoT中級の無料お試し で試せます。
確認問題(オリジナル)
問1 設備の故障予兆を検知するモデルで、見逃しを最も減らしたい。重視する指標として最も適切なものはどれか。
ア:故障と判定した事例のうち、本当に故障だった割合/イ:本当に故障した事例のうち、正しく検知できた割合/ウ:全ての事例のうち、判定が正しかった事例の割合/エ:正常な事例のうち、正常と判定できた事例の割合
正解:イ(再現率)。アは適合率、ウは正解率、エは特異度で、いずれも見逃しを直接表す指標ではありません。
問2 正解ラベルのない稼働データを、似た傾向ごとのグループに分けたい。手法として最も適切なものはどれか。
ア:過去の値から将来の値を当てる時系列予測を使う方法/イ:ラベル付きのデータで学習させる回帰分析を使う方法/ウ:報酬を最大化する行動を学ぶ強化学習を使う方法/エ:ラベルなしのデータを距離で分けるクラスタリングを使う
正解:エ。イは正解ラベルが必要、ウは行動の学習、アは予測で、グループ分けの目的と合いません。
問3 訓練データでは精度が高いのに、新しいデータでは精度が大きく下がった。原因として最も考えやすいものはどれか。
ア:モデルが訓練データに合わせすぎた過学習が起きている/イ:訓練データの量が多すぎて、学習が進まなかったため/ウ:評価に使ったデータに正解ラベルが付いていたため/エ:入力の値をあらかじめ正規化して学習させたため
正解:ア。イはむしろ過学習を抑える方向、ウは評価に必要な条件、エは一般に学習を安定させる処理です。
よくある質問
数式はどこまで必要ですか?
当サイトでは、平均・分散・相関係数の意味と、混同行列からの指標計算ができれば十分な出発点と考えています。
生成AIは第3章の範囲ですか?
章の見出しには含まれていません。関連知識として 生成AIとIoT を読んでおくと安心です。
第3章から読み始めてもいいですか?
構いません。データ活用は公式の出題カテゴリでも大きな比率を占めるため、早めに着手する価値があります。
統計検定のような深い知識は必要ですか?
当サイトでは不要と考えています。平均・分散・相関・回帰の意味と、評価指標の使い分けが中心です。
深層学習のネットワーク構造は覚えますか?
CNNは画像、RNNやTransformerは系列データに使われる、という対応を押さえれば出発点として十分です。
前処理では具体的に何をしますか?
欠損値の補完や除去、外れ値の確認、単位やサンプリング間隔のそろえ、正規化や標準化などです。センサデータは通信の途絶や故障で抜けや異常値が混ざりやすいため、分析の前に必ず確認します。
F値とは何ですか?
適合率と再現率の調和平均で、2×適合率×再現率÷(適合率+再現率)で求めます。本文の例(適合率64%、再現率80%)では約71%です。どちらか一方だけが高いモデルを過大評価しないための指標です。
回帰と分類はどう見分けますか?
答えが数値(明日の電力使用量、残り寿命の日数など)なら回帰、カテゴリ(故障か正常か、どの種類の不良か)なら分類です。問題文で「何を出力するか」に注目すると迷いません。
予知保全と予防保全の違いは何ですか?
予防保全は決めた時期や稼働時間ごとに点検・交換する方法、予知保全はセンサデータから状態を見て、故障の兆しが出たときに手を打つ方法です。後者は無駄な交換と突発停止の両方を減らせる可能性があります。
出典・参考
本番と同じペースで腕試し
記事の次は、本番形式の問題で。
公式の出題カテゴリの比率どおりに組んだ無料お試しを、登録不要・カード不要で解けます。続きの模試と章別ドリルは買い切りで、月額はかかりません。
あわせて読みたい
当サイトは、モバイルコンピューティング推進コンソーシアム(MCPC)とは関係のない個人が運営する非公式の学習教材です。掲載している問題はすべて当サイトのオリジナルで、実際の試験問題・過去問題・再現問題ではありません。試験の日程・受検料・出題範囲は公式サイト(https://www.mcpc-jp.org/license/ )で必ず確認してください。合格を保証するものではありません。合格の目安は当サイトの推定です。技術・制度の記述は「最終確認日」時点のものです。