この記事の要点
- 第6章は、集めたデータを価値に変える方法を、統計の基礎から機械学習・深層学習・生成AIまで順に扱う章。
- 平均と中央値、相関と因果、教師あり学習と教師なし学習、過学習など、対になる用語の区別が中心。
- 計算問題が苦手でも、定義と「どんな場面で使うか」を言えるようにすれば対応しやすい。
第6章の全体像:どの節で何を学ぶ?
第6章「IoTでデータを活用する」は6つの節とコラムで構成されます。表の学習ポイントは当サイトの独自の整理で、テキスト本文の要約ではありません。
| 節 | 学習ポイント(当サイトの整理) |
|---|---|
| 6-1 データ活用 | 収集・前処理・分析・可視化・活用の流れ |
| 6-2 統計と確率 | 平均・中央値・分散・標準偏差と、確率の基本 |
| 6-3 相関と回帰 | 2つの量の関係の強さと、一方から他方を予測する式 |
| 6-4 機械学習 | 教師あり・教師なし・強化学習の区別と評価の考え方 |
| 6-5 深層学習 | 多層のニューラルネットワークと画像・音声への応用 |
| 6-6 生成AI | 文章や画像を生成するモデルと、使うときの注意点 |
| コラム:GAN | 生成器と識別器を競わせて学習する仕組み |
← 表は横にスクロールできます →
押さえる用語と対比:似た言葉をどう区別する?
| 用語A | 用語B | 見分け方 |
|---|---|---|
| 平均値 | 中央値 | 中央値は並べた真ん中の値で、極端な外れ値の影響を受けにくい |
| 分散 | 標準偏差 | 標準偏差は分散の平方根で、元のデータと同じ単位になる |
| 相関 | 因果 | 一緒に変化することと、一方が原因で他方が起こることは別 |
| 教師あり学習 | 教師なし学習 | 正解ラベル付きのデータで学ぶか、ラベルなしで構造(グループなど)を見つけるか |
| 分類 | 回帰 | カテゴリを当てるか、数値を予測するか |
| 過学習 | 汎化 | 学習データにだけ合いすぎるか、未知のデータにも当てはまるか |
| 適合率 | 再現率 | 陽性と判定した中の正解の割合か、本当の陽性をどれだけ拾えたか |
← 表は横にスクロールできます →
間違えやすい点:どこで点を落としやすい?
| 誤解 | 正しい理解 |
|---|---|
| 相関係数が1に近ければ因果関係がある | 相関は関係の強さを示すだけで、原因と結果までは示さない |
| 相関係数は0から1の範囲 | −1から1の範囲。負の値は一方が増えると他方が減る関係 |
| 学習データでの精度が高ければよいモデル | 未知のデータでの性能(汎化)を、別のデータで確かめる必要がある |
| クラスタリングは教師あり学習 | 正解ラベルを使わないので教師なし学習 |
| 生成AIの出力は常に正確 | もっともらしい誤り(ハルシネーション)を含むことがあり、確認が必要 |
← 表は横にスクロールできます →
統計と機械学習をつなげて理解するには?
第6章は、前半の統計と後半の機械学習が別々の話に見えがちですが、「データから傾向をつかみ、予測や判断に使う」という同じ目的の、手作業寄りと自動寄りの方法と捉えるとつながります。回帰分析は統計の手法であると同時に、機械学習の「回帰」タスクの出発点でもあります。
統計の用語は、小さな数字で手を動かすと定着します。たとえば「2、4、4、5、100」という5個のデータなら、平均値は23、中央値は4です。1つの外れ値で平均が大きく動く一方、中央値はほとんど変わらないことが実感できます。センサのデータには故障や通信の誤りによる外れ値が混ざりやすいため、IoTでこの違いが大切になる理由も説明できるようになります。
機械学習は、正解ラベルがあるかで教師あり・教師なしを分け、教師ありの中では答えがカテゴリか数値かで分類・回帰を分ける、という2段階で整理します。強化学習は「行動に対する報酬」で学ぶ、別の枠組みです。評価の考え方では、学習に使ったデータとは別のデータで性能を確かめること(過学習の防止)が基本になります。
生成AIは新しい話題で、仕組みよりも使い方の注意点が問われやすいと当サイトは考えています。誤った内容をもっともらしく出力する可能性、入力した情報の取扱い、著作権などの論点を、IPAのガイドラインなど一次資料で確認しておくと安心です。GANのコラムは、生成器と識別器の2つを競わせるという構造を一文で言えれば十分でしょう。
学習の順番と時間の目安は?
以下は当サイトの目安で、公式の推奨ではありません。
- 6-1でデータ活用の流れを押さえる(約30分)
- 6-2と6-3で統計の用語を手計算の小さな例で確かめる(約2時間)
- 6-4で学習の種類と評価指標を表にする(約1.5時間)
- 6-5と6-6、コラムで深層学習と生成AIの位置づけを読む(約1時間)
- 問題演習で確認する(約1時間)
合計で約6時間が目安です。統計が苦手な方は、5個程度の数字で平均・中央値・分散を実際に計算すると定義が定着します。問題形式で確かめたい方はIoT基礎の無料お試しも使えます。
具体例で確かめる:平均値と中央値の差
5台のセンサの1日の稼働時間が 8、9、9、10、64(時間)だったとします。64は記録の誤りと思われる外れ値です。平均値は(8+9+9+10+64)÷5=20時間となり実態より大きく出ますが、並べた真ん中の値である中央値は9時間で、外れ値の影響をほとんど受けません。1日は24時間なので、64時間という値自体がデータの前処理で見つけるべき誤りだと気づけることも大切です。
よくあるミスは、相関係数が高いことを「原因と結果の関係がある」と読んでしまうことです。アイスの売上と水難事故がともに増えるのは、気温という共通の要因によるもので、一方が他方の原因ではありません。
確認問題1:外れ値に強い代表値は?
極端に大きな値が1つ混ざったデータで、その影響を最も受けにくい代表値はどれか。
- 平均値
- 中央値
- 合計値
- 最大値
正解:2。中央値は並べたときの真ん中の値なので、端の極端な値に左右されにくい性質があります。
1の平均値は外れ値に引っ張られます。3の合計値と4の最大値は、外れ値がそのまま結果に反映されます。
確認問題2:教師なし学習の例は?
次のうち、教師なし学習の例として最も適切なものはどれか。
- 過去の気温と売上から明日の売上を予測する
- ラベル付きの画像で犬と猫を見分けさせる
- 購買履歴から似た顧客をグループに分ける
- 報酬を最大にする行動を試行錯誤で覚える
正解:3。正解ラベルなしでデータの構造を見つけるクラスタリングは教師なし学習です。
2は正解ラベルを使う分類で教師あり学習です。1は数値を予測する回帰で、これも教師あり学習です。4は強化学習の説明です。
確認問題3:相関についての正しい説明は?
相関についての説明として、最も適切なものはどれか。
- 負の相関は2つの量に関係がないことを示す
- 相関係数が高ければ必ず因果関係がある
- 相関係数は0から100の範囲の百分率で示す
- 相関係数はマイナス1から1の範囲をとる
正解:4。相関係数は−1から1までの値をとり、絶対値が1に近いほど直線的な関係が強くなります。
2は相関と因果の混同です。3は範囲の誤りです。1は、負の相関は一方が増えると他方が減る関係で、無関係を示すのは0付近です。
よくある質問
分散と標準偏差はどう使い分けますか?
どちらもデータのばらつきを表しますが、分散は差を2乗して平均した値なので、単位も2乗になります。標準偏差は分散の平方根をとって元の単位に戻したもので、「平均から典型的にどのくらい離れているか」を直感的に読めます。センサの測定値のばらつきを説明するときは、標準偏差のほうが扱いやすいことが多いでしょう。
データの前処理はどこまで知っておけばよいですか?
IoTのデータには、通信の途切れによる欠損、センサの故障による異常な値、時刻のずれなどが混ざります。当サイトでは、欠損値の扱い(除く・補う)、外れ値の確認、単位や尺度をそろえる正規化、時刻をそろえる処理といった代表的な作業の名前と目的を言えるようにしておくことをすすめます。分析の精度は前処理で大きく変わるため、データ活用の流れの中でも重要な工程です。
適合率と再現率はどちらを重視すればよいですか?
用途によって変わります。故障の見逃しが大きな損害につながる設備監視では、本当の異常をできるだけ拾う再現率を重視します。逆に、誤った警報が多いと現場が対応しきれない場合は、警報の正しさを示す適合率を重視します。どちらか一方だけを高めるともう一方が下がりやすい、という関係もあわせて押さえておきましょう。
計算問題は出ますか?
出題形式の詳細は公式に公表されていないため、当サイトでは簡単な計算(平均・中央値など)もできるように準備することをすすめています。
生成AIはどこまで学べばよいですか?
仕組みの概要と、誤りを含む可能性や情報漏えいなど利用上の注意点を説明できるようにしておくとよいでしょう。IPAのテキスト生成AIの導入・運用ガイドラインが参考になります。
深層学習と機械学習の関係は?
深層学習は機械学習の一部で、多層のニューラルネットワークを使う方法です。
分散と標準偏差の違いは何ですか?
どちらもデータのばらつきを表します。分散は平均との差を2乗して平均したもの、標準偏差はその平方根です。標準偏差は元のデータと同じ単位(温度なら℃)になるため、ばらつきの大きさを直感的に比べやすいのが利点です。
出典・参考
本番と同じペースで腕試し
記事の次は、本番形式の問題で。
公式の出題カテゴリの比率どおりに組んだ無料お試しを、登録不要・カード不要で解けます。続きの模試と章別ドリルは買い切りで、月額はかかりません。
あわせて読みたい
当サイトは、モバイルコンピューティング推進コンソーシアム(MCPC)とは関係のない個人が運営する非公式の学習教材です。掲載している問題はすべて当サイトのオリジナルで、実際の試験問題・過去問題・再現問題ではありません。試験の日程・受検料・出題範囲は公式サイト(https://www.mcpc-jp.org/license/ )で必ず確認してください。合格を保証するものではありません。合格の目安は当サイトの推定です。技術・制度の記述は「最終確認日」時点のものです。