この記事の要点
- コンピュータビジョン(Computer Vision、CV)は、カメラの画像や映像から、写っているものや状況をコンピュータに理解させる技術分野 です。
- 代表的なタスクは、画像全体に1つの答えを出す 画像分類、物の位置を枠で示す 物体検出、画素ごとに分ける セグメンテーション など。「何を出力するか」で区別すると覚えやすくなります。
- 2012年ごろから、画像認識では深層学習(特に CNN)を使う方法が主流になりました。
- IoTでは、製造の外観検査、店舗や道路の人流・交通の把握、農業の生育の確認などに使われます。映像は重いので、エッジで処理して結果だけ送る 構成がよく選ばれます。
コンピュータビジョンとは何か?
コンピュータビジョンは、画像や映像を入力にして、そこに 何が・どこに・どんな状態で 写っているかを取り出す技術の総称です。人間の視覚がしている「見て分かる」をコンピュータで行う分野と言えます。
以前は、エッジ(輪郭)や色などの特徴を人が設計して取り出す方法が中心でした。2012年に、大規模な画像データセット ImageNet を使った画像認識の競技会で、深層学習(CNN)を使った手法が大きく精度を上げたことをきっかけに、深層学習が主流になりました。深層学習そのものは ディープラーニングとは で解説しています。
画像の入口であるカメラの仕組み(光を電気信号に変えるイメージセンサ)は、CMOSイメージセンサとは で整理しています。CV は、センサが作った画像を「意味」に変える側の技術です。
代表的なタスクは、何が違う?
タスクの違いは、「出力が何か」で比べると区別しやすくなります(当サイトの整理)。
| タスク | 出力 | IoTでの使いどころの例 |
|---|---|---|
| 画像分類 | 画像全体に1つのラベル(例:良品/不良品) | 製品の外観検査で、合否を判定する |
| 物体検出 | 物ごとの位置(枠)とラベル | 通路の人や車の数を数える、侵入を見つける |
| セグメンテーション | 画素ごとのラベル(領域の形) | 農地の画像で作物と雑草の領域を分ける |
| 姿勢推定 | 人の関節などの位置 | 作業者の姿勢から負担や転倒を見つける |
| 物体追跡 | 動画の中で同じ物の位置の変化 | 人流や車の動線を把握する |
| 文字認識(OCR) | 画像の中の文字 | アナログメーターの値を読み取る、ナンバーを読む |
← 表は横にスクロールできます →
試験では「位置まで分かるのはどれか」「画素単位で分けるのはどれか」のように、出力の違い で問われると考えておくと対応しやすくなります(推定)。
カメラから結果が出るまで、どう流れる?
- 撮影: カメラ(イメージセンサ)が光を画像データに変えます。
- 前処理: 大きさをそろえる、明るさやゆがみを補正する、ノイズを減らすなどの処理をします。
- 推論: 学習済みのモデルに画像を入れ、分類・検出などの結果を得ます。
- 後処理と判断: 結果を集計したり、しきい値と比べたりして、「異常あり」などの判断にします。
- 送信と活用: 判断や集計の結果をクラウドに送り、通知・記録・分析に使います。
推論をどこで行うかが IoT の設計の要点です。映像をそのままクラウドへ送ると通信量が大きく、遅延も生じます。そのため、カメラやゲートウェイの近くで推論し、結果だけを送るエッジAI の構成がよく選ばれます。詳しくは エッジAIとは を参照してください。
使うときに何に注意する?
- プライバシー: 人が写る映像は個人情報に当たる場合があります。撮影していることの掲示、必要な範囲だけの撮影、映像を残さず結果だけを保存する設計などを検討します。
- 環境の変化: 明るさ、天候、カメラの汚れや向きのずれで精度が落ちます。現場での検証と定期的な見直しが必要です。
- 学習データの偏り: 学習に使った画像と違う条件(別の製品、別の季節)では、精度が下がることがあります。
- 誤検知と見逃し: どちらを減らすかで、しきい値の決め方が変わります。検査では見逃しの害が大きいことが多いです。
CV の開発では、画像処理のオープンソースのライブラリ OpenCV などがよく使われます。用語の理解を問題で確かめるなら IoT基礎の無料お試し も使えます。
どこで取り違えやすい?
- 画像分類と物体検出: 分類は画像全体に1つの答え、検出は物ごとの位置と種類です。1枚に複数の物が写る場面では検出が必要になります。
- 物体検出とセグメンテーション: 検出は枠(四角)で位置を示し、セグメンテーションは画素単位で形まで分けます。
- イメージセンサと CV: イメージセンサは光を信号に変える部品、CV は画像から意味を取り出す技術です。
- エッジで処理すれば個人情報の問題は無い: 送る量や漏れる機会は減りますが、撮影そのものの扱いは別に考える必要があります。
確認問題1:タスクの区別
(当サイトの独自問題)1枚の画像に写っている複数の人や車について、それぞれの位置を枠で示し、種類を判定するコンピュータビジョンのタスクとして、最も適切なものはどれか。
- 画像分類
- 次元削減
- 文字認識
- 物体検出
正解:4。物体検出は、物ごとの位置(枠)と種類を出力します。
1:画像分類は画像全体に1つのラベルを付け、位置は出しません。2:次元削減はデータの特徴の数を減らす処理で、CV のタスク名ではありません。3:文字認識は画像の中の文字を読み取るタスクです。
確認問題2:画素単位の処理
(当サイトの独自問題)ドローンで撮った農地の画像を、画素ごとに「作物」「雑草」「土」に分けたい。このとき用いるタスクとして、最も適切なものはどれか。
- セグメンテーション
- 姿勢推定
- 画像分類
- 物体追跡
正解:1。セグメンテーションは画素ごとにラベルを付け、領域の形まで分けます。
2:姿勢推定は人などの関節の位置を推定するタスクです。3:画像分類は画像全体に1つのラベルを付けるだけです。4:物体追跡は動画の中で同じ物の動きを追うタスクです。
確認問題3:エッジで推論する理由
(当サイトの独自問題)監視カメラの映像をカメラの近くで推論し、検出結果だけをクラウドへ送る構成の主な利点として、最も適切なものはどれか。
- 通信量と応答の遅延を減らしやすい
- カメラの解像度が自動的に上がる
- 学習データを用意しなくてもモデルが作れる
- 撮影した映像を無制限に保存できる
正解:1。映像全体ではなく結果だけを送るので通信量が減り、現場で判断できるので遅延も小さくしやすくなります。
2:推論の場所とカメラの解像度は関係ありません。3:推論に使うモデルは、どこで動かすかに関係なく学習が必要です。4:エッジ側の機器の記憶容量は限られており、無制限ではありません。
よくある質問
画像認識とコンピュータビジョンは同じ意味ですか?
画像認識(何が写っているかを認識すること)は、コンピュータビジョンの中心的な課題の一つです。CV は、3次元の形の復元や動きの推定なども含む、より広い分野を指します。
CVに使うカメラは特別なものが必要ですか?
用途によります。外観検査では高い解像度や照明の工夫が要ることが多く、人流の把握などでは一般的なネットワークカメラでも使われます。暗い場所では赤外線カメラを使うこともあります。
IoT基礎でCVはどの分野に入りますか?
公式のカテゴリでいえば、センサ(画像センサ)とデータ活用(AI)の両方にかかる内容です。改訂4版では、出版社の紹介文で CV がコラムの話題として挙げられています(2026年9月27日確認)。
出典・参考
本番と同じペースで腕試し
記事の次は、本番形式の問題で。
公式の出題カテゴリの比率どおりに組んだ無料お試しを、登録不要・カード不要で解けます。続きの模試と章別ドリルは買い切りで、月額はかかりません。
あわせて読みたい
当サイトは、モバイルコンピューティング推進コンソーシアム(MCPC)とは関係のない個人が運営する非公式の学習教材です。掲載している問題はすべて当サイトのオリジナルで、実際の試験問題・過去問題・再現問題ではありません。試験の日程・受検料・出題範囲は公式サイト(https://www.mcpc-jp.org/license/ )で必ず確認してください。合格を保証するものではありません。合格の目安は当サイトの推定です。技術・制度の記述は「最終確認日」時点のものです。