この記事の要点
- エッジAIは、スマホや IoT 機器、工場のゲートウェイなど、データが生まれる場所の近く(エッジ)で AI の推論を行う方式です。クラウドにデータを送って処理するクラウドAIと対になります。
- 利点は、応答の遅れが小さい、通信量が減る、映像などの生データを外に出さずに済む場合がある、通信が切れても動く、の4つ。代わりに、端末の計算能力・メモリ・電力の制約を受けます。
- 端末では、AI の演算に特化した NPU と、モデルを小さく軽くする量子化・枝刈り・知識蒸留が組み合わされます。
- モバイル2級では「生成AI、IoTシステム及び主要アプリケーションの種類とその概要」(公式ページの図で23%)の範囲です。
エッジAIとは?一言でいうと?
エッジAIは、学習済みの AI モデルを端末やその近くの機器に載せ、データが生まれたその場で推論(判定・予測・生成)を行う方式です。ここでいうエッジは、ネットワークの「端」、つまり利用者やセンサに近い側を指します。
たとえば、スマホのカメラで撮った写真から人の顔を見つけて明るさを整える、工場のカメラ映像から不良品をその場で見分ける、スマートスピーカーが呼びかけの言葉だけを端末内で聞き分ける、といった使い方が当てはまります(当サイトが挙げた説明用の例です)。
注意したいのは、エッジAIの多くは推論をエッジで行うという意味で、モデルを作る学習は、大量のデータと計算資源があるクラウドやデータセンターで行うのが一般的だという点です。「学習はクラウド、推論はエッジ」と役割を分ける構成がよく見られます。
エッジAIとクラウドAIは何が違う?(遅延・通信量・プライバシー)
どちらが優れているかではなく、何を優先するかで使い分けます。当サイトの整理で比べます。
| 観点 | エッジAI | クラウドAI |
|---|---|---|
| 処理する場所 | 端末や近くの機器 | データセンターのサーバー |
| 応答の遅れ(遅延) | 通信の往復がないぶん小さくしやすい | 通信の往復と混雑の影響を受ける |
| 通信量 | 結果だけ送ればよく、少なくできる | 映像などの生データを送ると多くなる |
| プライバシー | 生データを端末の外に出さずに済む場合がある | 送ったデータの扱いを管理する必要がある |
| 通信が切れたとき | 推論は続けられる | 処理できなくなる |
| 使えるモデルの大きさ | 計算能力・メモリ・電力の制約を受ける | 大きなモデルを使いやすい |
| モデルの更新 | 多数の端末へ配る仕組みが必要 | サーバー側で一括して更新できる |
← 表は横にスクロールできます →
実際には、両方を組み合わせる構成も多くあります。端末で一次判定をして「怪しいもの」だけをクラウドへ送る、端末で処理しきれない重い依頼だけをクラウドに回す、といった分担です。
端末とクラウドの間には、携帯電話網の基地局に近い場所で処理する MEC(マルチアクセス・エッジ・コンピューティング) という選択肢もあります。ETSI(欧州電気通信標準化機構)は、複数の事業者の MEC 基盤でアプリケーションを動かせるよう、開かれた環境の標準化を進めています。詳しくはMECとは、IoT の文脈での整理はエッジ・フォグ・クラウドの違いをご覧ください。
NPUとは?端末でAIを速く動かす仕組みは?
NPU(Neural Processing Unit) は、ニューラルネットワークの推論に多く現れる計算(大量の掛け算と足し算を並べて行う行列の演算など)を、少ない電力で効率よく処理するための専用の回路です。スマホでは、CPU や GPU と同じ SoC(1つのチップにまとめた処理装置)の中に組み込まれることが多くなっています。
| 処理装置 | 得意なこと | エッジAIでの役割の例 |
|---|---|---|
| CPU | 複雑な分岐を含む汎用の処理 | 前処理・後処理、NPU が扱えない演算の実行 |
| GPU | 同じ計算を大量に並べて行う処理(画像の描画など) | 比較的大きなモデルの推論 |
| NPU | ニューラルネットワークの演算を低い電力で行う | カメラの画像認識や音声認識などを常時・低消費電力で動かす |
← 表は横にスクロールできます →
スマホの SoC の構成はスマホのSoCとARMとはで扱っています。NPU の性能は製品ごとに表し方が異なるため、試験対策としては「AI の演算に特化した回路」という役割と、CPU・GPU との違いを押さえておけば十分に整理できます。
モデルを軽くする方法は?(量子化・枝刈り・知識蒸留)
端末のメモリや電力に収めるため、学習済みのモデルを小さく、速くする工夫が使われます。代表的な3つを並べます。
- 量子化:モデルの重み(や途中の計算値)を、32ビットの浮動小数点数から8ビットの整数などの少ないビット数で表す
- 枝刈り(プルーニング):推論への影響が小さい結合や重みを取り除いて、計算を減らす
- 知識蒸留:大きなモデル(教師)の出力を手本にして、小さなモデル(生徒)を学習させる
量子化の効果について、Google のエッジ向け推論ライブラリ LiteRT の資料は、学習後に行う量子化の種類ごとに、重みを8ビットにする方式でモデルが約4分の1の大きさになり、処理が2〜3倍(計算まで整数で行う方式では3倍以上)速くなる例や、16ビットの浮動小数点にする方式で約半分の大きさになる例を示しています(2026年9月時点の公開資料)。同じ資料は、特に小さなネットワークでは精度が下がることがあるため量子化後の精度を確かめ、下がりすぎる場合は量子化を考慮した学習を検討するよう勧めています。
知識蒸留は、Hinton らが2015年に発表した論文「Distilling the Knowledge in a Neural Network」で広く知られるようになった手法で、複数のモデルを組み合わせた大きな仕組みの知識を、使いやすい1つの小さなモデルへ移すことを目的としていました。
どの手法も「小さく・速く」と「精度」のトレードオフです。「軽量化すれば精度は必ず保たれる」と覚えるのは誤りなので注意しましょう。
モバイル2級ではどう問われる?
エッジAIは、モバイル2級の出題カテゴリ「生成AI、IoTシステム及び主要アプリケーションの種類とその概要」(公式ページの図で23%、2026年9月27日確認)に当たるテーマです。当サイトの推定では、公式テキスト『モバイルシステム技術テキスト 第11版』の第10章「生成AIとAI活用」の範囲に入ります(章とカテゴリの対応は当サイトの推定で、参照しているのは目次の章名だけです)。
4択の形式に当てはめると、次のような観点で知識を確かめられる可能性があります。当サイトの整理であり、出題頻度を示すものではありません(出題頻度は公表されていません)。
- エッジAIの利点(低遅延・通信量の削減・プライバシー・通信断への強さ)と制約
- 学習と推論の役割分担(学習はクラウド、推論はエッジ、という構成)
- NPU の役割と、CPU・GPU との違い
- 量子化・枝刈り・知識蒸留の区別
- MEC やフォグなど、端末とクラウドの間で処理する考え方との関係
試験全体の形式はモバイルシステム技術検定2級とはをご覧ください。
どこで間違えやすい?つまずき別の見直し表
| つまずき | 正しい理解 | 見直しのコツ |
|---|---|---|
| エッジAIは学習も端末で行うものだと思う | 多くは推論をエッジで行い、学習はクラウドなどで行う | 「学習」と「推論」を分けて読む |
| エッジAIならデータは必ず外に出ないと思う | 生データを出さずに済む場合があるが、結果や一部のデータを送る構成も多い | 「送らずに済む場合がある」と限定して覚える |
| 量子化しても精度は変わらないと思う | 精度が下がることがあり、量子化後の確認が推奨されている | 軽量化は精度とのトレードオフ |
| 量子化と知識蒸留を同じ手法だと思う | 量子化は数値の表し方を粗くする。蒸留は小さなモデルを別に学習させる | 「表し方を変える」か「作り直す」か |
| NPU は GPU の別名だと思う | NPU はニューラルネットワークの演算に特化した回路 | 汎用(CPU)・並列(GPU)・AI 特化(NPU) |
| エッジAIとクラウドAIはどちらか一方を選ぶものだと思う | 一次判定を端末、重い処理をクラウドに分ける組合せも多い | 役割分担で考える |
← 表は横にスクロールできます →
確認問題1:重みを少ないビット数で表す軽量化の手法は?
次の文の空欄に入る語句として、最も適切なものはどれか。「学習済みモデルの重みを、32ビットの浮動小数点数から8ビットの整数などに置き換えて、モデルの大きさと計算量を減らす手法を( )という。」
- 1. 知識蒸留
- 2. 枝刈り
- 3. 量子化
- 4. 正規化
正解は3。量子化は、数値を少ないビット数で表すことでモデルを小さく、速くする手法です。LiteRT の資料では、8ビット化でモデルが約4分の1の大きさになる例が示されています。
1が誤りなのは、知識蒸留は大きなモデルの出力を手本に小さなモデルを学習させる手法で、数値の表し方を変えるものではないからです。2が誤りなのは、枝刈りは影響の小さい結合や重みを取り除く手法で、ビット数を減らすものではないからです。4が誤りなのは、正規化は主にデータの値の範囲をそろえる前処理などを指し、モデルを軽くする手法の名前ではないからです。
確認問題2:エッジAIの利点として適切なのは?
クラウドAIと比べたエッジAIの利点として、最も適切なものはどれか。
- 1. 端末の計算能力に関係なく、どんな大きさのモデルでも動かせる。
- 2. 推論を端末内で行い、映像などの生データを外へ送らずに済む場合がある。
- 3. 通信を使わないため、多数の端末へモデルを配る仕組みが要らない。
- 4. 処理を端末に移すので、クラウドAIより常に判定の精度が高くなる。
正解は2。エッジAIでは推論を端末内で行えるため、生データを外部へ送らずに済む構成を取れます。これにより通信量の削減やプライバシーの保護につながります。
1が誤りなのは、エッジAIは端末の計算能力・メモリ・電力の制約を受け、使えるモデルの大きさに限りがあるからです。3が誤りなのは、多数の端末のモデルを更新するには、むしろ配布の仕組みが必要になるからです。4が誤りなのは、精度は処理の場所ではなくモデルの性能で決まり、軽量化したモデルでは精度が下がることもあるからです。
確認問題3:NPUと知識蒸留の正誤の組合せは?
次の記述ア・イの正誤の組合せとして、最も適切なものはどれか。
ア:NPU は、ニューラルネットワークの演算を低い電力で効率よく処理するための専用の回路である。
イ:知識蒸留は、大きなモデルの出力を手本にして、小さなモデルを学習させる手法である。
- 1. ア:正 イ:正
- 2. ア:正 イ:誤
- 3. ア:誤 イ:正
- 4. ア:誤 イ:誤
正解は1。アは正しい記述です。NPU は AI の推論に多い行列の演算などを効率よく処理するための回路で、スマホでは SoC に組み込まれることが多くあります。イも正しい記述です。知識蒸留は、大きなモデル(教師)の知識を小さなモデル(生徒)へ移す手法として、Hinton らの2015年の論文で広く知られるようになりました。
アまたはイを誤とする2・3・4は、いずれも誤りです。
3問の根拠を説明できたら、AI 以外のテーマも含めて本番形式で確かめてみましょう。モバイル2級の無料お試し20問は登録不要で解けます。
よくある質問
エッジAIとオンデバイスAIは同じ意味ですか?
重なりの大きい言葉です。オンデバイスAIは、スマホなどの端末そのものの中で AI を動かすことを強調した言い方です。エッジAIはそれより広く、端末の近くにあるゲートウェイや基地局近くのサーバーで処理する場合も含めて使われることがあります。
生成AIもエッジで動かせますか?
モデルを小さくする工夫や端末の性能向上によって、比較的小さな言語モデルなどを端末で動かす取り組みがあります。ただし、大きなモデルほどメモリや電力の制約が厳しくなるため、端末とクラウドで処理を分ける構成も使われます。
量子化の「4分の1」という数字は覚えるべきですか?
32ビットを8ビットにすれば、重みの大きさはおおむね4分の1になる、という計算で理解しておけば十分です。実際の効果はモデルや方式で変わるため、特定の倍率を丸暗記するより、仕組みと精度とのトレードオフを押さえることをすすめます。
出典・参考
本番と同じペースで腕試し
記事の次は、本番形式の問題で。
公式の出題カテゴリの比率どおりに組んだ無料お試しを、登録不要・カード不要で解けます。続きの模試と章別ドリルは買い切りで、月額はかかりません。
あわせて読みたい
当サイトは、モバイルコンピューティング推進コンソーシアム(MCPC)とは関係のない個人が運営する非公式の学習教材です。掲載している問題はすべて当サイトのオリジナルで、実際の試験問題・過去問題・再現問題ではありません。試験の日程・受検料・出題範囲は公式サイト(https://www.mcpc-jp.org/license/ )で必ず確認してください。合格を保証するものではありません。合格の目安は当サイトの推定です。技術・制度の記述は「最終確認日」時点のものです。