IoTの用語IoT中級

Transformerとは|注意機構とIoT検定で問われる点

Transformerを一文で定義し、注意機構(Q・K・V)の考え方、RNNとの違い、BERT・GPT・ViTとの関係を表で整理。IoT中級のデータ活用で問われそうな観点と、間違えやすい点、解説つき独自の確認問題3問で理解を確かめられます。

最終更新
公開
読了目安
約11分
執筆
ICT模試 編集部

この記事の要点

  • Transformer は、注意機構(Attention)だけで系列の中の関係を計算する ニューラルネットワークの構造です。2017年の論文「Attention Is All You Need」で提案されました。
  • RNN のように前から順に処理しないので、学習を並列化しやすい のが最大の特徴です。そのかわり、順番の情報は 位置エンコーディング で別に加えます。
  • BERT(文の理解)、GPT 系(文章の生成)、ViT(画像認識)などは Transformer をもとにしたモデルで、今の生成AIの土台になっています。
  • IoT中級では出題カテゴリ「IoTデータ活用技術」(25〜30%)に当たる範囲です。IoT基礎の改訂4版の説明でも、生成AIの核として Transformer に触れています。

Transformerとは? 一言でいうと?

Transformer とは、入力された系列(文章の単語の並びなど)のすべての位置どうしの関係を、注意機構で一度に計算するニューラルネットワークの構造です。

2017年に Vaswani らが論文「Attention Is All You Need」で提案しました。論文の要旨では、注意機構だけに基づき、再帰(RNN)と畳み込み(CNN)を完全に使わない 構造であること、そのため並列化しやすく学習時間を大きく短くできたことが述べられています。機械翻訳の評価では、WMT 2014 の英独翻訳で BLEU 28.4、英仏翻訳で 41.8 という当時の最高水準の結果が報告されました。

もとの論文の Transformer は、入力を読み取る エンコーダ と、出力を1語ずつ作る デコーダ の組み合わせでした。エンコーダ・デコーダはそれぞれ同じ構造の層を6層重ねたものです。

注意機構(Attention)はどう働く?

注意機構は、「今注目している語にとって、ほかのどの語がどれだけ関係するか」を重みとして計算し、その重みで情報を混ぜ合わせる仕組みです。Transformer では、各語から次の3つのベクトルを作ります。

注意機構で使う3つのベクトル
名前役割のたとえ何に使うか
Query(Q)探している条件ほかの語の Key と比べて、関係の強さを出す
Key(K)各語につけた見出しQuery との内積で関係の強さ(重み)を決める
Value(V)各語が持つ中身重みをかけて足し合わせ、出力にする

← 表は横にスクロールできます →

論文では、この計算を Scaled Dot-Product Attention と呼び、Q と K の内積を √d_k(Key の次元数の平方根) で割ってから softmax で重みにし、V にかけます。割る理由は、次元が大きいと内積の値が大きくなり、softmax の勾配が極端に小さくなるのを防ぐためと説明されています。

さらに、この注意の計算を並列に複数(論文では8個)走らせる Multi-Head Attention を使い、異なる観点の関係を同時にとらえます。Q・K・V を同じ系列から作る場合を Self-Attention(自己注意) といいます。

簡単な例で考えます。「センサの値が急に上がったので、それを記録した」という文で、「それ」の Query は「センサの値」の Key と強く一致し、「それ」の出力には「センサの値」の情報が多く混ざります。語の距離が離れていても、一度の計算で関係を結べるのがポイントです。

順番の情報:Transformer は語を並列に扱うので、そのままでは語順が分かりません。論文では、sin と cos の関数で作った 位置エンコーディング を入力に加えて順番を表しています。また、文章を作るデコーダでは、まだ作っていない後ろの位置を参照しないよう マスク をかけます。

RNN と Transformer の違いは?

Transformer が登場する前、文章や時系列データの処理には RNN(再帰型ニューラルネットワーク)やその改良の LSTM が広く使われていました。違いを表にまとめます。計算量の欄は原論文の比較(n は系列の長さ、d は表現の次元数)によります。

RNN と Transformer(Self-Attention)の比較
観点RNNTransformer
処理の順番前から1つずつ順に処理し、状態を次へ渡すすべての位置を同時に処理する
並列化しにくい(順番に待つ必要がある)しやすい
逐次的な計算の段数O(n)O(1)
遠く離れた語の関係何段も状態を経由して伝わる一度の注意の計算で直接結べる
1層あたりの計算量O(n・d²)O(n²・d)
語順の扱い処理の順番そのものが語順になる位置エンコーディングで加える
苦手なこと長い系列で離れた情報を保ちにくい系列が長いと計算量が長さの2乗で増える

← 表は横にスクロールできます →

表の最後の行が大事です。Transformer は万能ではなく、系列が長くなると計算量とメモリが大きく増えます。センサの長い時系列をそのまま入れるような場面では、この弱点が設計上の課題になります。

BERT・GPT・ViT とはどういう関係?

Transformer の構造をもとに、目的に合わせたモデルが作られてきました。代表的なものを原論文の説明で整理します。

Transformer をもとにした代表的なモデル(各原論文で確認)
モデル発表特徴主な用途
Transformer2017年エンコーダとデコーダを注意機構だけで構成機械翻訳
BERT2018年エンコーダを使い、左右両方の文脈を同時に使って事前学習文の分類・理解
GPT-32020年1,750億パラメータの自己回帰型言語モデル(前の語から次の語を予測)文章の生成
ViT2020年画像を小さなパッチに分け、その並びを Transformer に入力画像認識

← 表は横にスクロールできます →

生成AIやLLMの全体像は 生成AIとLLM で、深層学習そのものの仕組みは ディープラーニング で説明しています。

IoT との関係では、カメラ画像の認識(ViT の考え方)、センサの時系列からの異常の検知、集めたデータを要約・説明する生成AIなどで Transformer 系のモデルが使われ得ます。ただし計算量が大きいので、機器の中(エッジ)で動かすか、クラウドで動かすかの判断が必要になります。

IoT検定ではどう問われる?

IoT中級の公式ページでは、出題カテゴリ「IoTデータ活用技術(AI、ビッグデータ分析、活用事例)」の比率が 25〜30% と示されています(2026年9月27日確認)。Transformer はこのカテゴリの AI の話題に入ります。中級の対応テキスト『IoT技術テキスト 第4版』では、第3章「IoTデータ活用技術」の範囲に当たると当サイトは推定しています(使っているのは目次の章名だけです)。

IoT基礎でも、MCPC のテキストのページで『IoT技術テキスト 基礎編 改訂4版』の説明として、生成AIを「深層学習の Transformer アルゴリズムを核として発展してきた」技術として扱うと書かれています。改訂の全体像は 基礎編 改訂4版で変わったこと にまとめました。

4択で問われるとしたら、次のような観点が考えられます(出題の頻度や実際の問題を示すものではありません)。

  • 仕組みの名前を選ぶ:系列の関係を重みで計算する仕組みの名前(注意機構)を、ほかの仕組みと区別できるか。
  • RNN との違いの正誤:並列化、語順の扱い、長い系列での弱点について、正しい記述と誤った記述を見分けられるか。
  • 派生モデルの対応:BERT・GPT 系・ViT の特徴と名前を正しく組み合わせられるか。
  • 生成AIとの関係:生成AIの土台の技術として Transformer を位置づけられるか。

間違えやすいのはどこ?

Transformer の説明でよく混ざる点を、つまずき別にまとめました。

Transformer の間違えやすい点
間違えやすい理解正しい理解
Transformer は RNN を改良した再帰型のモデル再帰も畳み込みも使わず、注意機構だけで構成する
語を並列に扱っても語順は自然に分かる語順は位置エンコーディングで別に加える
√d_k で割るのは計算量を減らすため内積が大きくなり softmax の勾配が小さくなりすぎるのを防ぐため
Transformer は系列が長いほど有利計算量は系列の長さの2乗で増えるので、長い系列は負担が大きい
BERT は文章を生成するためのモデルBERT はエンコーダ型で、左右の文脈を使う理解向けの事前学習モデル
Transformer は文章専用ViT のように画像をパッチの並びとして扱う使い方もある

← 表は横にスクロールできます →

確認問題1:Transformer が並列計算しやすい理由は?

Transformer が RNN に比べて学習を並列化しやすい主な理由として、最も適切なものはどれか。

  1. 系列の各位置を前から順に処理し、前の状態を次の位置へ渡すため
  2. 注意機構で、系列内のすべての位置どうしの関係を同時に計算するため
  3. 畳み込み層を重ねて、近い位置の特徴を段階的に集めていくため
  4. 入力の系列を固定長のベクトル1本にまとめてから一度に処理するため

正解:2。Transformer は注意機構で全位置の関係を同時に計算するため、前の結果を待つ必要がなく並列化しやすくなります。

1 は RNN の説明です。前の状態を待つので、むしろ並列化しにくい理由になります。3 は CNN(畳み込み)の説明で、Transformer は畳み込みを使いません。4 は入力を1本のベクトルに押し込む古い方式の説明で、Transformer は各位置の表現を保ったまま関係を計算します。

確認問題2:√d_k で割るのは何のため?

Scaled Dot-Product Attention で、Query と Key の内積を √d_k(Key の次元数の平方根)で割る目的として、最も適切なものはどれか。

  1. 内積の値が大きくなり、softmax の勾配が極端に小さくなるのを防ぐため
  2. 系列の長さの2乗で増える計算量を、長さに比例する量まで減らすため
  3. 語の順番の情報を内積に加えて、位置の違いを区別できるようにするため
  4. 後ろの位置の語を参照できないようにして、生成の手順を守らせるため

正解:1。原論文では、次元数が大きいと内積が大きくなり、softmax が勾配の極めて小さい領域に入ってしまうため、√d_k で割ると説明されています。

2 は誤りです。割り算をしても全位置の組み合わせを計算することは変わらず、計算量は減りません。3 は位置エンコーディングの役割です。4 はデコーダで使うマスクの役割で、割り算とは別の仕組みです。

確認問題3:BERT と ViT の特徴を組み合わせると?

次の記述ア・イに当てはまるモデルの組合せとして、最も適切なものはどれか。

ア:エンコーダを使い、文の左右両方の文脈を同時に使って事前学習するモデル/イ:画像を小さなパッチに分け、その並びを Transformer に入力して画像を認識するモデル

  1. ア:GPT-3 イ:ViT
  2. ア:BERT イ:CNN
  3. ア:GPT-3 イ:RNN
  4. ア:BERT イ:ViT

正解:4。BERT は左右両方の文脈を使って事前学習するエンコーダ型のモデル、ViT は画像をパッチの並びとして Transformer に入力するモデルです。

1 と 3 のアの GPT-3 は、前の語から次の語を予測する自己回帰型の言語モデルで、左右両方の文脈を同時には使いません。2 のイの CNN は畳み込みで画像の特徴を集める方式で、パッチの並びを注意機構で扱う ViT とは違います。3 のイの RNN は系列を順に処理する方式で、画像認識のためにパッチを入力するモデルではありません。

次は何で力を試す?

3問とも根拠を言えたなら、Transformer の要点はつかめています。IoT中級では、AI のほかにビッグデータ分析や活用事例、さらにセンサ・通信・セキュリティまで幅広く出題されます。IoT中級の無料お試し20問 で、公式カテゴリの比率に合わせた20問を解いてみてください。登録なしで、全問の解説を読めます。

当サイトの問題集はモバイル2級と IoT中級が対象です。Transformer は IoT基礎の範囲でもありますが、基礎向けの問題集は用意していません。中級の試験の全体像は IoTシステム技術検定 中級とは をご覧ください。

よくある質問

Transformer と生成AIは同じものですか?

同じではありません。Transformer はモデルの構造の名前で、生成AIは文章や画像を作るAIの総称です。今の多くの生成AIは Transformer をもとにしています。

Transformer を理解するのに数式は必要ですか?

4択の検定対策としては、Q・K・V の役割、√d_k で割る理由、位置エンコーディング、RNN との違いを言葉で説明できることが先です。

IoT機器の中で Transformer は動きますか?

モデルの大きさと機器の性能によります。計算量が大きいので、小さくしたモデルを使うか、クラウドやエッジサーバで処理する構成がとられることがあります。

出典・参考

  1. [1]Vaswani et al., Attention Is All You Need(arXiv:1706.03762、確認 2026-09-27)
  2. [2]Devlin et al., BERT(arXiv:1810.04805、確認 2026-09-27)
  3. [3]Brown et al., Language Models are Few-Shot Learners(arXiv:2005.14165、確認 2026-09-27)
  4. [4]Dosovitskiy et al., An Image is Worth 16x16 Words(arXiv:2010.11929、確認 2026-09-27)
  5. [5]MCPC IoTシステム技術検定[中級](確認 2026-09-27)
  6. [6]MCPC 検定テキスト(確認 2026-09-27)
  7. [7]リックテレコム『IoT技術テキスト 第4版』書誌ページ(確認 2026-09-27)

本番と同じペースで腕試し

記事の次は、本番形式の問題で。

公式の出題カテゴリの比率どおりに組んだ無料お試しを、登録不要・カード不要で解けます。続きの模試と章別ドリルは買い切りで、月額はかかりません。

IoTシステム技術検定 中級

80問・90分の模試と章別ドリル・¥4,980(税込・買い切り)

IoT中級の無料お試し20問
料金と収録内容を見る →

当サイトは、モバイルコンピューティング推進コンソーシアム(MCPC)とは関係のない個人が運営する非公式の学習教材です。掲載している問題はすべて当サイトのオリジナルで、実際の試験問題・過去問題・再現問題ではありません。試験の日程・受検料・出題範囲は公式サイト(https://www.mcpc-jp.org/license/ )で必ず確認してください。合格を保証するものではありません。合格の目安は当サイトの推定です。技術・制度の記述は「最終確認日」時点のものです。

← 対策記事の一覧へ