解説論文
人工知能入門・その仕組みと課題

Summary 人工知能(AI)技術について,1956年の登場から第3次ブームと言われた深層学習(Deep Learning)を経て,現在の生成AIまでの技術の変遷とその仕組みを簡単に解説するとともに,現時点での課題となる電力問題と倫理問題に言及する.できるだけ分かりやすく解説し,主要なポイントをつかみ取って頂くよう心掛けた.この解説論文を基に,読者の方には,この技術に対する今後の発展・活用への期待と,研究・開発に取り組む対象を見つけて頂けると幸いである.
Key Words 人工知能,Artificial Intelligence,Deep Learning,Neural Network,LLM
1
はじめに
毎日のニュースに接していると,「人工知能」という言葉があふれている.この原稿を書いている間にも,日々新たなニュースが飛び込んでくる.日進月歩というよりは「秒進分歩」といった感である.人工知能は,もう人々の生活の基盤である電気,水道,ガス,通信などと同等に,社会的なインフラストラクチャーとして確立してきている感さえある.ただ,中身を知らずに使うことは,必要以上の期待や不安を持つことにもつながるので,ほかの多くの関連する書籍(1)も出版される中,本稿ではこの人工知能技術について,学生をはじめ多くの一般の方を対象に,その仕組みを,複雑な数式などを使わずに,要点だけを拾えるように簡易化して解説し,「これだけは知っておきたい」基礎的な動作のしくみを伝える.また,抱える課題を提示することで,人工知能技術のより良い活用を考えるための礎を提供することとしたい.本稿では,この技術を支える半導体技術から脳科学までの幅広い技術研究領域に対し,これから取り組まれる方に向けて,そのきっかけをつかんで頂くことを目的に解説を進める.ジュニアウエビナー連動企画でもあり,併せて視聴されたい.
†
(株)NTTデータ先端技術,東京都
NTTDATA Intellilink Corporation, Tokyo, 100-7013 Japan
2
人工知能の誕生
人工知能とは何であるか? では知能とは? 定義には今もって様々な解釈があるが,その取組みのスタートは1956年のダートマス会議(2)から始まる.John McCarthy先生が会議の中でArtificial Intelligenceという言葉を使い始め,機械が人間の知能を模倣できるのではないかという仮説を立てて,新たな学問分野としての研究が開始された.以来,「AI」という表現が使われるようになった.単なる数値計算だけでなく,言葉の理解や様々な事柄の論理形成など,人間の知能と言われるようなものを機械で模倣するための道のりが始まったのである(図1).
ダートマス会議では,人間が物事を考える過程を「機械=計算機」で模倣するためには,この過程をどう数値化・記号化したらよいのか? とか,何か考えた先にある答えを見つけ出す方法とか,言葉を理解することができるか? などの論点で議論が進み始めた.例えば,迷路からの脱出を計算機に考えさせるといった課題である.迷路の中で,どの方向に進んだら脱出できるのか? 計算機は考えられる経路を次々と効率的に試し,脱出不能な経路を消し込み,最後に脱出できる経路を求めることができた.計算機が答えを導き出したのである.このようにしてチェスゲームやパズルを解くことまで成し遂げ,期待が高まってきた.しかし,当時の計算機の能力では,この辺りが限界で,人間の知的(と感じるよう)な働きを実現できるまでには至らず,徐々に人々の関心が薄れ,ブームが終えんを迎えた.
次の人工知能の「第2次ブーム」と呼ばれるものは,1980年頃に起こる.これは,「ルール=知識」を用いた処理の実現で,「エキスパートシステム」と呼ばれた(3).あらかじめ計算機にルールを覚えこませておき,ルールに従えば計算機が答えを出すというもので,例えば,病名の特定に使うという応用が考えられた.体がだるいですか? 鼻水が出ますか? 頭が痛いですか? 体温が高いですか? といったルールを積み重ねて,最終的に「風邪」と答えを出す.医師の診断を仰がなくても計算機が自動的に診断結果を出す可能性が示され,期待が高まった.しかしながら,人間の知的(と感じるよう)な活動には,実はとてもたくさんのルールが積み重ねられており,当時の計算機では書き切れないほどのルールが必要ということが分かり始め,この第2次ブームもやがて終えんする.期待が大きかった分,その後は人工知能の「冬の時代」が訪れた.

図1 人工知能(Artificial Intelligence)の始まり
3
Deep Learning(深層学習)の実現~第3次ブームの到来~
第2次ブームの「計算機にルールを詰め込む」アプローチとは異なり,「計算機が経験データを寄せ集めてルールを学び取る(「機械学習」と呼ばれる)ことで知能を模倣しようとした研究も進められていた.実はこの研究が,現代の人工知能につながっている.
1943年頃から,神経生理学的な観点から脳に関する研究が進められており,脳細胞である「ニューロン」と,ニューロン同士のつなぎ目である「シナプス」の仕組みに着目し,それを数学的モデルに置き換えたシナプスを見いだし,その数学的モデルに置き換えたニューラルネット(図2)の働きについての研究(4)が進んでいた.
数学的なモデルとして脳を模倣する取組みであり,これで人間の知的(と感じるよう)な機能が実現できるかもしれないと考えられた.このモデルの仕組みは,図の左側から何らかの信号が入力されると,それが,数々のニューロンを伝って,最終的に右側に出力が現れるといった信号を伝達する電気回路のような仕組みである.そして,このニューラルネットの最も特徴的な機能は,それぞれのシナプスにおいて,入力信号に対して重みづけを付加して次のニューロンに信号を伝えることができることである.どういうことかというと,シナプスの左側のニューロンからの信号を次のニューロンに伝える際に,信号が重要な信号として伝える場合は,シナプスの重みづけを大きくして次のニューロンに伝える.また重要ではない信号を伝える場合には,重みづけを小さくして次のニューロンに伝えることができるのである.また,ニューロンへの複数の入力信号については,足し合わせた結果がたくさん集まれば,次のニューロンへ伝えるといった仕組みにもなっている(図2).

図2 ニューラルネットワーク
このニューラルネットが一体どう働くのか? 例えば,ニューラルネットの左側からライオンの画像信号を入れ,信号がニューラルネットを伝わり,最終的に右側に回答の信号を出力させるようなことを考える.右側の出力には,ライオンと猫という出力を設定しておき,どちらに強い信号が現れるか観察する.その際,シナプスの重みづけは,最初は適当な値を設定しておき,出力を観察することにする.
ライオンの画像を入力した際,出力にライオンと強く出れば,正解となる.逆に猫の出力が強く出れば,不正解となるので,ニューラルネットの中のそれぞれのシナプスの重みづけを変化させ,ライオンの出力が大きくなるように調整して,正解に導く.様々なライオンの画像を入力しても,必ずライオンの出力信号が得られるように,シナプスの最適な重み付けを,"答え合わせをしながら"探し出して,調整していく.少し考えてみると,図のような数個のニューロンでは,多くの種類のライオンの画像に対してなかなか最適な重み付けを探すことができないが,莫大な数のニューロンとシナプスを用意すれば,どんな画像が入力されてもライオンの出力が強くなるニューラルネットにできると想像できる.
実はこのシナプスの重み付けの調整が,ニューラルネットの「学習」なのである.人間の脳の中には約1,000億個のニューロンがあると言われている.生まれたばかりの赤ちゃんは昼も夜も,言葉も,何もかも分からない.ところが毎日母親の顔を見ていると,やがて母親と認識できるようになる.これは赤ちゃんが脳の中にある1,000億個のニューロンをつなぐシナプスの重み付けを毎日調整し,母親という出力が得られるように「学習」しているのである.このようにして,人間も人工知能も"答え合わせ"をしながら「学習」し,正解を導き出せるようにしているのである.
では,シナプスの重み付けはどのようにして調整するのか? ここでは,誤差逆伝搬(バックプロパゲーション)という手法(出力と正解との誤差を小さくする重み付けの調整量を,出力から入力に向かって算出する手法)(5)を使う.ここでは詳細は述べないが,大量のシナプスの調整を様々な入力に対して行う必要があり,莫大な計算量が必要となるため,当時,この手法はなかなか実用的な域には達していなかった.
そのような中,カナダ・トロント大学のGeoffrey Hinton先生が研究室の学生とともに実証的研究を進めて,画像処理向けに構成したニューラルネット(CNN: Convolutional Neural Network)とGPUの組合せにより,画像認識における性能を大幅に改善した(6).2012年に行われた画像認識コンテストにて,それまでの画像認識率をはるかにしのぐ値を示したのである.この技術はニューラルネットの入力から出力までのニューロンを多段状態に並べた形状から,深い層を表す「ディープ」と学習の「ラーニング」を組み合わせた「ディープラーニング(Deep Learning)」とも呼ばれた技術であり,この時点での実証成果を境に現代の人工知能の核となる技術となっている.
有効性のキーポイントは膨大な計算量をいかに実現したのかにある.ここにGPU(Graphic Processing Unit,画像処理ユニット)の登場となる(図3).なぜ画像処理に使うユニットがバックプロパゲーションの計算に使われるのか? 実はどちらも行列演算による計算で成り立っている.
GPUは元々,パソコンゲームなどにおいて,画面内をキャラクターが縦横無尽に動き回るための出力画像の計算を専用に行う用途として開発された.画像が三次元の立体表現となり,高精細化とともに,滑らかな動きを表現するには短時間に莫大な行列演算が必要になってくる.行列演算に特化した計算ユニットであるGPUの性能は驚くべき進化を遂げた.この超高速行列演算が可能なGPUがバックプロパゲーション手法の解を求める演算にも使うことができることに気付いたのがGeoffrey Hinton先生の研究室であり,コンテストにて驚異的な画像認識率をたたき出したのである.ここからGPUを使ったディープラーニングが一躍,実用化の道を進み始めた.

図3 GPU
4
Deep Learning(深層学習)の活用
人工知能を活用するには,学習によりシナプスを調整し終えたニューラルネットを用いて推論(Inference)をする.上述の例で言うと,重みづけを調整し終えたニューラルネットに新たな画像を見せ,ここに何が描かれて(映って)いるのかを答えさせると,ライオンという推論結果が得られるようになる.つまり,人工知能の活用とは,入力に対する推論の結果を利用するということになる.
この画像認識率を大幅に高めた結果は,様々な効用を生んだ.例えば,いろいろな人が書いた手書き文字は読み難い場合も多い.そこで,書道家の書いたものから,癖のある簡単には読み解けない文字までをニューラルネットに学習させることにより,ほぼ,どんな文字でも読めるようになり,文字の認識率は大きく前進した.昨今では,スマホのカメラで撮った手書きメモを簡単にテキストデータ化できるようになり,高精度OCRとしての活用が広がっている.
手書き文字だけでなく,例えばカメラで捉えた「あんパン」を考える.様々な角度で撮ったあんパンの画像を学習させることにより,パン屋さんで買い物トレイの上にどのように置かれた状態でも,あんパンと認識できるようになる.ほかの種類のパンも学習させることにより,トレイにどんなパンが何個載っているかを判別することができ,一瞬で会計処理ができるようになる.
車の自動運転についても同様に,自動車の運転席にカメラを設置し,運転手が見る景色の画像を撮り,何がカメラに写っているのかを学習させればよい.つまり,撮った画像から,道路の部分を切り出し,道路であると学習させる.これを様々な道路で学習させる.真っ直ぐの道路,曲がりくねった道路,坂道の道路,交差点の道路など.また,昼間の道路,夜の道路,雨や雪の降った道路などを切り出して,学習させることにより,どんな状況下で撮った画像においても,道路の部分を認識することができるようになる.道路と同じように,歩道,歩道を歩く人,前方を走る車や,信号機や建物についても様々な映像を用意し,切り出して学習させ,その学習済みニューラルネットに,新たなカメラで捉えた車前方の風景を推論させると,どこが道路でどこが歩道か? 人は居るのか? 前方に車が止まっているか? 等を推論し出力することができ,この出力結果を用いれば,どこを走り,いつ止まればよいかを判断することができるようになる.これで自動運転が実現できるようになる.最近では,自動車に様々な方向に向けたカメラを搭載し,自動車周囲の動画像を得て,対向車や歩行者の動きを予測し,事故を未然に防ぐという研究も行われている(7).
5
Deep Learningの学習
このような活用を実用化するには学習するデータ量をできるだけ増やす必要がある.多くの手書き文字,あんパン,道路などを取り込むことが重要で,その際には,何と書いてあるのか? パンの名前は? ということや,道路などの対象物名を教えなくてはならない.つまり"教師あり学習"と言える.これは量が増えてくると骨の折れる作業となる.これに対し,取り込まれた多くのデータについて,ある傾向やパターンが自然と見えてくる場合もある.例えば,多くの学生の勉強時間とテストの点の分布データから,学生のタイプが見えてくるような場合である.時間をたくさん使って高得点を取る努力型なのか,短時間の勉強で得点を伸ばす効率型なのか.時間を使っても点数が伸びないタイプの学生には,勉強方法のヒントを与え,高得点に結び付けることに使える.このように人間が何も教えず,そのパターンを見つけ出すので"教師なし学習"として,楽に(自然に)学習することができる場合である.
更に"強化学習"と呼ばれる方法により,人手を介さず,計算機が自動的に学習する方法が考えられた.簡単に理解するには,人間でいうところの自転車乗りを想像すればよい.初めて乗ると倒れてしまう.そこで転ばないように体重移動やハンドル操作などを試行錯誤して,やがてスーッと乗れるようになる.これと同じで,計算機が自分で入力データを少しずつ変化させるなどの試行錯誤を繰り返しながら推論結果を観察し,どのように学習を進めていけばよいかを得る学習方法である.また自転車を乗るときに,雨が降ってきたとか,周囲の状況が変化したときに乗り方も変わってくるように,一度学習したか結果を更に更新する学習方法として「ベイズ理論」という考え方もある.このように計算機が自ら学習する方法についても研究が進んでいる.
6
バイアス問題とブラックボックス問題
このようにして,格段に人工知能の活用が進んだ.上述で例示したように画像処理の分野での活用が中心となるが,これが人工知能の「第3次ブーム」と呼ばれている.ただし,この人工知能の活用には課題も含まれることが,この時点から議論されていた.それが,バイアス問題とブラックボックス問題である.これは現在の人工知能についても共通する課題である.
バイアス問題とは,学習させるデータに偏りがある場合には,推論の答えも偏向してしまうという問題である.人間の場合もそうであるが,例えば母親が日本人で日本語を話す家庭で育った赤ちゃんは,日本語が得意だが,英語は不得意になることと同様である.人工知能も学習させる内容によって,推論の出力が偏ってしまうのである.このことから,人工知能の学習データはできるだけ偏りをなくすことが望まれる.学習するデータ量を多くすれば多くするほど,この偏りが平準化されるとも考えることができる.
ブラックボックス問題とは,人工知能が推論結果を導き出した理由を求めることが難しいという問題である.ニューラルネットを思い出してみよう.実は,高精度の推論結果を期待すれば期待するほど,そのニューラルネットの規模,つまりニューロンの数が莫大な数になることが想像できる.すると,出力側から入力側の信号を追い掛けることが難しくなり,なぜ答えを出したのかが追いづらくなる.つまり答えは出るが,その答えを出した理由が分からないということになる.これがブラックボックス問題である.答えが出ればそれでよい,という用途には向いているが,理由が必要となる用途には人工知能は使いづらいということになる.
よく例に出されるのは,人命にかかわる判断には人工知能が使えないということである.例えば,臓器移植の際に,「誰に移植をするか」の判断に人工知能を活用する場合を考えてみよう.移植を受けようとするA,B,Cの3人が候補に挙がったとする.移植臓器の適合性の学習をさせた人工知能に3人の身体状態を入力したところ,Aさんが最も良いと人工知能が判断した.確かに結果としてはAさんが最も長生きしたが,Bさん,Cさんにはその理由が伝えられない.Bさん,Cさんは納得がいかないということになる.このような場面では,理由を説明できない人工知能は使えないということになる.
このような問題を抱える人工知能は,その用途をよく吟味してから活用することが必要になる.

図4 人工知能への期待
7
生成AIへの道のり
画像処理分野を中心として,高い認識精度を実現した第3次ブームの人工知能は,自動運転をはじめ広く活用が考えられたが,更なる発展として言語理解の領域へ発展を遂げた.
元々言語理解についても,機械による認識については古くから研究されてきた.自然言語処理技術(NLP: Natural Language Processing)の研究である(8).どんなことが書かれているか? 何が話されているか? である.研究では,単語と文法(ルール)を組み合わせ,パターンと照合することで,どんな意味を持つかを推測する手法が取られたが,莫大な言語の量や文法が多岐にわたり,更に様々な言い回し(書きまわし)等に対応することも必要であり,研究が続けられてきた.
計算機の進化に伴って,まずは言葉の単位となる単語のベクトル表現技術が台頭してきた.計算機に言葉を認識させるには,まずは単語を数値で表現することである.例えば,「猫」という単語を数字で表現することにする(9).比較対象として犬やリンゴなどの言葉を用意する.これら三つの言葉を様々な特徴から分類してみる.まず品詞で言うと,三つとも名詞ということになり,数値1と表すことにする.名詞以外の品詞の場合は0と表すことにする.次の特徴は動物か否かを表現する.猫と犬は1となり,リンゴは0となる.更に,忠実度を表現してみると,主観が入るが,猫が0.5,犬が0.9,リンゴは0と表される.このようにして単語の様々な特徴を数値で表していくと,その特徴の数値の組(ベクトル)から単語が表されるようになる.特徴の種類が多いほど,数字の組が大きいほど,より正確に計算機の中で単語を取り扱うことができるようになる.
単語が正確に計算機に取り込まれるようになると,続いて単語を集めた言葉(文章)を読み取る技術に注目が集まる.これは「大規模言語モデル(LLM: Large Language Model)」と呼ばれる技術で,膨大な単語・文章を学習し,文脈を理解して,更に次に来る言葉を予測する技術となる.
どのように文章を読み取るのか? 画期的な手法が2017年に登場した(10).自己注意機構(Self-attention)と呼ばれる仕組みを使い,各単語の相互の関係を推論し,文章の中で,どの単語にどう注目すればよいのか? を,単語と同じように数値ベクトルで表す方法である.もっとも注目を引く単語はどれか? その単語と深く関わりのある単語はどれか? このことが分かると,文章の意味をくみ取ることができるようになる.ここでも少し考えてみると,当たり前のことであるが,文章が長ければ長いほど(文章に含まれる単語の数が多いほど)文章の意味を深く読み取ることができることになる.
また,この仕組みを使うと,以前の言語解析・認識のような,文法(ルール)を取り込むこともなく,全てニューラルネットの学習による推論結果を用いることにより,文章を読み取ることができるようになる.更に言葉の流れを逐次解析しながら,認識を進めるのではなく,長い文章においても,全体の単語の関係性が対象となるため,文章の前方と後方での解釈の整合性を取れることから,文章全体のより正確な読み取りにもつながる.
文章を正確に読み取った上で,更にその活用となる「翻訳(英語からドイツ語)」の実証がこの論文(10)で検証され,新たな自然言語処理の道が切り開かれた.この新たな技術は「Transformer(系列変換)」と呼ばれ,二つの部品,エンコーダとデコーダから構成されている.(どちらの部品も自己注意機構を用いるため,論文の題名が"Attention is all you need"となっている.)入力となる英語の文章をエンコーダに取り込み,デコーダに引き継いで系列変換されたドイツ語の出力を得るという仕組みである.
エンコーダの部分では入力された英語文の単語への切り分けと,単語ごとにベクトルへの変換が行われる.続いてデコーダにこのベクトルを入力し,デコーダで新たなドイツ語文に置き換える.デコーダでは,エンコーダで作り上げたベクトルよりスタートの単語を類推する.例えば,"ドイツ語に訳して"という文章があれば,入力文章の中からスタート言語として,最も注目された単語のドイツ語を設定する.そして,この単語をきっかけとして,次に出てくる単語をそれまでに生成した文書の各単語の関係性から次々と類推し,単語の列を作り上げていく.つまり元の文章から翻訳された新たな異なる文章を生み出していく"系列変換"なのである.
更に,文章を深く理解するための研究が進み,BERT(Bidirectional Encoder Representations from Transformers)という技術がGoogleのチームから発表(11)された.これは,注目する文章の前後の文章までも同時に取り込み,文脈を理解する技術で,発表されて以来,NLPの基盤技術として広く使われ続けている.このようにして単語>文章>文脈と,計算機による文章の理解(エンコーダ機能)が深まった.
また生成(デコーダ機能)も進化を遂げた.それがGPT(Generative Pre-trained Transformer)である.簡単には,翻訳向けに開発されたデコーダ機能を,生成のみに特化させ,生成の精度を上げるとともに,人間との自然な対話ができるような学習方法(RLHF: Reinforcement Learning from Human Feedback)を採用し,Chat-GPTに進化したのである.RLHFとは計算機が生成した複数の文章を人間が優劣を評価し,どう評価したかを更に強化学習することで,対話力を向上させてきている.
GPTはその後も進化を続けており,デコーダのみで様々な処理ができるほどの人工知能となったが,エンコーダの特徴も取り入れたT5(Text to Text Transfer Transformer)という発表(12)もあり,それぞれの特徴を生かして進化を続けている.
このようにして,人工知能を用いて言語への応用が物すごい勢いで進んだ.振り返ってみると,画像処理の高精度化から,更に言語処理への高度化が行われることで,人工知能の活躍の場が広がったことになる.活用範囲が広がりを見せたところで,更に,このTransformerは"系列変換"ということから言語翻訳にとどまらず,ディジタルデータの系列変換であるとの認識が広がり,例えば日本語の質問から日本語の答えを生むという考え方で,「質問に答える」という系列変換までの広がりを見せた.
更にディジタルデータが連なった系列,つまり音声も画像もすべてディジタルデータの系列と捉えることができるので,縦横無尽に系列変換が実現(マルチモーダル化)されることになる.例えば,テキストデータから音声データを生成することで,既にテレビやラジオのニュースなどで,ごく自然な原稿読上げに活用されている.また画像データから音声データを生成することで,写真の解説文章をも生成することができ,更にはコンピュータを動かすプログラムも,普段の言葉で動作の注文をすれば,コードとして出力させることができる.
入力されるディジタルデータの系列の特徴をつかみ取り,所望のディジタルデータの系列に変換し,生成する.つまり,これが生成AIなのである.

図5 Transformer
8
生成AIの発展
万能な生成AIにも,大きな欠点がある.それがAIのハルシネーション(Hallucination=幻覚)と呼ばれる,誤生成である.生成AIは大規模なディジタルデータの学習から,もっともらしい生成データを出力するが,100 %の正解データを生成するわけではない.例えば,偏ったデータで学習したAIであれば偏ったデータを出力するし,学習したことがないデータは,「知らない」との答えは出さず,何らかの,もっともらしい回答を生成してしまう.大量の学習をしていれば,知らないことが少なくなるので,ハルシネーションの恐れは少なくなるとも考えられる.しかし,完全には抑え込めないことから新たに「RAG(Retrieval-Augmented Generation:検索拡張生成)(13)」という技術が登場した.
RAGは生成AIが検索参照するデータ領域をあらかじめ用意し,その領域にあるデータを,生成AIが必要とした場合にはそのまま出力に含めるという働きの機能で,例えば,学校の校則などの規則や,会社の商品ラインナップ等の利用が考えられる.どんな規則があるのか? 規則に照らし合わせた判断は? といったことや,会社が扱う商品のリストの利用であれば,顧客への提案として商品はこれがよい,などの出力が期待できる.このRAGの利点は,検索拡張領域のデータをそのまま出力することで,このデータにはハルシネーションが含まれていないという点が挙げられる.もちろん規則などを外部に提示したくない場合は,学校や会社の中だけで利用する環境を整えることにより,情報漏えいを防ぐことができる.
更に,この考え方を,広く社会一般の情報流通領域に拡張した対応を可能にする技術として「MCP(Model Context Protocol)(14)」と呼ばれる技術の利用が考えられるようになった.これは,生成AIが情報検索できる領域をインターネット空間やオープンデータベースなど,広く情報社会の領域で検索できるようにインタフェースを整えて,情報を取得できるようにするものである.生成AIに,一つ一つ情報を用意して学習させることなく,情報が流通するネットワーク全体から知識として拾い上げることができるようになる.
このようにして,RAGからMCPへと発展した上で,更に「AIエージェント(15)」という考え方が実用的になってきた.AIエージェントとは"自律的な働きをするAI"との考え方であり,MCPによって開かれた様々な情報空間を,縦横無尽に飛び跳ねて,自律的に総合判断を進めるということが期待される.
AIエージェントを概念的に考える際には,二つの人工知能を対話させることを考えてみると分かりやすい.人間がAIに質問を投げ掛けて答えを得るように,一方のAIが他方のAIに質問を投げ掛けて答えを得る場面を考えると,AI同士で議論が始まると想像できる.これを一つのAIで実現するとどうなるか? つまりAIの自問自答である.この自問自答を続けるのがAIエージェントといってもよい.自律的に答えを得るまで,様々な情報を検索し,類推を繰り返すことにもなる.よく出る例としては,旅行のプラン作りを自律的に行うことが挙げられる."いつか,どこかに行きたいので旅行プランを作成して(いつ,どこはあやふやな情報でもよい.)"と生成AIに入力すると,生成AIが電車,バスの時刻表をインターネットに参照しにいき,また宿泊施設の空き情報も参照した上で,時間の整合性を取り,プランとして作り上げることが期待できる.もちろん,期日や場所があやふやな指示であっても,それに合わせた季節や地域をインターネットのお勧めを参照した上で,提案を含めて旅行プランとして提示してくれる.
AIエージェントは旅行プランだけでなく,仕事においても,会議日程や参加者への招待メール作成などの段取り,会議に必要なデータ収集,会議議事録の作成,要約した上で,次の会議の設定までを自動的に進めることができる.まさに自律的なAIなのである.
このようにして生成AIは発展を遂げ,今や人類のパートナーとしての役割を担い始めているのである.ただ,AIエージェントが自律的に何らかの思考を限りなく続けた場合はどうなるか? 研ぎ澄まされた思考は,やがて知能爆発(16)を起こすという,SF的なことを唱える人もいる.少し怖い話でもある.
また,別の更なる発展形態としては,これまでは計算機への入力と出力におけるバーチャルな世界での実現がなされてきたが,今後は物理世界での活用が待たれている.「Physical AI」と称して話題が広がってきている.要は「AIロボット」の実現であるが,単にロボットを力作業の支援に使うだけでなく,各種物理センサから得られる物理量を学習し,活用する知能の実現である.人間もそうであるが,存在する物理の世界から様々な刺激を受け,知能活動に生かしている.これまでの生成AIの基本モデルであったLLMから世界基盤モデルWFM(World Foundation Model)へ発展させようとする研究もある(17).例えば,単にカメラで捉えた景色だけでなく,暑さ寒さ,匂いなどの物理環境からどんなことを学べて,どう解釈すればよいのか? 高度な俳句を詠むことなどができるようになるかもしれない.今後の発展に期待したい.
また,これまでに述べてきた人工知能はニューラルネットをベースに展開してきているが,人間の脳はまだ十分に調べ切れているわけではなく,例えば第六感や,NHKの番組(18)で紹介された「サヴァン症候群」などに代表される,脳の未知の能力等について,人工知能でどう表現できるか? 脳科学の研究とともに新たな発展が期待できる分野でもある.
9
人工知能技術の課題
さて,ここまで述べてきた人工知能技術は今後も発展し続けるであろう.やがては「AGI(Artificial General Intelligence)」と呼ばれる汎用人工知能技術の実現も成し遂げられるかもしれない.とは言いつつも,現時点で大きな課題があるのも事実である.一つは電力問題であり,もう一つは倫理問題である.
9.1 電力問題
ディジタル技術は,もちろん計算機を動かす必要があり,通信ネットワークをも含めて電力エネルギーが必要である.更に人工知能は計算量がばく大であり,それに必要なGPUを代表とする演算装置が使う電力は,その装置を冷却するための電力も必要となり,"うなぎ登り"だ.図6は人工知能の開発年代を横軸に,縦軸は必要となる計算量を表したグラフ(19)であるが,人工知能の第一次ブームから深層学習の実現が始まった第三次ブームでグラフの傾斜が急になり,更に生成AIの登場で傾きが一段と急しゅんになった.
生成AIはその規模の大きさからクラウド利用が前提となり,データセンターに置かれることが多い.このデータセンターの電力量は,その横に原子力発電所を用意する必要があるとも言われている.「ワットビット」(電力=ワットと情報通信・データ処理=ビットを統合し,効率的な社会基盤を構築する考え方)という言葉も使われるようになった(20).これが,今後の人工知能技術を更に発展させるために乗り越える課題となる.
GPUをはじめ,演算デバイスの能力を最大限に引き出すためには,デバイスの冷却が必要になる.これまでにも半導体チップをファンで冷やす空冷,周りに「水のジャケット」をかぶせて流水による水冷,特殊な冷却液に計算機ごと漬けてしまう方法(21),あるいは空冷ではあるが,風の通り道をサーバ機器内や収納ラック,データセンター室内において最適化する方法(22)で効率良く冷やす技術,データセンター自体を寒冷地に建設すること等が考えられてきた.また,直流電源での計算機の駆動方式(23)などによる省電力化なども考えられている.
更に大きな生成AIのシステムを作り上げるためには,データセンターを分散させ,各データセンターが必要とする電力も分散させることにより,電力の「地産地消」を確立し,更にデータセンター間を低遅延通信ネットワークIOWN(24)で結ぶことにより,あたかも一つの大きなデータセンターとしての活用を実現することも始まっている.このようにして,人工知能の発展とともに電力消費問題を解決する手段が考えられている.

図6 AI技術の発展と消費電力
9.2 倫理問題
もう一つの問題が人工知能の倫理問題である.本稿においても,これまでにバイアス問題やブラックボックス問題,ハルシネーションの問題を述べてきた.また,人工知能の性能が高まるにつれ,その出力結果が人間が生み出したものと大差ないレベルとなり,人間が作り出したものなのか,人工知能が作り出したものなのか,判別がつきにくくなってきた.これらのことを考えると,人工知能の出力結果が人間社会の倫理問題に抵触する可能性が一気に高まってきた.
例えば,高度なフェイク画像生成が差別行動や扇動活動に発展するおそれがあることや,ハルシネーションによる誤情報の拡散による世情不安などが挙げられる.また,学習データとして著作権を侵害するようなデータの利用や,個人情報や機密情報を学習データに取り込んでしまうことによる漏えいリスクも考える必要が出てくる.このような倫理問題にも対処していかないと人工知能技術の健全な発展はないと考えられる.
また,人工知能技術は人類にとって「もろ刃の剣」とも表現できる.これは原子力技術との比較がよく語られる.原子力技術はCO2を排出しないクリーンな発電が可能で,人類にとって有効な技術ではあるが,他方,原子爆弾といった兵器にも活用される技術である.人工知能も人類のパートナーとなり得る技術と位置づけられるが,他方,情報セキュリティを脅かすことをはじめ,軍事利用の研究も盛んに行われている.こういった技術開発の観点においても,その倫理観が問われるところである(図7).
現時点では米国,欧州あるいは日本において法律やガイドラインの制定などによる規制が行われつつあるが,他方,技術開発の先導優位を目指した開発競争が進められ,規制を目的とした法律の施行も遅らせるような話が巻き起こっているのも事実である.是非,技術者の皆さんには,この辺りの倫理観を個人個人が持つことにより,人工知能技術の健全な発展に寄与してほしいと願うばかりである.

図7 人工知能技術と倫理問題
10
おわりに
以上,人工知能技術について学生の方や一般の方に向けて,できるだけ簡単な表現を使い,その歴史と仕組み,及び抱える課題について述べた.本稿が社会的に重要と位置付けられる人工知能技術について,アウトラインをつかみ,過度な期待や不安を持つことなく,この技術の活用と発展に向けて,多くの方にこの人工知能技術やそれを支える様々な技術分野に取り組んでもらうきっかけになれば幸いである.
最後に,この分野において2024年にノーベル物理学賞をGeoffrey Hinton先生が受賞され,脚光を浴びた.しかし,その研究の源流は日本の福島邦彦先生や甘利俊一先生まで遡ることができるとも言われている.この技術研究分野には二人の先生のほか,日本が大きく貢献していることを記しておきたい.
文 献
(2026年2月5日受付,2026年4月6日再受付)
川村直毅
1986からNTT厚木電気通信研究所にて半導体加工・分析技術を研究.また研究成果のビジネス化にも取り組む.その後,1999にNTTデータに移りICカードの技術開発・実用化に従事.2017からNTTデータ先端技術にてAI技術の普及に取り組む.