AIを追いかけるために必要なのは、もはやモデルやアルゴリズムを理解することだけではありません。急速に変化する略語や新しい技術概念を含む用語集を読み解くことも必要です。本ガイドでは、スマートアシスタントや生成モデルの背後で何が起きているのかを理解するために、開発者、プロダクトチーム、技術分野の読者が知っておくべき主要な用語を集めています。
これらの概念には、訓練、推論、重みといった基礎的なものから、AIエージェントやModel Context Protocolなど、より新しい応用に関連するものまで含まれます。また、モデルの効率性や監視可能性をめぐる近年の議論で登場した、「不透明な推論」(Opaque recurrence)などの用語も取り上げます。
モデルを構築し、動作させる概念
大規模言語モデル(LLM)とは、膨大な量の書籍、記事、テキストから単語やフレーズ間の関係を学習する深層ニューラルモデルです。入力を受け取ると、モデルはその入力に最も合致する可能性の高いパターンを生成します。これらのモデルは、ChatGPT、Claude、Google Gemini、Meta AI Llama、Microsoft Copilot、Mistral Le Chatで利用されています。
訓練とは、モデルがデータからパターンを学習するプロセスです。一方、推論は、モデルが学習した内容に基づいて予測や回答を生成するためにモデルを実行することを指します。スマートフォンのプロセッサからGPUやAIアクセラレーターに至るまで、推論に使用されるハードウェアは、モデルの実行速度や大規模モデルを扱う能力に影響します。
重みは、モデル内部のさまざまな特徴がどの程度重要かを決定するもので、訓練中に変化し、出力が求められる目標に近づくよう調整されます。検証損失(Validation loss)は、検証データ上でモデルがどの程度適切に学習できているかを測定します。通常は低いほど望ましいものですが、訓練データを記憶して汎化可能なパターンを学習しない過適合を見つけるうえでも役立ちます。
深層学習は、複数の層からなるニューラルネットワークを使用するモデルを指します。一方、ニューラルネットワークは、これらのモデルの基盤となる、より広い計算構造を指します。こうしたシステムは通常、より単純なアルゴリズムと比較して大量のデータと長い訓練時間を必要とするため、開発コストが高くなります。
モデルはどのように特化し、効率化されるのか
ファインチューニング(Fine-tuning)では、特定のタスクや分野に特化したデータを使って、既存モデルの訓練を継続します。一方、転移学習(Transfer learning)では、別のタスクに取り組む際の出発点として、事前訓練済みモデルを使用します。新しいタスクのデータが限られている場合、開発時間を短縮できる可能性がありますが、その分野に適した追加データが必要なくなるわけではありません。
蒸留(Distillation)では、大規模モデルが「教師」として機能し、その出力を使って、教師の振る舞いを模倣しようとする小規模モデルを訓練します。その結果、性能がある程度失われる可能性はあるものの、より小型で効率的なモデルが得られる可能性があります。競合モデルの出力を蒸留することは、APIやアシスタントの利用規約に違反する可能性があると、情報源は指摘しています。
Mixture of Experts(混合専門家)アーキテクチャは、ネットワークを専門化されたユニットに分割し、リクエストごとにその一部だけを有効化します。これにより、各処理に必要な計算量を抑えながら大規模モデルを構築できます。Mistral AIのMixtralはよく知られた例です。一方、最新のGPTモデルはこのアーキテクチャの何らかの形態を使用していると広く考えられていますが、OpenAIによる公式の確認はありません。
拡散(Diffusion)モデルは、画像、音楽、テキストの生成に利用されます。データに段階的にノイズを加え、その後、ノイズからデータを復元する逆のプロセスを学習します。一方、GANは、出力を生成するネットワークと、それを評価するネットワークを組み合わせたものです。特にディープフェイクツールのような、より限定された用途で、リアルな画像や動画の生成に使用されてきました。
エージェントとツールへの接続
AIエージェントは、ユーザーに代わってチケットを予約したり、コードを更新したり、外部サービスを操作したりするなど、一連の手順を実行できると想定されている点で、基本的なチャットボットとは異なります。ただし、この用語には統一された定義がなく、こうした機能を提供するために必要なアーキテクチャもなお開発中です。
コーディングエージェントは、コードの提案だけにとどまらず、コードの作成、テスト、デバッグ、完全なリポジトリ上での作業を専門とします。しかし記事によれば、エージェントは限られた監視のもとで広範な作業を実行できる可能性があるため、人間によるレビューは依然として必要です。
APIエンドポイントは、あるプログラムが別のプログラムにサービスを要求できる、裏側にあるボタンのようなものです。エージェントの能力が高まるにつれて、エージェントはこれらのエンドポイントを発見して利用し、自動処理を実行できるようになります。これは実用的な可能性を広げる一方、予期しない挙動を生む可能性もあります。Model Context Protocol(MCP)は、関係ごとに専用コネクターを構築することなく、モデルがファイル、データベース、アプリケーションに接続できるようにするオープン標準です。Anthropicが2024年にこのプロトコルを発表し、その後Linux Foundationに移管され、さらにOpenAI、Google、Microsoftが採用しました。
これらの用語が実務上重要な理由
これらの概念は、AIシステムの性能がモデルだけで決まるものではないことを示しています。並列処理により、GPU上で数千の処理を同時に実行できます。一方、トークン処理量(Token throughput)は、システムが一定時間内に処理できる作業量を測定するもので、対応可能なユーザー数や応答速度に影響する要因です。
トークン(Token)はテキストの小さな単位で、単語の一部である場合もあります。言語の入力と処理、そしてモデルサービスの料金計算に使用されます。メモリキャッシュ、特にKVキャッシュは、推論中に繰り返される計算を減らし、回答を高速化するのに役立ちます。
一方、ハルシネーションは依然として品質上の大きな問題の一つです。モデルは、誤った情報や誤解を招く助言を生成することがあり、危険になり得る健康関連の回答も含まれます。情報源によれば、このリスクは訓練データの欠落に関連しており、より特化され、分野に限定されたモデルが推進される理由の一つとなっています。
特に注目に値する用語の一つが不透明な推論です。これは、理解可能な言語で連続した思考手順を示すのではなく、入力をモデルの層に何度も通すことを意味します。この方式はより効率的であり、少ない計算量で小規模モデルがより高い性能を発揮できる可能性がありますが、読み取り可能な痕跡が少なくなるため、研究者が望ましくない挙動を発見することが難しくなります。これに関連する用語として、ほぼ同じ工学的手法を説明する再帰深度(Recurrent depth)があります。
一方、「Neuralese」は、モデルが人間に理解可能な言語を使わず、内部の数値表現だけで完全に思考する仮想的なシナリオです。情報源によれば、公開されているモデルでこの状態に到達したものはなく、OpenAIは、2026年9月に発表されたAstraモデルが思考連鎖の可読性を維持していると述べています。ただし、安全性研究者は、不透明な推論に利用されることを懸念しています。
この用語集の価値は、一般的な議論でしばしば混同される概念を区別している点にあります。訓練は推論ではなく、エージェントは単なるチャットボットではなく、「オープンソース」は必ずしもモデルのすべての構成要素が同じ方法で利用可能であることを意味しません。また、より新しい用語、特に自律性と透明性に関連する用語には、依然としてさまざまな定義があり、監督と安全性の境界をめぐる未解決の問題が残されています。