LLM 入門:大規模言語モデルの仕組み
大規模言語モデル(LLM)は現代の AI アプリの中核となりました。このチュートリアルでは LLM が実際にどう動くかをできるだけ平易に説明し、正しい直感とさらなる学習の土台を築きます。
著者:AI Resource Hub
大規模言語モデルとは
大規模言語モデルは大量のテキストで学習したニューラルネットワークです。その中核機能はただ一つ、既存のテキストから次に来る最も確からしい単語を予測することです。
単純に見える「次の単語予測」も、膨大なパラメータとデータ規模のもとで、会話、翻訳、コーディング、要約などの複雑な能力を生み出します。
トークン:モデルから見たテキスト
モデルは文字を直接処理しません。まずテキストをトークンに分割します。トークンは単語全体、サブワード、または数文字の場合があります。
英語では約4文字が1トークン、中国語では1文字が通常1〜2トークンに対応します。API の課金もコンテキスト長の制限もすべてトークン単位で計算されます。
モデルがテキストを生成する仕組み
入力(プロンプト)が与えられると、モデルは語彙内の各トークンの確率を計算し、サンプリング戦略で次のトークンを選び、入力に追加して、生成が終わるまでこのループを繰り返します。
temperature(温度)パラメータはランダム性を制御します。値が低いほど出力は決定的で保守的に、高いほど創造的になりますが、話題から外れやすくなります。
コンテキストウィンドウ
モデルが一度に「見られる」トークンの総量をコンテキストウィンドウと呼びます。ウィンドウを超えた内容は切り捨てられるか忘れられるため、長い会話は要約が必要で、長い文書は分割処理が必要です。
限界とハルシネーション
LLM は「もっともらしくでたらめを言う」ことがあります。これはハルシネーションと呼ばれる現象です。モデルは事実を本当に「知っている」わけではなく、答えらしく見えるテキストを予測しているだけです。
したがって正確な情報が必要な場面では、検索拡張生成(RAG)、ツール呼び出し、または人の確認を組み合わせてリスクを減らすべきです。