LLM 入門:大規模言語モデルの仕組み
大規模言語モデル(LLM)は現代の AI アプリの中核となりました。このチュートリアルでは LLM が実際にどう動くかをできるだけ平易に説明し、正しい直感とさらなる学習の土台を築きます。
著者:AI Resource Hub
大規模言語モデルとは
大規模言語モデルは大量のテキストで学習したニューラルネットワークです。その中核機能はただ一つ、既存のテキストから次に来る最も確からしい単語を予測することです。
単純に見える「次の単語予測」も、膨大なパラメータとデータ規模のもとで、会話、翻訳、コーディング、要約などの複雑な能力を生み出します。
トークン:モデルから見たテキスト
モデルは文字を直接処理しません。まずテキストをトークンに分割します。トークンは単語全体、サブワード、または数文字の場合があります。
英語では約4文字が1トークン、中国語では1文字が通常1〜2トークンに対応します。API の課金もコンテキスト長の制限もすべてトークン単位で計算されます。
モデルがテキストを生成する仕組み
入力(プロンプト)が与えられると、モデルは語彙内の各トークンの確率を計算し、サンプリング戦略で次のトークンを選び、入力に追加して、生成が終わるまでこのループを繰り返します。
temperature(温度)パラメータはランダム性を制御します。値が低いほど出力は決定的で保守的に、高いほど創造的になりますが、話題から外れやすくなります。
コンテキストウィンドウ
モデルが一度に「見られる」トークンの総量をコンテキストウィンドウと呼びます。ウィンドウを超えた内容は切り捨てられるか忘れられるため、長い会話は要約が必要で、長い文書は分割処理が必要です。
限界とハルシネーション
LLM は「もっともらしくでたらめを言う」ことがあります。これはハルシネーションと呼ばれる現象です。モデルは事実を本当に「知っている」わけではなく、答えらしく見えるテキストを予測しているだけです。
したがって正確な情報が必要な場面では、検索拡張生成(RAG)、ツール呼び出し、または人の確認を組み合わせてリスクを減らすべきです。
LLM の学習プロセス
LLM のトレーニングは段階的に進みます。まず事前学習:モデルは公開インターネット、書籍、コードリポジトリ、ライセンスデータセットから数兆トークンを読み込みます。この段階で文法、世界知識、推論パターンを学びますが、まだ指示にうまく従えず、安全でない内容を生成することもあります。
次にファインチューニング:人間が高品質な質問応答ペアを書き、モデルは指示に従い有害な要求を拒否することを学びます。最後に、人間からのフィードバックに基づく強化学習(RLHF)でモデルの行動を人間の選好に合わせます。このパイプラインにより、生の事前学習モデルと ChatGPT のような完成品は同じアーキテクチャを共有しながらも全く異なる動作をします。
実世界での応用
LLM はほぼあらゆる種類のソフトウェアに組み込まれています。代表的な用途としては、ライティングアシスタント(メール下書き、ブログ記事、広告コピー)、コーディングコーパイロット(自動補完、コードレビュー、テスト生成)、カスタマーサポートチャットボット、文書要約、非構造化テキストからのデータ抽出、翻訳などがあります。教育分野では個別チューターとして、医療分野では臨床メモの作成支援、法務分野では契約レビューの加速に活用されています。
適切な LLM を選ぶ
すべての LLM がすべての仕事に合うわけではありません。選ぶ際は以下を検討してください:(1) タスク適合——特定のユースケース(コーディング、クリエイティブライティング、要約)に優れているか。(2) コンテキストウィンドウ——文書の長さを処理できるか。(3) レイテンシとコスト——想定ボリュームでの API 料金が予算内か。(4) プライバシー——セルフホスト可能か、クラウド API で十分か。(5) 多言語サポート——対象言語で十分に機能するか。最終決定前に、自データで 2〜3 の候補をベンチマークしてください。リーダーボードは大まかな指標にはなりますが、実際のワークロードでのテストには及びません。