前言
大規模言語モデル(LLM)は、確率生成システムです。
- 知識のタイムリー性:モデルの知識は訓練データの時間点までに限定されます。
- 推論の制限:本質的には確率予測であり、複雑な数学的推論では誤りが生じやすい(deepseekのアーキテクチャは異なる)。
- 専門領域の盲点:特定の垂直領域の知識が不足しています。
- 幻覚現象:一見合理的だが実際には誤った内容を生成することがあります。
モデルの微調整とは?
微調整は、事前にトレーニングされた大規模モデル(GPT、BERTなど)を特定の領域やタスクのデータで追加トレーニングし、新しいタスクに適応させるプロセスです。
これは、「博士課程の学生が通識教育(事前トレーニング)を受けた後、特定の研究方向(微調整)に特化する」ようなものです。
微調整の適用シナリオ
特定分野の専門性の向上
医療、法律、金融、技術などの高度に専門的な知識が必要な場合、一般的な大規模モデルはこれらの分野の知識と論理を持ち合わせていません。
- 医療レポート生成
- 法的契約レビュー
- 財務報告解析
- 研究論文評価
企業のニーズに合わせる
企業はAIに特定のビジネスロジックを持つことを求めています。
- コード生成
- 業務フローの最適化
- 企業アシスタント
ユーザーの好みに合わせる
個別のスタイルや特性に対応します。
- パーソナライズされたチャット
- コンテンツ作成アシスタント
- ゲームNPC
特定のタスクの実行
標準化されたタスクを実行します。
- コード生成モデル
- テーブル理解
データの安全性とプライバシー
敏感なデータに対する対策です。
- 銀行データ
- 医療機関データ
リソース制約のある環境
オフラインデバイスや低メモリ環境での使用です。
- 装置故障診断マニュアル検索
- 地下または海底での救助知識
微調整の方法
監督付き微調整(Supervised Fine-Tuning, SFT)
明確なタスクとラベル付きデータがある場合に使用します。
[
{
"instruction": "法務顧問として、以下の質問に答えてください:",
"input": "会社で解雇された場合、どれだけの補償を受け取れますか?",
"output": "労働契約法第47条に基づいて..."
}
]
指示微調整(Instruction Tuning)
モデルがさまざまな指示を理解し実行する能力を高めます。
[
{
"instruction": "量子力学を簡単な言葉で説明してください。",
"output": "量子力学は小さな粒子の行動を研究する科学..."
}
]
対話微調整(RLHF/DPO)
人間のフィードバックにより、モデルの出力を調整します。
[
{
"prompt": "気候変動についての記事を書いてください。",
"chosen": "気候変動は人類が直面する最も緊急の問題の一つです。科学研究は...",
"rejected": "気候変動はメディアが誇張した詐欺であり、気にする必要はありません。"
}
]
多タスク学習
関連する複数のタスクを同時に最適化します。
[
{
"task": "感情分析",
"input": "この携帯電話のバッテリー寿命が短すぎる。非常に失望しました。",
"output": "ネガティブ"
}
]
微調整フレームワークの紹介
Hugging Face Transformers
業界標準のNLPフレームワークで、200以上の事前トレーニング済みモデルとツールチェーンを提供します。
DeepSpeed
Microsoftが開発した分散トレーニングエンジンで、ZeRO最適化により大規模モデルの全パラメータ微調整を可能にします。
LLaMA-Factory
国内製の低コード微調整フレームワークです。
Megatron-LM
NVIDIAの兆単位のモデルトレーニングフレームワークで、3D混合並列戦略を使用します。