同じ質問を投げても、モデルによって答えの「感じの良さ」がずいぶん違います。
内容は合っているのに素っ気なかったり、聞いていないことまで並べてきたり。
この差を埋めるために広く使われているのが RLHF という手法です。
今回は RLHF が何をしているのかを、学習の流れに沿って整理しました。
RLHF は何の略か
RLHF は Reinforcement Learning from Human Feedback の略で、日本語では「人間のフィードバックによる強化学習」と訳されます。
名前のとおり、人間が付けた評価を手がかりに、強化学習でモデルを調整する手法。
もともとは言語モデル向けではなく、2017年にゲームやロボット制御の研究として発表されたものです。
人間に2つの動きを見せて「どちらが良いか」を選ばせ、その選好から報酬関数を学ぶ、というアイデアでした。
論文では、エージェントが環境とやり取りした回数のうち1%未満に人間が評価を付けるだけで、Atari のゲームや模擬ロボットの制御を学習できたと報告されています(Deep reinforcement learning from human preferences, arXiv:1706.03741)。
言語モデルに持ち込んだのが InstructGPT
この考え方を大規模言語モデルへ適用して広く知られたのが、2022年3月に公開された InstructGPT の論文です。
モデルを大きくするだけでは、利用者の意図に沿った答えは出てこない。
論文はそこを出発点にして、人間のフィードバックで整えたモデルのほうが好まれることを示しました(Training language models to follow instructions with human feedback, arXiv:2203.02155)。
実際、13億パラメータの InstructGPT の出力が、1750億パラメータの GPT-3 の出力より人間評価で好まれたと報告されています。
パラメータ数が100分の1以下でも、答え方の調整が効けば評価は逆転する。
3つのステップで何をしているか
RLHF の流れは、大きく3段階に分かれます。
第1段階は教師あり微調整で、人間が書いた模範解答を使ってモデルを一度整える工程です。
第2段階は報酬モデルの学習。
同じ質問に対する複数の答えを人間に順位付けしてもらい、その順位を再現するように別のモデルを訓練します。
第3段階が強化学習で、報酬モデルが高い点を付ける答えを出すよう、元のモデルを更新していく流れです。
ここで使われる代表的なアルゴリズムが PPO(Proximal Policy Optimization)。
報酬モデルは、与えられた答えに点数を返すだけの小さなモデルです。
人間の採点係を機械で用意して、その採点係に向かって本体を最適化していく。
この「採点係を先に作る」という段取りが、RLHF をほかの学習手法と分けている特徴になります。
第1段階にあたるファインチューニングそのものについては、別記事で整理しました。
なぜ「正解」ではなく「順位」なのか
一見すると、模範解答をたくさん書かせたほうが早そうに思えます。
ところが、良い文章をゼロから書く作業は人間にとってかなり重い。
一方で「AとBのどちらがマシか」を選ぶだけなら、判断は速く、評価者ごとのブレも小さく収まります。
つまり 作らせるより選ばせるほうが、同じ時間で集められる判断の数が多いわけです。
その順位データを報酬モデルへ変換してしまえば、人間の判断を機械側で何度でも再利用できます。
ここが RLHF の設計の核心にあたる部分。
RLHF の弱点と後継手法
便利な反面、RLHF には知られた弱点があります。
ひとつは報酬ハッキングで、報酬モデルが高く採点する特徴だけを狙った答えに寄っていく現象です。
長く書けば点が上がる報酬モデルなら、モデルはひたすら冗長な答えを返すようになります。
もうひとつは、評価者のバイアスがそのまま学習されてしまうこと。
そして 報酬モデルと強化学習の2段構えは、パイプラインが複雑で学習が不安定になりやすいという運用上の問題も抱えています。
対策としては、学習中に元のモデルから離れすぎないよう制約を入れるのが一般的です。
ただし制約を強くすれば今度は調整が効かなくなるので、さじ加減が要ります。
この複雑さを畳んだのが、2023年に提案された DPO(Direct Preference Optimization)です。
報酬モデルを別に用意せず、選好データから直接モデルを最適化する。
論文では、報酬モデルのパラメータ化を工夫することで最適な方策を閉じた形で取り出せるようになり、標準的な RLHF の問題が単純な分類の損失だけで解けると説明されています(Direct Preference Optimization: Your Language Model is Secretly a Reward Model, arXiv:2305.18290)。
最後に
RLHF は、モデルに「正解」を教える手法ではありません。
人間が選んだ好みを報酬に翻訳して、答え方のクセを寄せていく仕組みです。
だからこそ、評価者が何を良しとしたかが、そのままモデルの性格になります。
事実の誤りが RLHF だけでは消えない理由も、突き詰めればここに行き着くのです。
以上です。










コメントを残す