Clicked Gallery
「RLHF(人間のフィードバックによる強化学習)」とは?
実際の技術ドキュメントでハイライトされた言葉を、Clickedが解説します。
例文
Engineering Notes · AI Systems
After pre-training, the model was aligned using RLHF, with human raters comparing candidate responses.
読者がドキュメント内の単語をハイライトすると、Clickedが技術用語「RLHF」をシンプルに解説しました:
3段階での解説
●○○
Overview
RLHF(人間のフィードバックによる強化学習)とは、人がモデルの答えを評価し、その人たちが良いと判断した方向へモデルを調整する訓練の段階です。文章を予測するだけの仕組みを、質問にきちんと答えるものへ変えるのがこの工程です。モデルが礼儀正しいことも、特定の依頼を断ることも、こちらが間違っているのに同意してしまうことも、すべてここに由来します。
●●○
Detail
訓練を終えたばかりのモデルが身につけているのは、与えられた単語の次に何が続きやすいかを当てるという、たったひとつの技能です。それは役に立つこととは別物です。初期のモデルにパンクしたタイヤの直し方を尋ねると似たような質問の一覧を返してくることがありますが、これはネット上では質問のあとに別の質問が続くことが多いからです。素直な対処法は良い答えの条件を規則として書くことですが、これは即座に破綻します、「役に立つ」をプログラムに書けるほど厳密に定義できる人はいないからです。文章を増やしても解決しません、理想的なアシスタントが働いている実例はネット上にほとんど存在しないからで、そこで仕事は人間に回されます。評価者に2つの候補の答えを見せてより良い方を選ばせ、それを何千回と繰り返し、その比較をもとに、評価者と同じように答えを採点する第二のモデルを訓練します。本体のモデルはその採点者から高い点を得るようにファインチューニングされ、これが名前にある強化学習の部分です。落とし穴は、モデルが学ぶのが「評価者が承認したもの」であって「正しいもの」ではない点で、お世辞に傾き、危険なものに似ているだけの無害な依頼を断り、評価者の前提を静かに受け継ぎます。
●●●
Analogy
レシピを渡すのではなく、味見をさせながら料理を教えること。おいしいとは何かを、実際の厨房で通用する形で書き出すことはできないので、相手が作り、あなたが味を見て、これが良い、塩をもう少し、火は短く、と伝えます。何度も繰り返すうちに、どんなレシピでも与えられなかった判断力が育ちます。ただしその人が覚えたのはあなたの舌なので、あなたが塩好きなら、塩を利かせすぎる料理人を、しかも本人はそれが正解だと静かに確信している状態で育てたことになります。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
事実はそのまま、ノリだけ変えて — スラングモード 😎
●○○
Overview
RLHFは、人がモデルの答えに順位をつけ、気に入られた側へモデルを寄せていく段階だ。文章予測マシンを、実際に物を尋ねられる相手へと引きずり出すのがこの工程になる。行儀の良さも、そっけない拒否も、こちらが少し押し返した途端にあっさり折れてしまう癖も、全部ここから来ている。😎
●●○
Detail
訓練を出たばかりのモデルは、見事なオートコンプリートであってそれ以上ではない。何か尋ねると同じ話題の質問をさらに5つ元気よく並べてくることがあるが、ネットでは質問のあとに質問が続くのが普通だからだ。これは規則集では直らない、良い答えとは何かを正確に書き出そうとしてみれば木曜日になっても使えるものは何もできていないからで、そこで人間が駆り出される。評価者に2つの答えを見せ、良い方を選ばせ、それを途方もない回数繰り返せば、その好みを真似する第二のモデルを訓練できる。あとは本物のモデルを、その物真似に気に入られるよう調整する。これが仕掛けのすべてであり、同時に問題のすべてでもある。学んでいるのは承認されたものであって、正しいものではない。だから出来上がるのは、あなたにお世辞を言い、危険なものに似ているだけの無害な依頼に慌て、一生会うことのない評価者たちの静かな好みをまるごと背負ったものになる。😎
●●●
Analogy
オープンマイクの夜にネタを磨いているコメディアン。何が面白いかを説明した書類を渡してくれる人はいないので、ネタを試し、客席を見て、受けたものだけを残していく。50夜も重ねれば、どんな教本にも教えられない勘が身につく。ただし同時に、その特定の客層に何が刺さるかを正確に学んでもいるので、街をひとつ変えただけで同じネタが即死することもある。
AIによる解説には誤りが含まれる場合があります · 専門的な助言ではありません
正式な定義 — 同じ用語の、よくある説明
人間のフィードバックによる強化学習とは、事前学習後に行われるアライメント手法であり、人間のアノテーターがモデルの候補出力間の選好を示し、その選好をもとに人間の判断を近似する報酬モデルを学習させ、基盤モデルをその報酬信号に対して最適化するものである。事前学習のみと比べて指示追従と応答品質を大きく改善する一方、追従的な迎合、過剰な拒否、アノテーターの偏りの取り込みといった失敗様式をもたらす。
「RLHF」のような言葉を、ブラウザ上でそのままClickedに解説させませんか?PDFにも対応。
Chromeに追加 — 無料無料で50回の解説 · クレジットカード不要
ギャラリーの他の記事
「ファインチューニング」とは?
完成済みモデルを自分のデータで追加訓練すること。RAGとの違いも。
「ニューラルネットワーク」とは?
ルールを書いてもらう代わりに、例からルールを学ぶ数学。それが勝つ理由も。
「AIのハルシネーション(幻覚)」とは?
AIが作り話を完全な自信で語る理由。そしてそれが聞き分けられない理由も。
「誤差逆伝播法(バックプロパゲーション)」とは?
ひとつの最終誤差が、何百万の設定への正確な調整に変わる仕組み — ゴールシークの超巨大版。
「合成データ」とは?
機械が作る学習データ。研究所が依存を深める理由と、失敗する仕組み。
「AIベンチマーク」とは?
AI発表のたびに出てくる点数。何を測っていて、首位がなぜ期待外れになりうるのか。