>

Clicked Gallery

「RLHF(人間のフィードバックによる強化学習)」とは?

実際の技術ドキュメントでハイライトされた言葉を、Clickedが解説します。

例文

Engineering Notes · AI Systems

After pre-training, the model was aligned using RLHF, with human raters comparing candidate responses.

読者がドキュメント内の単語をハイライトすると、Clickedが技術用語「RLHF」をシンプルに解説しました:

3段階での解説

事実はそのまま、ノリだけ変えて — スラングモード 😎

正式な定義 — 同じ用語の、よくある説明

人間のフィードバックによる強化学習とは、事前学習後に行われるアライメント手法であり、人間のアノテーターがモデルの候補出力間の選好を示し、その選好をもとに人間の判断を近似する報酬モデルを学習させ、基盤モデルをその報酬信号に対して最適化するものである。事前学習のみと比べて指示追従と応答品質を大きく改善する一方、追従的な迎合、過剰な拒否、アノテーターの偏りの取り込みといった失敗様式をもたらす。

「RLHF」のような言葉を、ブラウザ上でそのままClickedに解説させませんか?PDFにも対応。

Chromeに追加 — 無料

無料で50回の解説 · クレジットカード不要