>

Clicked Gallery

Was ist RLHF (bestärkendes Lernen aus menschlichem Feedback)?

Markiert in einem echten Engineering-Dokument. Erklärt von Clicked.

Im Satz verwendet

Engineering Notes · AI Systems

After pre-training, the model was aligned using RLHF, with human raters comparing candidate responses.

Der Leser markierte ein Wort in der Dokumentation. Clicked erklärte den Fachbegriff „RLHF“ ganz einfach:

In drei Stufen erklärt

Gleiche Fakten, anderer Vibe — Slang-Modus 😎

Formale Definition — Derselbe Begriff, wie er sonst erklärt wird

Bestärkendes Lernen aus menschlichem Feedback ist ein Ausrichtungsverfahren nach dem Vortraining, bei dem menschliche Annotatoren Präferenzen zwischen Ausgabekandidaten äußern, diese Präferenzen ein Belohnungsmodell anpassen, das menschliches Urteil approximiert, und das Basismodell anschließend gegen dieses Signal optimiert wird. Es verbessert die Befolgung von Anweisungen gegenüber reinem Vortraining erheblich und führt zugleich Fehlermodi wie Schmeichelei, übermäßige Verweigerung und die Kodierung von Bewerterverzerrungen ein.

Soll Clicked Begriffe wie „RLHF“ direkt in deinem Browser erklären – auch in PDFs?

Zu Chrome hinzufügen — Kostenlos

50 kostenlose Erklärungen · Keine Kreditkarte nötig