Clicked Gallery
Was ist RLHF (bestärkendes Lernen aus menschlichem Feedback)?
Markiert in einem echten Engineering-Dokument. Erklärt von Clicked.
Im Satz verwendet
After pre-training, the model was aligned using RLHF, with human raters comparing candidate responses.
Der Leser markierte ein Wort in der Dokumentation. Clicked erklärte den Fachbegriff „RLHF“ ganz einfach:
In drei Stufen erklärt
Overview
Detail
Analogy
Gleiche Fakten, anderer Vibe — Slang-Modus 😎
Overview
Detail
Analogy
Formale Definition — Derselbe Begriff, wie er sonst erklärt wird
Soll Clicked Begriffe wie „RLHF“ direkt in deinem Browser erklären – auch in PDFs?
Zu Chrome hinzufügen — Kostenlos50 kostenlose Erklärungen · Keine Kreditkarte nötig
Mehr aus der Galerie
Was ist Fine-Tuning?
Ein fertiges Modell mit eigenen Daten weitertrainieren, und worin sich das von RAG unterscheidet.
Was ist ein neuronales Netz?
Mathematik, die Regeln aus Beispielen lernt, statt sie geschrieben zu bekommen, und warum das gewinnt.
Was ist eine KI-Halluzination?
Warum KI erfundene Fakten mit voller Überzeugung ausgibt, und warum man es nicht hört.
Was ist Backpropagation?
Wie ein finaler Fehler zur präzisen Anpassung für Millionen Einstellungen wird — Zielwertsuche in groß.
Was sind synthetische Daten?
Von Maschinen erzeugte Trainingsdaten, warum Labore zunehmend darauf setzen und wie es schiefgeht.
Was sind KI-Benchmarks?
Die Zahlen hinter jeder KI-Ankündigung, was sie messen und warum der Erste enttäuschen kann.