Key points are not available for this paper at this time.
Reinforcement Learning from Human Feedback (RLHF) beinhaltet das Training von Policy-Modellen (PMs) und Belohnungsmodellen (RMs), um Sprachmodelle mit menschlichen Präferenzen in Einklang zu bringen. Anstatt sich ausschließlich auf PMs und RMs unabhängig zu konzentrieren, schlagen wir vor, ihre Interaktionen während des Feintunings zu untersuchen und das Konzept der Seamlessness einzuführen. Unsere Studie beginnt mit der Beobachtung des Sättigungsphänomens, bei dem kontinuierliche Verbesserungen von RM und PM nicht in Fortschritt bei RLHF umgesetzt werden. Unsere Analyse zeigt, dass RMs nicht in der Lage sind, angemessene Bewertungen für PM-Antworten zu vergeben, was zu einer Fehlanpassungsrate von 35% zu menschlichen Präferenzen führt und eine signifikante Diskrepanz zwischen PM und RM verdeutlicht. Um die Seamlessness zwischen PM und RM ohne menschlichen Aufwand zu messen, schlagen wir eine automatische Metrik vor, SEAM. SEAM quantifiziert die Diskrepanzen zwischen PM- und RM-Beurteilungen, die durch Datenproben hervorgerufen werden. Wir validieren die Effektivität von SEAM in der Datenauswahl und Modellvergrößerung. Unsere Experimente zeigen, dass (1) die Verwendung von SEAM-gefilterten Daten für das RL-Training die RLHF-Leistung um 4,5% verbessert und (2) die SEAM-gesteuerte Modellvergrößerung zu einer Leistungsverbesserung von 4% gegenüber standardmäßigen Vergrößerungsmethoden führt.
Lu et al. (2024) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: