Der Ausgangspunkt: Menschen als Maßstab
Lange Zeit wurden Modelle vor allem darauf optimiert, welche Antwort Menschen besser finden. Dieses Verfahren nennt sich Reinforcement Learning from Human Feedback (RLHF). Aber das hat einen entscheidenden Haken: Menschliche Bewertungen sind teuer, langsam und subjektiv. Und sie belohnen vor allem das, was gut klingt, nicht immer das, was inhaltlich richtig ist.