Wir hatten einen Loop gebaut, in dem der Agent nach jeder Iteration ein Qualitätsurteil bekam. Auf dem Papier sauber. In der Praxis lernte er das Falsche, weil das Signal mehrdeutig war: „gut” hieß mal schnell, mal vollständig, mal beides.
Die Lektion: Bevor man den Loop schließt, muss das Feedback-Signal so eindeutig sein, dass zwei Menschen es gleich interpretieren würden. Ist es das nicht, optimiert der Agent das Rauschen.