Person
1 entry · 15 December 2022
A model critiques and revises its own outputs against a written list of principles, then trains a reward model from its own preference judgements instead of human labels.
Safety & alignment · Ideas & essays