Anthropic publishes Constitutional AI
A model critiques and revises its own outputs against a written list of principles, then trains a reward model from its own preference judgements instead of human labels.
AnthropicSafety & alignment · Ideas & essays