npx skills add ...
npx skills add firecrawl/ai-research-skills --skill constitutional-ai
Anthropic's method for training harmless AI through self-improvement. Two-phase approach - supervised learning with self-critique/revision, then RLAIF (RL from AI Feedback). Use for safety alignment, reducing harmful outputs without human labels. Powers Claude's safety system.
npx skills add firecrawl/ai-research-skills --skill constitutional-ai
Constitutional AI (CAI) trains models to be harmless through self-critique and AI feedback, without requiring human labels for harmful outputs.
Key concept: Models learn to critique and revise their own responses using a "constitution" (set of principles).
Two phases:
Constitution example:
Step 1: Generate initial responses:
Step 2: Self-critique with constitution:
Step 3: Revision based on critique:
Step 4: Fine-tune on revised responses:
Step 1: Generate comparison pairs:
Step 2: AI preference evaluation:
Step 3: Train preference model (reward model):
Step 4: RL training with RLAIF:
Enable reasoning transparency:
Use Constitutional AI when:
Principles:
Use alternatives instead:
Issue: Model refuses too much (evasive)
Add constitution principle:
Issue: Self-critiques are weak
Use stronger critique prompts:
Issue: Revisions don't improve quality
Iterate multiple times:
Issue: RLAIF preferences are noisy
Use multiple AI evaluators:
Constitution design: See references/constitution-design.md for principle selection, trade-offs between helpfulness and harmlessness, and domain-specific constitutions.
RLAIF vs RLHF: See references/rlaif-comparison.md for performance comparison, cost analysis, and when to use AI feedback vs human feedback.
Chain-of-thought reasoning: See references/cot-critique.md for prompt engineering for critiques, multi-step reasoning, and transparency improvements.
Compute requirements: