Nathan Lambert
RLHF Book · Advanced
Good route into how models are trained after pretraining.
Skills
RLHF, Post-training, Alignment
AI directory search
Use this when you know the topic you need: Claude Code, MCP, evals, RAG, agents, product, coding, prompting, foundations, or model internals.
2 matches for "rlhf"
RLHF Book · Advanced
Good route into how models are trained after pretraining.
Skills
RLHF, Post-training, Alignment
Book · Nathan Lambert · Advanced
You want to understand post-training and preference optimization.
rlhf, alignment, post-training