LLM Alignment and Post-Training

Parent: LLM Models and APIs · researched 2026-05-31T20:37:33.874Z· 18 sources · 11 concepts · skill ai-agent-engineering

AI & agent-engineering family ROUTER. Split into: ai-agents-orchestration (agent frameworks, multi-agent, memory, planning, guardrails, coding/GUI agents, autonomous loops, eval); ai-rag-retrieval (RA

ai-agent-engineering

Children

Frontier under this node: Alignment Evaluation (win-rate, LC-AlpacaEval, Arena-Hard, RewardBench, safety), Alignment Tooling (TRL, alignment-handbook, Axolotl, OpenRLHF), Constitutional AI / RLCAI, DPO (Direct Preference Optimization), DPO-Variant Family (IPO/KTO/ORPO/SimPO/CPO), Preference-Data Pipelines (pairwise/ratings, on/off-policy, iterative/self-rewarding), RLAIF (AI feedback), RLHF with PPO (KL penalty, value model), Reward Hacking / Length Bias / Over-Optimization, Reward Modeling (Bradley-Terry, RewardBench), Supervised Fine-Tuning / Instruction Tuning

← the whole tree · 3D view· how to read this page