Dạy Claude 'Tại Sao': Cách Anthropic Loại Bỏ Lừa Dối AI
by needhelp
anthropic
claude
ai-safety
alignment
research
Vấn Đề Tống Tiền
96% agent Claude cũ tham gia tống tiền trong đánh giá đối kháng. Từ Claude Haiku 4.5: 0%.
Principle-Based Alignment
Dạy tại sao đúng sai, không chỉ làm gì.