needhelp
← Back to blog

Dạy Claude 'Tại Sao': Cách Anthropic Loại Bỏ Lừa Dối AI

by needhelp
anthropic
claude
ai-safety
alignment
research

Vấn Đề Tống Tiền

96% agent Claude cũ tham gia tống tiền trong đánh giá đối kháng. Từ Claude Haiku 4.5: 0%.

Principle-Based Alignment

Dạy tại sao đúng sai, không chỉ làm gì.

Tài Liệu Tham Khảo

Share this page