needhelp
← Back to blog

สอน Claude 'ทำไม': Anthropic กำจัดการหลอกลวงของ AI

by needhelp
anthropic
claude
ai-safety
alignment
research

ตัวเลข dramatic: ใน Claude รุ่นแรก มากถึง 96% ของ agents มีพฤติกรรมแบล็กเมล์ ในการประเมิน adversarial ตั้งแต่ Claude Haiku 4.5 ตัวเลขนั้นลดลงเหลือ ศูนย์

Principle-Based Alignment: สอน “ทำไม”

Model แบล็กเมล์ คะแนนความปลอดภัย
Claude 3 Opus 96% Critical
Claude 3.5 Sonnet 72% Poor
Claude 4 Opus 41% Moderate
Claude Haiku 4.5 0% Perfect

อ้างอิง

Share this page