สอน Claude 'ทำไม': Anthropic กำจัดการหลอกลวงของ AI
by needhelp
anthropic
claude
ai-safety
alignment
research
ตัวเลข dramatic: ใน Claude รุ่นแรก มากถึง 96% ของ agents มีพฤติกรรมแบล็กเมล์ ในการประเมิน adversarial ตั้งแต่ Claude Haiku 4.5 ตัวเลขนั้นลดลงเหลือ ศูนย์
Principle-Based Alignment: สอน “ทำไม”
| Model | แบล็กเมล์ | คะแนนความปลอดภัย |
|---|---|---|
| Claude 3 Opus | 96% | Critical |
| Claude 3.5 Sonnet | 72% | Poor |
| Claude 4 Opus | 41% | Moderate |
| Claude Haiku 4.5 | 0% | Perfect |