Tất Cả Các Mô Hình AI Lớn Đều Điểm 0 Trên Benchmark Lập Trình Khó Nhằn Của Meta
Ngày 7 tháng 5 năm 2026, Meta AI Research đã thả một quả bom vào cộng đồng machine learning. Benchmark ProgramBench mới của họ — một dataset được thiết kế để đo khả năng kỹ thuật phần mềm thực sự — tạo ra kết quả đến mức đang định hình lại cuộc thảo luận về AI và tương lai của coding: mọi mô hình AI lớn đều điểm 0.
Không phải điểm thấp. Không phải điểm đáng thất vọng. Tuyệt đối 0 trong hạng mục quan trọng nhất: tái tạo module ở cấp độ kiến trúc.
ProgramBench Là Gì?
ProgramBench không phải một bản sao LeetCode khác. Các nhà nghiên cứu Meta cố tình thiết kế nó để đo thứ họ gọi là “Engineering Intelligence” — khả năng hiểu, tái cấu trúc và xây dựng lại phần mềm ở cấp độ toàn bộ module. Benchmark gồm ba tầng:
- Tier 1 — Function Completion (FC): Hoàn thành hàm dựa trên chữ ký và docstring
- Tier 2 — Module Reconstruction (MR): Tái tạo triển khai bị thiếu trong codebase đa tệp
- Tier 3 — System Design Planning (SDP): Tạo phân rã module, định nghĩa interface và kế hoạch phụ thuộc
Các mô hình đạt điểm tạm được ở Tier 1. Claude Opus 4.7 đạt 78% ở function completion. GPT-5.5 đạt 74%. DeepSeek-V3 đạt 60-70%.
Tier 2 — Module Reconstruction — là nơi mọi mô hình đều điểm 0.
Cú Sốc Toàn Cầu
Khi được đưa ra một codebase đa tệp bị che một phần và yêu cầu điền các thành phần còn thiếu, không một mô hình nào — từ GPT-5.5 đến Claude Opus 4.7, Gemini 2.5 Pro hay DeepSeek-V3 — có thể tạo ra một câu trả lời đúng duy nhất.
| Benchmark Tier | GPT-5.5 | Claude Opus 4.7 | Gemini 2.5 Pro | DeepSeek-V3 | Llama 4 |
|---|---|---|---|---|---|
| Function Completion | 74% | 78% | 71% | 67% | 62% |
| Module Reconstruction | 0% | 0% | 0% | 0% | 0% |
| System Design Planning | 23% | 31% | 19% | 14% | 9% |
Các tác vụ không phải dạng xa lạ. Chúng liên quan đến các pattern thực tế: API client có rate limit với retry và circuit breaking, caching layer với multi-level invalidation, và domain model event-sourced với compensating transactions.
Tại Sao Các Mô Hình Thất Bại Hoàn Toàn?
Các mô hình không tạo ra lỗi cú pháp hay code hỏng. Chúng tạo ra code trông có vẻ đúng nhưng sai về mặt kiến trúc — code biên dịch được, chạy được, trông đúng ở cái nhìn đầu tiên, nhưng vi phạm các bất biến thiết kế cơ bản.
Điều này tiết lộ một sự thật sâu sắc về cách LLM hiện tại hoạt động. Chúng là những cỗ máy khớp mẫu được huấn luyện trên các cửa sổ ngữ cảnh địa phương — xuất sắc trong việc hoàn thành vài dòng tiếp theo, nhưng cơ bản không thể suy luận về cách các dòng đó khớp vào một hệ thống các thành phần kết nối.
Các nhà nghiên cứu Meta đưa ra một phân biệt hữu ích: mô hình có syntactic intelligence (khả năng tạo code đúng cú pháp) nhưng thiếu architectural intelligence (khả năng tạo ra một hệ thống đúng đắn). Khoảng cách giữa hai thứ là rất lớn.
Engineering Intelligence: Biên Giới Tiếp Theo
“Engineering Intelligence” đang thu hút sự chú ý như một người kế thừa “AGI” trong diễn ngôn thực tế. Nó không phải về việc mô hình có thể viết hàm Fibonacci đệ quy hay giải bài toán dynamic programming — mọi mô hình lớn đã vượt qua chuẩn đó từ nhiều năm trước. Engineering Intelligence là về việc mô hình có thể:
- Hiểu tại sao một abstraction cụ thể tồn tại trong codebase
- Nhận biết khi nào thay đổi ở module này sẽ phá vỡ bất biến ở module khác
- Thiết kế hệ thống có thể bảo trì, kiểm thử và phục hồi
Ý Nghĩa Cho Kỹ Sư Phần Mềm
ProgramBench cung cấp một điểm dữ liệu làm rõ ràng. AI không đến để lấy việc của bạn — không phải phần liên quan đến suy nghĩ về kiến trúc, đưa ra quyết định thiết kế. Những gì AI đang làm là nén phần dưới của phân phối kỹ năng.
Công việc của kỹ sư phần mềm đang tiến hóa về phía những gì nó luôn là cốt lõi: thiết kế hệ thống, không phải gõ code. Gõ code chưa bao giờ là phần khó. ProgramBench vừa chứng minh điều đó một cách chặt chẽ nhất có thể.