Все ведущие AI-модели провалили адский бенчмарк программирования от Meta
7 мая 2026 года Meta AI Research опубликовала сенсацию. ProgramBench — датасет для тестирования реальных инженерных способностей — дал результат, уже переопределяющий разговор об AI и программировании: каждая ведущая модель набрала ноль.
Не низкий балл. Не разочаровывающий. Абсолютный ноль в наиболее значимой категории: архитектурная реконструкция модулей.
Что такое ProgramBench?
ProgramBench не очередной LeetCode-клон. Исследователи Meta спроектировали его для измерения «Инженерного интеллекта» — способности понимать, рефакторить и восстанавливать ПО на уровне целых модулей.
Три уровня:
- Tier 1 — Function Completion: завершить тело функции. 78% у Claude, 74% у GPT-5.5
- Tier 2 — Module Reconstruction: восстановить недостающие реализации в многофайловой кодовой базе. 0% у всех
- Tier 3 — System Design Planning: архитектурное проектирование. 31% у Claude, 23% у GPT-5.5
Ноль, услышанный миром
| Уровень | GPT-5.5 | Claude Opus 4.7 | Gemini 2.5 Pro |
|---|---|---|---|
| Function Completion | 74% | 78% | 71% |
| Module Reconstruction | 0% | 0% | 0% |
| System Design Planning | 23% | 31% | 19% |
Задачи по модульной реконструкции не были экзотическими: rate-limited API-клиент с retry и circuit breaker, кеширующий слой с многоуровневой инвалидацией, event-sourced доменная модель.
Почему модели провалились так полностью?
Модели не выдавали синтаксических ошибок. Они выдавали правдоподобный, но архитектурно неверный код — код, который компилируется, работает и выглядит корректно, но нарушает фундаментальные инварианты дизайна.
Meta ввела полезное различие: модели обладают синтаксическим интеллектом (способность производить корректный код), но лишены архитектурного интеллекта (способность производить корректную систему).
Инженерный интеллект: новый фронтир
Термин «Инженерный интеллект» набирает обороты. Это не про написание рекурсивных функций — все модели с этим справляются годами. Это про:
- Понимание почему существует определенная абстракция
- Распознавание, когда изменение в одном модуле нарушит инварианты в другом
- Проектирование поддерживаемых, тестируемых и устойчивых систем
ProgramBench предполагает, что ни одна из сегодняшних моделей не обладает даже зачатками инженерного интеллекта. Они инструменты ускорения, но не могут рассуждать о ПО как о системе.
Для миллионов разработчиков: AI не приходит за вашей работой. Не за той частью, что требует мышления об архитектуре. Проектирование систем — не печатание кода. И ProgramBench доказал это самым строгим образом.