needhelp
← Back to blog

Все ведущие AI-модели провалили адский бенчмарк программирования от Meta

by needhelp
meta
programming
benchmark
ai-evaluation
software-engineering

7 мая 2026 года Meta AI Research опубликовала сенсацию. ProgramBench — датасет для тестирования реальных инженерных способностей — дал результат, уже переопределяющий разговор об AI и программировании: каждая ведущая модель набрала ноль.

Не низкий балл. Не разочаровывающий. Абсолютный ноль в наиболее значимой категории: архитектурная реконструкция модулей.

Что такое ProgramBench?

ProgramBench не очередной LeetCode-клон. Исследователи Meta спроектировали его для измерения «Инженерного интеллекта» — способности понимать, рефакторить и восстанавливать ПО на уровне целых модулей.

Три уровня:

  • Tier 1 — Function Completion: завершить тело функции. 78% у Claude, 74% у GPT-5.5
  • Tier 2 — Module Reconstruction: восстановить недостающие реализации в многофайловой кодовой базе. 0% у всех
  • Tier 3 — System Design Planning: архитектурное проектирование. 31% у Claude, 23% у GPT-5.5

Ноль, услышанный миром

Уровень GPT-5.5 Claude Opus 4.7 Gemini 2.5 Pro
Function Completion 74% 78% 71%
Module Reconstruction 0% 0% 0%
System Design Planning 23% 31% 19%

Задачи по модульной реконструкции не были экзотическими: rate-limited API-клиент с retry и circuit breaker, кеширующий слой с многоуровневой инвалидацией, event-sourced доменная модель.

Почему модели провалились так полностью?

Модели не выдавали синтаксических ошибок. Они выдавали правдоподобный, но архитектурно неверный код — код, который компилируется, работает и выглядит корректно, но нарушает фундаментальные инварианты дизайна.

Meta ввела полезное различие: модели обладают синтаксическим интеллектом (способность производить корректный код), но лишены архитектурного интеллекта (способность производить корректную систему).

Инженерный интеллект: новый фронтир

Термин «Инженерный интеллект» набирает обороты. Это не про написание рекурсивных функций — все модели с этим справляются годами. Это про:

  • Понимание почему существует определенная абстракция
  • Распознавание, когда изменение в одном модуле нарушит инварианты в другом
  • Проектирование поддерживаемых, тестируемых и устойчивых систем

ProgramBench предполагает, что ни одна из сегодняшних моделей не обладает даже зачатками инженерного интеллекта. Они инструменты ускорения, но не могут рассуждать о ПО как о системе.

Для миллионов разработчиков: AI не приходит за вашей работой. Не за той частью, что требует мышления об архитектуре. Проектирование систем — не печатание кода. И ProgramBench доказал это самым строгим образом.

Share this page