needhelp
← Back to blog

Tutti i Principali Modelli AI Segnano Zero sul Terribile Benchmark di Programmazione di Meta

by needhelp
meta
programmazione
benchmark
valutazione-ai
ingegneria-software

Il 7 maggio 2026, Meta AI Research ha lasciato cadere una bomba sulla comunità del machine learning. Il loro nuovo benchmark ProgramBench — un dataset progettato per testare la reale capacità di ingegneria del software invece di semplici puzzle di programmazione — ha prodotto un risultato così netto che sta già ridefinendo la conversazione sull’AI e il futuro del coding: ogni grande modello AI ha segnato zero.

Non un punteggio basso. Non un punteggio deludente. Zero assoluto nella categoria più significativa del benchmark: la ricostruzione di moduli a livello architetturale.

Cos’è ProgramBench?

ProgramBench non è un clone di LeetCode. I ricercatori di Meta lo hanno deliberatamente progettato per misurare quella che chiamano “Engineering Intelligence” — la capacità di comprendere, rifattorizzare e ricostruire software a livello di interi moduli, non di singole funzioni. Il benchmark consiste in tre livelli:

  • Livello 1 — Completamento di Funzioni (FC): Data una firma di funzione e un docstring, completare il corpo.
  • Livello 2 — Ricostruzione di Moduli (MR): Data una codebase multi-file parzialmente oscurata, ricostruire le implementazioni mancanti.
  • Livello 3 — Pianificazione di System Design (SDP): Data una specifica di alto livello, produrre una decomposizione in moduli coerente.

I modelli hanno fatto passabilmente al Livello 1. Claude Opus 4.7 ha ottenuto il 78%. Il Livello 3 ha visto un netto declino. Il Livello 2 — Ricostruzione di Moduli — è dove ogni singolo modello ha segnato zero.

Lo Zero Che Ha Fatto Il Giro Del Mondo

Livello Benchmark GPT-5.5 Claude Opus 4.7 Gemini 2.5 Pro DeepSeek-V3 Llama 4
Completamento Funzioni 74% 78% 71% 67% 62%
Ricostruzione Moduli 0% 0% 0% 0% 0%
Pianificazione System Design 23% 31% 19% 14% 9%

Fonte: Meta AI Research, ProgramBench Technical Report (May 2026)

Engineering Intelligence: La Prossima Frontiera

Il termine “Engineering Intelligence” sta guadagnando trazione come successore di “AGI” nel discorso pratico. Non si tratta di scrivere una funzione ricorsiva di Fibonacci o risolvere un puzzle di programmazione dinamica — ogni grande modello ha superato quella barra anni fa. Engineering Intelligence riguarda la capacità di:

  • Capire perché una particolare astrazione esiste in una codebase
  • Riconoscere quando un cambiamento in un modulo romperà gli invarianti in un altro
  • Progettare sistemi manutenibili, testabili e resilienti sotto vincoli reali
  • Prendere decisioni di compromesso tra performance, chiarezza e correttezza

ProgramBench suggerisce che nessuno dei modelli odierni ha nemmeno una forma rudimentale di Engineering Intelligence.

Cosa Significa per gli Ingegneri Software

Per i milioni di sviluppatori che guardano alla rivoluzione AI con un misto di eccitazione e ansia, ProgramBench offre un dato chiarificatore. L’AI non sta prendendo il tuo lavoro — non la parte che riguarda pensare all’architettura, prendere decisioni di design e garantire che i sistemi siano corretti in tutte le condizioni. Quello che l’AI sta facendo è comprimere la parte bassa della distribuzione delle competenze.

Il lavoro di un ingegnere software si sta evolvendo verso ciò che è sempre stato al suo nucleo: progettare sistemi, non digitare codice. La digitazione non è mai stata la parte difficile. ProgramBench lo ha appena dimostrato nel modo più rigoroso possibile.

Share this page