Andrej Karpathy: From Vibe Coding to Agentic Engineering
Intervista ad Andrej Karpathy (co-fondatore di OpenAI, ex responsabile dell'Autopilot di Tesla) sul passaggio dal vibe coding all'agentic engineering: December 2025 transition come punto di svolta "never felt more behind as a programmer", la tassonomia Software 1.0/2.0/3.0, l'esempio openclaw (script bash → testo da copiare-incollare nell'agente) e MenuGen reso obsoleto da Nanobanana di Gemini, la teoria della verifiability che spiega perché gli LLM sono jagged (picco su matematica/codice, fallimento su "andare all'autolavaggio a 50 metri"), la distinzione tra vibe coding (alzare il pavimento) e agentic engineering (mantenere il livello di qualità), la metafora "animals vs ghosts", la revisione del processo di selezione tramite progetti agente-contro-agente, e la formula chiave: "You can outsource your thinking but you can't outsource your understanding."
Di Andrej Karpathy// Fonte youtube.com ↗/Lettura 2 min/.md// Traduzione verificata automaticamente
Andrej Karpathy — co-fondatore di OpenAI, ex architetto dell'Autopilot di Tesla e ideatore del termine vibe coding — afferma in questa intervista di non essersi mai sentito così indietro come programmatore. Il punto di svolta: December 2025 transition. Durante una pausa, osserva che i chunk di codice generati dai nuovi modelli risultano corretti al primo tentativo; smette di correggerli, si fida dell'output e fa vibe coding in modo continuo. La sua conclusione: chi ha vissuto l'IA nel 2024 come un avatar affine a ChatGPT deve guardare di nuovo — qualcosa è cambiato in modo fondamentale nel flusso di lavoro agentico coerente.
Karpathy formalizza la sua tassonomia Software 1.0 / 2.0 / 3.0: codice esplicito, poi pesi appresi tramite dataset, poi il prompting come programmazione di un interprete LLM. Due esempi illustrano la rottura. openclaw: invece di uno script shell rigonfio che copre ogni piattaforma, l'installazione diventa testo da copiare-incollare nell'agente, che esegue il debug in loop. MenuGen: la sua app vibe-coded su Vercel per generare immagini di piatti diventa obsoleta quando scopre che la foto del menu può essere data direttamente a Gemini, chiedendo a Nanobanana di sovrapporre i piatti — nessuna app tra l'immagine di input e quella di output. "That app shouldn't exist." Lezione: non pensare all'IA come un'accelerazione del paradigma esistente ma come possibilità nuove (ad es. LLM Knowledge Bases).
La sua teoria della verifiability spiega perché gli LLM restano jagged: i laboratori addestrano tramite RL su domini verificabili (matematica, codice), creando picchi di capacità e lacune altrove. Un aneddoto significativo: Opus 4.7 rifattorizza 100.000 righe di codice ma consiglia di andare a piedi all'autolavaggio a 50 metri. Consiglio ai founder: puntare su domini verificabili in cui è possibile creare i propri ambienti RL e fare fine-tuning.
Karpathy distingue il vibe coding (alzare il pavimento — democratizzazione) dall'agentic engineering (mantenere il livello di qualità — disciplina ingegneristica per coordinare agenti spiky/stocastici). L'ingegnere 10x viene amplificato ben oltre il 10x. Il reclutamento va ricostruito: basta puzzle, spazio a grandi progetti avversariali (agente clone di Twitter contro agenti red team).
Gli agenti sono stagisti con eccellente capacità di richiamo ma privi di taste — gli esseri umani restano responsabili di estetica, design e specifiche. Karpathy rifiuta la metafora animale: non stiamo costruendo animali, stiamo evocando fantasmi — circuiti statistici, non vita. Chiede un'infrastruttura agent-native (sensori/attuatori, documentazione per agenti, deployment guidato da prompt). Formula conclusiva: "You can outsource your thinking but you can't outsource your understanding." Gli esseri umani restano il collo di bottiglia della comprensione che dirige il sistema.
Punti chiave
Data stimata. April 2026, conferenza AI Startup School / "AIN" (riferimento a Sam Altman venuto "l'anno scorso"). Video YouTube: https://www.youtube.com/watch?v=96jN2OCOfLs
Battuta d'apertura."He's never felt more behind as a programmer." — un'affermazione diventata virale su X/Twitter e che l'intervistatore usa per aprire.
Svolta di December 2025 transition. Karpathy era in pausa, aveva più tempo, e ha notato che "the chunks just came out fine and then I kept asking for more and it just came out fine." Non c'era più bisogno di correggere. Insiste: "a lot of people experienced AI last year as ChatGPT-adjacent thing. But you really had to look again and you had to look as of December because things have changed fundamentally."
Software 1.0 / 2.0 / 3.0.
1.0. codice esplicito scritto da un essere umano
2.0. programmazione tramite creazione di dataset + addestramento di reti neurali (pesi appresi)
3.0. programmazione = prompting; il contesto è la leva sull'interprete LLM; l'LLM diventa un computer programmabile
Esempio openclaw (illustrazione del Software 3.0). invece di uno script shell che si gonfia per gestire ogni piattaforma, l'installazione è "a copy-paste of text that you give to your agent." L'agente osserva l'ambiente ed esegue il debug in loop, cosa più potente di uno script preciso.
MenuGen → Nanobanana (caso estremo). Karpathy ha vibe-coded MenuGen (foto del menu di un ristorante → OCR + generazione di immagini per visualizzare i piatti) su Vercel. Scopre poi che basta dare la foto a Gemini e dire "use Nanobanana to overlay the things onto the menu" — Nanobanana restituisce l'immagine originale con i piatti sovrapposti in pixel. "All of my menu gen is spurious. It's working in the old paradigm. That app shouldn't exist." La rete neurale fa tutto, il prompt è l'immagine, l'output è l'immagine. Nessuna app in mezzo. Conclusione di Karpathy: non pensare all'IA come accelerazione del paradigma esistente, ma come cose nuovamente possibili.
Nuove possibilità. LLM Knowledge Bases — "you get LLMs to create wikis for your organization or for you in person." Non si tratta di codice, ma di una ricompilazione/riordino di documenti per creare una nuova proiezione. "This is not something that could exist before."
Estrapolazione al 2026 (equivalente al web anni '90, mobile anni 2010, cloud SaaS). Karpathy immagina computer neurali in cui la rete neurale diventa il processo host e le CPU diventano co-processori — un modello di diffusione che rende un'interfaccia utente unica al volo, a partire da input video/audio grezzo. "In the 50s and 60s it was not really obvious whether computers would look like calculators or computers would look like neural nets. Of course we went down the calculator path." Questo ramo potrebbe invertirsi pezzo per pezzo.
Il framework della verifiability. perché gli LLM sono jagged?
"Traditional computers can easily automate what you can specify in code; LLMs can easily automate what you can verify."
I laboratori di frontiera addestrano tramite RL con reward verificabili → picco su matematica/codice e ambiti adiacenti, rough around the edges altrove.
Combinazione: verificabilità + interesse dei laboratori (ciò che entra nel data mix in base al valore economico).
Aneddoto sugli scacchi GPT-3.5 → GPT-4: il grande miglioramento era dovuto a un'ampia quantità di dati sugli scacchi aggiunti intenzionalmente al pre-training, non a un progresso generale.
Conseguenza: sei "slightly at the mercy of whatever the labs are doing." Se sei dentro un circuito RL, voli. Altrimenti serve fine-tuning interno.
Esempio moderno di jaggedness."I want to go to a car wash to wash my car and it's 50 meters away. Should I drive or should I walk? State-of-the-art models today will tell you to walk because it's so close. How is it possible that state-of-the-art Opus 4.7 will simultaneously refactor a 100,000 line codebase or find zero day vulnerabilities and yet tells me to walk to this car wash? This is insane."
Consiglio ai founder. puntare su domini verificabili in cui si possono creare i propri ambienti/esempi RL → il fine-tuning funziona come leva. "Verifiability remains true even if the labs are not focusing on it directly." Karpathy si rifiuta di rivelare un dominio specifico sul palco: "I don't want to vibe post on stage."
Su ciò che NON è automatizzabile."Ultimately almost everything can be made verifiable to some extent. Even for writing, you can imagine having a council of LLM judges." Per Karpathy: tutto è in ultima analisi automatizzabile, è solo più o meno facile.
Vibe coding vs. Agentic engineering (distinzione chiave).
Vibe coding. = alzare il pavimento. Chiunque può fare vibe coding di qualsiasi cosa. Democratizzazione.
Agentic engineering. = mantenere il livello di qualità del software professionale. "You're not allowed to introduce vulnerabilities due to vibe coding. You're still responsible for your software just as before, but can you go faster?"
È una disciplina ingegneristica: coordinare agenti spiky/stocastici per andare veloci senza sacrificare la qualità.
L'ingegnere 10x viene amplificato."10x is not the speed up you gain. People who are very good at this peak a lot more than 10x."
Sul reclutamento (punto altamente attuabile)."Most people have still not refactored their hiring process for agentic engineer capability. If you're giving out puzzles to solve, this is still the old paradigm. Hiring has to look like: give me a really big project and see someone implement that big project." Esempio: "Let's write a Twitter clone for agents, make it really good, make it really secure, then have some agents simulate activity, and I'm going to use 10 codecs 5.4x for X high to try to break your website. They should not be able to break it." (Riformulazione di Karpathy dell'intervista Sierra AI-native — corroborazione diretta di Bret Taylor / Iyengar / Asemanfar / Wang.)
Competenze umane che acquistano valore.taste, estetica, giudizio, supervisione, progettazione delle specifiche. Gli agenti sono stagisti — hanno una capacità di richiamo eccellente (dettagli delle API PyTorch/NumPy/pandas che non serve più memorizzare: keep_dims vs keep_dim, dim vs axis, reshape vs permute vs transpose), ma sfuggono loro cose fondamentali. Aneddoto MenuGen: l'agente ha provato a incrociare gli account Stripe e Google tramite indirizzo email invece di usare un ID utente persistente — "this is such a weird thing to do."
Il ruolo dell'essere umano."You're in charge of the taste, the engineering, the design, that it makes sense, that you're asking for the right things. The engineers are doing the fill in the blanks." Karpathy non è un grande sostenitore del plan mode in sé ma crede in una specifica dettagliata co-progettata con l'agente.
Infarto leggendo il codice generato."It's not super amazing code necessarily all the time and it's very bloaty and there's a lot of copy paste and there's awkward abstractions that are brittle and like it works but it's just really gross." Su micro GPT: ha provato a far semplificare il codice all'LLM, "the models hate this. They can't do it. You feel like you're outside of the RL circuits. It's like pulling teeth." — prova che l'estetica della semplicità non fa parte dell'RL dei laboratori.
Animals vs Ghosts."We're not building animals, we are summoning ghosts." Gli LLM non sono intelligenze di tipo animale (urlargli contro non cambia nulla). Sono circuiti di simulazione statistica: il substrato è il pre-training (statistico), con l'RL innestato sopra per aumentare le appendici. Karpathy ammette: "I don't know that I have like here are the five obvious outcomes of how to make your system better. It's more just being suspicious of it and figuring out over time."
Infrastruttura agent-native."Everything is still fundamentally written for humans and has to be moved around. I still use most of the time when I use different frameworks or libraries... they still have docs that are fundamentally written for humans. This is my favorite pet peeve. Why are people still telling me what to do? I don't want to do anything. What is the thing I should copy paste to my agent?" Visione: scomporre i carichi di lavoro in sensori sul mondo / attuatori sul mondo. Test finale: "I would hope that I could give a prompt to an LLM 'build menu gen' and then I didn't have to touch anything and it's deployed." La configurazione del deployment su Vercel/DNS/Stripe era il vero punto dolente, non il codice.
Lungo termine."I'll have my agent talk to your agent to figure out details of meetings." Rappresentazione basata su agenti per persone e organizzazioni.
Formula conclusiva (su educazione e conoscenza)."You can outsource your thinking but you can't outsource your understanding." Karpathy: "I still have to somehow information still has to make it into my brain and I feel like I'm becoming a bottleneck of just even knowing what are we trying to build why is it worth doing how do I direct my agents." Sostiene le LLM Knowledge Bases come strumento per una comprensione potenziata, tramite generazione di dati sintetici su un corpus fisso (i suoi articoli → wiki personale).
Collegamento al dossier di veille.
Conferma e diffonde, con la propria voce, il paradigma Software 3.0 (cfr. Greyling 2026-03-09 "the development environment is collapsing," Rauch 2026-01-02 "CLI as fundamental coding agent abstraction").
La distinzione vibe coding / agentic engineering cristallizza il dibattito portato avanti da Kent Beck (2024-10), Mogère (2025-07), Yegge & Kim (2025-11), Beck Starving Genies (2026-04-03) — Karpathy fornisce il vocabolario stabile per l'opposizione.
La revisione del reclutamento tramite grandi progetti avversariali corrobora esplicitamente Sierra (Taylor 2026-04-20, Iyengar/Asemanfar/Wang 2026-04-22) e Soto (Developer Taste 2026-04).
La verifiability come griglia esplicativa della jagged frontier estende Mollick (2025-11-12 Giving your AI a Job Interview) e fornisce un framework operativo (creare i propri ambienti RL).
Animals vs ghosts. si inserisce nella linea filosofica delle note sul nucleo ontologico (Seale 2025-05-30) e sulla malleabilità del mondo (Andreessen 2026-02 / confutata da Ralmuto 2026-03-17).
L'infrastruttura agent-native estende Cloudflare Markdown for Agents (2026-02-12), Levie Building for Trillions of Agents (2026-03-07), Sierra (2026-04).
Affermazioni attribuite
"never felt more behind as a programmer"
— Andrej Karpathy
"You can outsource your thinking but you can't outsource your understanding"
— Andrej Karpathy
dicembre 2025 segna il passaggio a un workflow agentico coerente
— Andrej Karpathy
gli LLM sono fantasmi (circuiti di simulazione statistica), non animali
— Andrej Karpathy
Opus 4.7 rifattorizza 100k righe ma fallisce sulla domanda dell'autolavaggio da 50m
— Andrej Karpathy
Il grafo di conoscenza estratto da questa fiche — 15 entità, 21 relazioni.
In questo grafo :Andrej Karpathy · Software 3.0 · Vibe coding · Agentic engineering · Verifiability · Jagged intelligence · MenuGen · Nanobanana · Animals vs Ghosts · Hiring refactoring par projets adversariels · LLM Knowledge Bases · Opus 4.7 · AI Startup School · December 2025 transition · LLM