Gzip non è un'AI, ma fa il suo lavoro meglio di quanto pensi
·2 min·Medio
“
Uno sviluppatore ha scoperto che gzip, il vecchio algoritmo di compressione dei file che usi ogni giorno senza saperlo, riesce a fare cose che sembravano esclusive dei modelli linguistici sofisticati. La domanda sorge spontanea: cos'è veramente un language model?
In 30 secondi
01Gzip, algoritmo del 1992, batte BERT in alcuni test di classificazione testuale senza reti neurali.
02
→
💡
Cosa significa per te
Per una persona normale: significa che non sempre il tool più complicato o tecnologicamente avanzato è la risposta giusta. A volte un'idea semplice e vecchia risolve il problema meglio di algoritmi costosi e sofisticati — una lezione che vale sia nella tecnologia che nella vita.
Pensavi che mettere 'AI' accanto a un'azienda bastasse per far volare le sue azioni? Beh, il mercato ha riservato una sorpresa amara quest'anno.
·1 min·2·Base
Funziona rilevando anomalie: testo che si comprime poco è diverso dal contesto, testo che si comprime molto appartiene al contesto.
03Dimostra che soluzioni semplici spesso risolvono problemi meglio di modelli complessi con milioni di parametri.
La storia inizia in modo quasi comico. Nathan Habermann ha preso gzip — non uno strumento all'avanguardia, non un transformer addestrato su miliardi di parametri, ma letteralmente lo stesso algoritmo che comprime i tuoi PDF dal 2003 — e l'ha messo a confronto con modelli linguistici veri. Il risultato? In alcuni compiti di classificazione testuale, gzip non solo se la cavava, ma batteva persino BERT e altri modelli neural trendy.
Come funziona la cosa? Qui viene il bello. Gzip lavora comprimendo il testo: se una stringa si comprime molto dopo l'aggiunta di una nuova frase, significa che quella frase contiene poche informazioni nuove (probabilmente "appartiene" allo stesso contesto). Se invece la compressione non migliora molto, significa che la frase è diversa, inattesa, anomala. È una specie di rilevamento di anomalie rudimentale, ma incredibilmente efficace.
Questo esperimento non è una semplice curiosità di laboratorio — mette in discussione quello che crediamo di sapere sui modelli linguistici. Da anni sentiamo dire che servono milioni di parametri, addestramento su datacenter enormi, GPU costose. Ma gzip, con il suo approccio stupidamente semplice di compressione, dimostra che a volte la miglior soluzione non è la più complessa. È come scoprire che il tuo nonno che ripara tutto con duct tape sa risolvere i problemi meglio di un ingegnere con gli ultimi attrezzi costosi.
📬 Ti piace quello che leggi?
Ricevi le migliori notizie AI ogni settimana, direttamente in inbox.
Naturalmente, gzip non vincerà la Coppa del Mondo dell'AI. Per compiti complessi come la generazione di testo, i modelli neurali hanno ancora il monopolio. Ma questo esperimento illumina un punto fondamentale: le metriche con cui giudichiamo l'intelligenza artificiale potrebbero essere sbagliate, oppure stiamo usando strumenti eccessivamente complicati quando qualcosa di più basilare farebbe il lavoro altrettanto bene.
L'ironia? Gzip è stato scritto nel 1992. Se allora qualcuno avesse detto "tra 30 anni questo algoritmo farà quello che le reti neurali faranno", nessuno ci avrebbe creduto. Eppure eccoci qua, sorpresi dal fatto che una delle cose più semplici e vecchie del mondo digitale continua a sorprenderci. Forse dovremmo smettere di inseguire sempre la tecnologia più nuova e ricordare che l'eleganza spesso vince sulla potenza bruta.
Mentre il mondo tech discuteva di OpenAI, Anthropic ha piazzato la sua mossa. Hanno lanciato Opus 5, un modello che, dicono, quasi raggiunge il mitico Fable 5.