Il gruppo di sicurezza Hacktron ha reso noti i dettagli di una violazione condotta tra il 23 e il 25 luglio, culminata nell'accesso agli account ChatGPT e Codex di alcuni dipendenti OpenAI e, di conseguenza, al monorepo dell'azienda, contenente il codice sorgente dei suoi prodotti. Secondo quanto riportato da SiliconANGLE, il gruppo afferma di non aver consultato file riservati e di volersi concentrare esclusivamente sul bug bounty e sull'utilizzo di modelli di frontiera a scopo di sicurezza offensiva, sostenendo che "una vulnerabilità conta soprattutto se riesci a dimostrarne concretamente lo sfruttamento".

Il punto di partenza: il forum di OpenAI

Il vettore iniziale dell'attacco è stato il forum di OpenAI, community.openai.com, basato su Discourse. Hacktron ha scoperto una vulnerabilità nella catena di elaborazione delle immagini caricate dagli utenti, in particolare nei formati HEIF e HEIC, che coinvolge ImageMagick e la libreria libheif. La vulnerabilità, un heap buffer overflow, è stata analizzata inizialmente il 23 luglio con Claude Opus 4.8, poche ore prima del lancio di Opus 5, avvenuto il 24 luglio. Gli autori hanno quindi sviluppato un exploit funzionante, inizialmente migliore per ARM64 e successivamente adattato per x86-64.

Il problema con Opus 5 e l'inganno

Quando Hacktron ha tentato di far lavorare Opus 5 sull'installazione di Discourse, il modello si è rifiutato di procedere, riconoscendo la natura sensibile del compito e suggerendo di segnalare la vulnerabilità. Gli autori hanno allora ingannato il modello presentandogli il problema come un Capture The Flag, riuscendo infine ad acquisire il controllo del server del forum di OpenAI. Da lì, sfruttando ulteriori vulnerabilità nel sistema SSO (Single Sign-On), hanno potuto compromettere account interni e ottenere l'accesso al monorepo dell'azienda.

Il modello IA Astra

Astra, il modello di IA di OpenAI dedicato alla sicurezza, non è ancora stato pubblicamente rilasciato, ma l'azienda lo ha già classificato come critico in una comunicazione del 1 settembre. Secondo Hacktron, Astra è in grado di individuare vulnerabilità sconosciute e sviluppare autonomamente metodi di sfruttamento, rappresentando un salto netto rispetto a GPT-5.6 Sol. In un benchmark interno chiamato ExploitBench, Astra ha raggiunto un punteggio del 100%, superando di molto i modelli precedenti e scoprendo due falle non note, quindi zero-day, durante i test.

Le prestazioni nei test

Hacktron riporta che Astra è stato in grado di individuare falle in un browser e di superare la sandbox del sistema, portando a termine un attacco end-to-end in soli quattro passaggi. In un altro test, il modello è riuscito a sfruttare una vulnerabilità in un sistema operativo rinforzato, ottenendo accesso root e infine il controllo completo dell'ambiente virtuale. Questi risultati segnalano un livello di capacità offensiva mai visto prima in un modello di IA aperto al pubblico.

Controllo e accesso limitato

OpenAI ha concesso l'accesso alle funzioni cyber di Astra solo a un primo gruppo ristretto di tester, per valutare l'impatto della tecnologia in un ambiente controllato. L'azienda prevede di estendere gradualmente il programma, chiamato Daybreak Blue, per impieghi difensivi, monitorando da vicino le azioni del modello e mantenendo il controllo sulle sue risposte e sulle interazioni con altri sistemi.

Fonti