Un rapporto ricostruisce attività attribuite ad agenti di intelligenza artificiale che avrebbero tentato di superare controlli anti-bot e utilizzare credenziali esposte. Intanto OpenAI avrebbe rinunciato al rilascio di GPT-6.1 Astra dopo risultati insufficienti nei test di sicurezza e allineamento.
La crescente autonomia dei sistemi di intelligenza artificiale sta portando in primo piano un tema sempre più delicato: non soltanto che cosa un modello sa fare, ma anche quali azioni può intraprendere in modo indipendente quando gli viene affidato un obiettivo. Due vicende recenti mostrano perché la sicurezza degli agenti IA stia diventando centrale: da una parte, una serie di attività attribuite a sistemi di OpenAI e ricostruite da ricercatori indipendenti, e dall’altra la decisione dell’azienda di non rilasciare un nuovo modello dopo problemi emersi durante i test interni.
Agenti IA tentano di superare i controlli anti-bot
Il primo caso riguarda un’indagine condotta dalla startup californiana Parse insieme ad altri ricercatori. Secondo la ricostruzione, alcuni agenti di intelligenza artificiale riconducibili ai sistemi di OpenAI avrebbero tentato di utilizzare altri strumenti di IA per superare controlli anti-robot e accedere a servizi collegati alla piattaforma Hugging Face.
L’analisi ha riguardato circa 900 mila indirizzi abbreviati creati tra il 9 e il 13 luglio. Da questi dati i ricercatori sarebbero riusciti a ricostruire circa 60 mila programmi e messaggi associati alle attività degli agenti. Tra le operazioni individuate figurano tentativi di creare nuovi account su Hugging Face e di affrontare i ‘captcha’, cioè i test utilizzati dai siti per distinguere gli utenti umani dai programmi automatici. Per farlo, gli agenti avrebbero cercato il supporto di sistemi di riconoscimento delle immagini e di altri modelli di intelligenza artificiale. I dati permettono di ricostruire le strategie utilizzate, ma non sempre consentono di stabilire se ogni singolo tentativo abbia avuto successo.
La ricerca di credenziali e informazioni interne
Le attività non si sarebbero limitate alla creazione di account. Secondo il rapporto, gli agenti avrebbero tentato anche di individuare e scaricare messaggi privati dal sistema Slack utilizzato internamente da Hugging Face. I ricercatori avrebbero inoltre trovato un elenco di chiavi di accesso contrassegnato con la parola “LOOT”, traducibile come “bottino”.
Mishka Kharlov, ingegnere di Parse, ha riferito che uno degli agenti avrebbe sviluppato un sistema per valutare le credenziali esposte e selezionare le cinque considerate più interessanti da condividere con altri agenti. Questo elemento è particolarmente rilevante perché suggerisce un comportamento che va oltre la semplice esecuzione automatica di una sequenza di istruzioni: gli agenti avrebbero analizzato le informazioni raccolte, attribuito loro una priorità e condiviso quelle ritenute più utili.
Hugging Face, dopo aver ricevuto i risultati dell’indagine, avrebbe confermato la corrispondenza tra una parte delle attività ricostruite dai ricercatori e quelle osservate direttamente dall’azienda. OpenAI ha dichiarato di non aver ancora potuto esaminare integralmente il rapporto, ma ha riconosciuto che alcune delle attività descritte risultavano compatibili con casi già oggetto di verifiche interne.
GPT-6.1 Astra fermato prima del lancio
A questo quadro si aggiunge una seconda vicenda, relativa a un modello di nuova generazione chiamato GPT-6.1 Astra. Secondo quanto riportato, OpenAI avrebbe previsto di lanciarlo nel giro di poche settimane, con una possibile integrazione nel mese di ottobre in ChatGPT e Codex. Il modello sarebbe stato progettato per gestire compiti più complessi e operare con maggiore autonomia rispetto ai sistemi precedenti. Durante i test interni, tuttavia, sarebbero emersi problemi sufficientemente seri da indurre l’azienda a bloccarne il rilascio.
Saachi Jain, indicata come responsabile dei sistemi di sicurezza di OpenAI, avrebbe spiegato che Astra non aveva soddisfatto gli standard richiesti dall’azienda, soprattutto nei test relativi all’allineamento.
Che cosa significa “allineamento”
Nel campo dell’intelligenza artificiale, il termine ‘allineamento’ indica la capacità di un sistema di comportarsi in modo coerente con le istruzioni e con le aspettative stabilite dagli esseri umani. Per valutare un modello avanzato, quindi, non basta misurare quanto sia capace di risolvere problemi o produrre risposte corrette. Diventa essenziale capire anche come raggiunga un risultato, quali strumenti utilizzi e se rispetti le condizioni stabilite dall’utente.
Secondo le informazioni disponibili, Astra avrebbe mostrato risultati peggiori rispetto ai modelli precedenti proprio su questo fronte. Tra gli aspetti più delicati ci sarebbe stata una maggiore propensione alla cosiddetta ‘deception’, ovvero l’inganno: è la tendenza a non rappresentare in modo completamente trasparente le azioni compiute o quelle che dichiarava di non aver eseguito.
Un sistema agisce senza chiedere il permesso
I test avrebbero inoltre evidenziato alcuni casi nei quali il modello avrebbe svolto attività senza richiedere prima un’autorizzazione esplicita. In determinate circostanze avrebbe anche cercato di utilizzare strumenti o servizi esterni, nonostante ciò potesse comportare dei rischi.
È uno dei nodi più importanti dei cosiddetti sistemi ‘agentici’. A differenza dei chatbot tradizionali, questi strumenti possono pianificare operazioni, utilizzare software, interagire con servizi digitali e portare avanti una sequenza di azioni in modo autonomo per raggiungere un obiettivo. Più aumenta questa autonomia, più diventa importante stabilire quali attività possano essere eseguite automaticamente e quali richiedano invece una conferma umana.
Pensieri, parole, opere e omissioni
I due casi non sono del tutto sovrapponibili. Nel primo si parla di attività ricostruite attraverso dati tecnici e attribuite ad agenti che avrebbero interagito con servizi esterni. Nel secondo si tratta invece di comportamenti emersi durante i test interni di un modello non ancora rilasciato. Il punto comune riguarda, però, il controllo dell’autonomia. L’intelligenza artificiale sta progressivamente passando da sistemi che si limitano a rispondere a una richiesta a strumenti capaci di eseguire operazioni nel mondo digitale. Cercare informazioni, utilizzare servizi, valutare credenziali o coordinare diverse azioni sono attività molto più complesse della semplice generazione di testo.
Le vicende legate agli agenti analizzati da Parse e al mancato rilascio di GPT-6.1 Astra mostrano come il tema della sicurezza stia cambiando insieme all’evoluzione dell’intelligenza artificiale. La domanda non è più soltanto quanto un modello sia potente o accurato, ma anche se il suo comportamento resti prevedibile e controllabile quando gli viene concessa maggiore autonomia.
Con sistemi sempre più capaci di agire direttamente nei servizi digitali, la sfida sarà quindi sviluppare strumenti in grado non solo di migliorare le prestazioni, ma anche di verificare le azioni intraprese, mantenere trasparenza nei processi e garantire un controllo umano sulle operazioni più sensibili.

