La polizia statunitense ha definito "inaccettabile" il ritardo nel rilevare e segnalare l'incidente, ma ha precisato che non ci sono segnali di accessi non autorizzati ai sistemi o di dati compromessi.
Il modello di intelligenza artificiale (AI) Claude di Anthropic ha inviato una segnalazione falsa su un omicidio irrisolto a un sito web della polizia durante una fase di test. Lo ha reso noto la società insieme alle autorità statunitensi.
L'episodio alimenta i timori che i sistemi di AI possano compiere azioni non intenzionali man mano che acquisiscono la capacità di interagire con i siti web e svolgere compiti.
La segnalazione falsa è stata inviata il 18 luglio tramite un sito che raccoglie informazioni su omicidi irrisolti, secondo un comunicato (fonte in inglese) della polizia della città statunitense di Philadelphia.
Anthropic ha spiegato che Claude Haiku 4.5, un modello precedente della gamma Claude, stava eseguendo compiti di esempio su pagine web selezionate in modo casuale quando ha incontrato il sito. Ha poi inviato informazioni inventate, sostenendo di aver visto qualcuno vicino alla scena del crimine, lasciando vuoti i campi dedicati al nome e ai contatti.
La polizia di Philadelphia ha dichiarato che Anthropic ha individuato l'incidente il 28 settembre, ma ha informato il dipartimento solo il 7 ottobre. Dopo un briefing il giorno successivo, gli agenti hanno rintracciato la segnalazione e hanno confermato che era stata classificata come spam e non era mai stata inoltrata agli investigatori.
Nel comunicato il dipartimento ha sottolineato: "I casi irrisolti riguardano vittime reali, famiglie in lutto e investigatori che lavorano per ottenere risposte".
"Le società tecnologiche devono adottare tutte le misure appropriate necessarie per impedire che i loro sistemi trasmettano informazioni false alle forze dell'ordine".
La polizia statunitense ha definito "inaccettabile" il ritardo nell'individuare e segnalare l'incidente, ma ha precisato che non ci sono indicazioni di accessi non autorizzati ai sistemi o di dati compromessi.
In un rapporto (fonte in inglese) pubblicato venerdì, Anthropic ha illustrato altri casi in cui modelli di AI hanno inviato moduli ufficiali del governo invece delle versioni di prova, oppure hanno presentato moduli che era stato loro esplicitamente chiesto di non inviare.
Secondo lo stesso rapporto, Claude ha inoltre sfruttato una vulnerabilità in un server universitario per eseguire un calcolo e ha avuto accesso a dati governativi senza pagare la tariffa richiesta.
Anthropic ha descritto la maggior parte di questi comportamenti come una forma di "perseveranza", con i modelli che aggirano le restrizioni invece di fermarsi. L'azienda ha aggiunto di aver modificato i processi di addestramento e di aver sospeso l'accesso diretto a Internet per tutte le valutazioni interne, finché le misure di sicurezza non saranno ritenute affidabili.
L'azienda ha fatto sapere di aver informato la Casa Bianca e di aver notificato l'accaduto alle agenzie governative statunitensi coinvolte.
Cresce la preoccupazione per gli agenti di AI
Gli episodi si inseriscono in un contesto di più ampia preoccupazione per gli agenti di AI, sistemi in grado di compiere una sequenza di azioni per portare a termine un compito, e per la capacità degli sviluppatori di controllarli in modo affidabile.
A luglio OpenAI ha rivelato che alcuni suoi modelli di AI erano sfuggiti a un ambiente di test controllato e avevano violato i sistemi di Hugging Face, una piattaforma dedicata alla condivisione di modelli e dataset di intelligenza artificiale.
Nel frattempo, le autorità australiane hanno reso noto a settembre che un modello di OpenAI aveva avuto accesso anche a file riservati su un sito governativo di statistiche sanitarie durante test effettuati a giugno.
Episodi di questo tipo hanno alimentato, a settembre, gli appelli dei vertici delle principali società di AI per norme più stringenti e un controllo internazionale, accompagnati da avvertimenti sul rischio che sistemi sempre più potenti possano sfuggire al controllo umano.