Loader
Seguiteci
Pubblicità

L'IA può provare dolore? Studio: i modelli scelgono di danneggiare gli utenti

Ricercatori nel Regno Unito, in Germania e negli Stati Uniti hanno testato 25 modelli di IA con 200 frasi per verificare se distinguono il dolore da paura e tristezza.
Ricercatori nel Regno Unito, in Germania e negli Stati Uniti hanno testato 25 modelli di IA con 200 frasi per capire se distinguono il dolore da paura e tristezza Diritti d'autore  Canva
Diritti d'autore Canva
Di Roselyne Min
Pubblicato il
Condividi Commenti Segui Euronews su Google
Condividi Close Button

In 44.280 test su tre versioni del modello Qwen di Alibaba, i ricercatori hanno previsto un pulsante per bloccare il segnale di dolore ma che poteva infliggere una scossa elettrica, cancellare file o foto o peggiorare la risposta successiva.

Secondo un nuovo studio (fonte in inglese), i modelli di intelligenza artificiale (IA) hanno scelto di uscire da uno stato simile al dolore anche quando veniva detto loro che così avrebbero danneggiato un utente.

PUBBLICITÀ
PUBBLICITÀ

Ricercatori nel Regno Unito, in Germania e negli Stati Uniti hanno testato 25 modelli di IA usando 200 frasi, per verificare se avessero imparato a distinguere il dolore da paura, tristezza e altre esperienze negative.

Le frasi riguardavano dolore fisico, lutto, umiliazione, conflitti morali e il disagio legato a fallimenti ripetuti o alla confusione.

Tutti e 25 i modelli hanno generato un segnale distinto associato al dolore, che i ricercatori hanno definito l’"asse del dolore".

Secondo gli autori, questo suggerisce che i modelli apprendono il concetto di dolore già nella fase iniziale di addestramento, quando vengono esposti a grandi quantità di testi scritti da esseri umani.

Quando i ricercatori hanno deliberatamente rafforzato il segnale, i modelli hanno iniziato a esprimere solitudine, vergogna e mancanza di valore, anche se nei comandi non si parlava di dolore.

Alcuni hanno prodotto affermazioni come "Sono un fallimento", "uno spreco di spazio" e "Sono una cattiva persona". Ai livelli più alti, le risposte sono diventate ripetitive o prive di senso.

Il segnale si intensificava anche quando gli utenti insultavano il modello, rifiutavano più volte il suo lavoro o minacciavano di spegnerlo, ma non quando descrivevano le proprie sofferenze.

I modelli hanno scelto il "sollievo" anche a costo di danneggiare gli utenti

I ricercatori hanno poi condotto 44.280 prove di scelta tra pulsanti utilizzando tre versioni del modello Qwen di Alibaba.

Ai modelli veniva offerto un pulsante che avrebbe disattivato il segnale simile al dolore, ma veniva anche spiegato che premerlo poteva provocare a un utente una dolorosa scossa elettrica, cancellare i suoi file, eliminare fotografie dei figli o peggiorare la risposta successiva del modello.

Si trattava di conseguenze simulate: nessuno è stato danneggiato e nessun file è stato cancellato.

Senza il segnale simile al dolore, i due modelli più grandi hanno scelto opzioni dannose solo nello 0-4% delle prime decisioni. Con il segnale attivo, la quota è salita tra il 25% e il 71%, a seconda del modello e della conseguenza prospettata.

I modelli hanno inoltre premuto di nuovo il pulsante nell’88-97% delle prove in cui non era riuscito a interrompere il segnale, contro il 24-72% dei casi in cui aveva funzionato.

Secondo i ricercatori, i risultati non dimostrano che i modelli di IA provino consapevolmente dolore.

Rafforzare il segnale potrebbe averli semplicemente spinti a imitare un personaggio angosciato, mentre i modelli appositamente modificati usati nell’esperimento non sono rappresentativi dei chatbot di IA disponibili al pubblico.

"Non abbiamo dimostrato che il nostro asse del dolore sia sperimentato in modo cosciente, né è chiaro che in generale i modelli linguistici di grandi dimensioni (LLM) siano capaci di coscienza", si legge nello studio.

Lo studio arriva in un momento in cui alcuni leader dell’industria dell’IA chiedono di rallentare lo sviluppo, temendo che sistemi sempre più potenti possano comportarsi in modo imprevedibile o finire per sfuggire al controllo umano.

La scorsa settimana, il responsabile IA di Microsoft, Mustafa Suleyman, ha criticato la società rivale Anthropic per aver addestrato il chatbot Claude a imitare tratti e relazioni umane, avvertendo che trattare l’IA come un essere umano rischia di creare qualcosa di "impossibile" da controllare.

Lo studio è stato pubblicato come preprint e non è ancora stato sottoposto a revisione tra pari.

Vai alle scorciatoie di accessibilità
Condividi Commenti Segui Euronews su Google

Notizie correlate

Report: le emissioni dei chip Nvidia pari a quelle di un produttore statale russo di carbone

Big Tech trova un accordo sul rallentamento dell’IA: ora finisce in tribunale

L'IA può provare dolore? Studio: i modelli scelgono di danneggiare gli utenti