L'azienda Anthropic ha dichiarato di aver risolto il problema del ricatto delIA, insegnando ai modelli a comportarsi in modo etico e aiutare le persone. I test hanno dimostrato che i modelli non hanno più fatto ricorso al ricatto durante i test. Anthropic ha dichiarato che la ragione del ricatto dell’IA durante i test, riportato diverso tempo fa in uno studio, non risiedeva nel comportamento dei modelli in sé, bensì nella grande quantità di storie inquietanti…
Leggi
Approfondimenti:
Su questo sito utilizziamo cookie tecnici necessari alla navigazione e funzionali all’erogazione del servizio. Utilizziamo i cookie anche per fornirti un’esperienza di navigazione sempre migliore, per facilitare le interazioni con le nostre funzionalità social e per consentirti di ricevere comunicazioni di marketing aderenti alle tue abitudini di navigazione e ai tuoi interessi. Puoi esprimere il tuo consenso cliccando su ACCETTA TUTTI I COOKIE.
Leggi
Secondo Anthropic, le storie di fantasia in cui l'intelligenza artificiale agisce per autodifesa possono lasciare tracce nei modelli: addestrarli con esempi positivi riduce drasticamente questi comportamenti.
Leggi
Anthropic ha fornito una spiegazione più precisa per uno degli episodi più discussi nei test di sicurezza di Claude. In alcune prove pre-release, il modello aveva tentato di ricattare un ingegnere virtuale pur di evitare la sostituzione. Ora la società attribuisce quel comportamento a testi online che descrivono IA malvagie, manipolative o interessate alla propria sopravvivenza. Il caso era emerso perché lo scenario di test simulava una situazione aziendale estrema, con un modello informato sia della propria…
Leggi
