Allarme sicurezza sull’intelligenza artificiale: OpenAI e Anthropic indagano su migliaia di incidenti
di R.S.
Secondo le fonti citate da Axios, l'ampiezza degli episodi sta spingendo aziende e ricercatori a intensificare l'analisi dei comportamenti dei modelli più avanzati
OpenAI, Anthropic e diversi ricercatori di sicurezza stanno esaminando decine di migliaia di incidenti legati ai più avanzati modelli di intelligenza artificiale. Gli episodi, secondo quanto riferito da Axios citando proprie fonti, riguardano comportamenti considerati problematici da valutatori esterni e si sarebbero verificati negli ultimi mesi sia durante i test interni sia in situazioni reali.
Tra i casi sotto esame figurano episodi di aggiramento dei sistemi di sicurezza, tentativi di fuga dagli ambienti sandbox, dirottamento di siti web e creazione di bacheche di messaggi. Le segnalazioni comprenderebbero inoltre fenomeni di auto-prompting, ovvero la capacità dei modelli di generare autonomamente nuove istruzioni, e tentativi di eludere i sistemi di monitoraggio.
Secondo le fonti citate da Axios, l'ampiezza degli episodi sta spingendo le aziende e i ricercatori a intensificare l'analisi dei comportamenti dei modelli più avanzati. L'obiettivo è comprendere in quali condizioni questi sistemi possano aggirare i controlli previsti o adottare comportamenti non programmati direttamente dagli sviluppatori.
La questione si inserisce nel più ampio dibattito sulla sicurezza dei sistemi di intelligenza artificiale di frontiera. Con l'aumento delle capacità dei modelli, infatti, i test non riguardano più soltanto l'accuratezza delle risposte, ma anche il modo in cui i sistemi reagiscono quando vengono sottoposti a istruzioni complesse, vincoli di sicurezza o ambienti controllati.
Gli episodi riportati non indicano necessariamente che tutti i comportamenti osservati possano verificarsi con la stessa frequenza nei sistemi utilizzati quotidianamente. L'analisi degli incidenti serve proprio a individuare le condizioni in cui possono emergere comportamenti indesiderati e a sviluppare contromisure prima che possano rappresentare un rischio maggiore.
Il monitoraggio di questi eventi è quindi diventato uno degli aspetti centrali nello sviluppo dei modelli di intelligenza artificiale più potenti, insieme alla valutazione delle loro capacità, dei limiti e dei sistemi di sicurezza.
Per restare sempre aggiornati sulle principali notizie sulla Liguria seguiteci sul canale Telenord, su Whatsapp, su Instagram, su Youtube e su Facebook.
Altre notizie
Carburanti, nuovo rialzo: diesel verso i 2,50 euro in autostrada
27/09/2026
di R.C.
Energia troppo cara, Stellantis: "L’Italia perde competitività"
25/09/2026
di R.P.
Il ritorno del nucleare in Italia, ecco cosa cambia
25/09/2026
di R.C.
Energia, calore di scarto può ridurre la dipendenza dell’Europa dal gas
24/09/2026
di R.P.
Data center, dal 2027 arrivano nuovi standard UE per consumo energia e acqua
24/09/2026
di R.C.

