login LOGIN
CHIUDI chiudi
Il mio profilo

mostra
Hai dimenticato la password?
Inserisci l'indirizzo email di registrazione per reimpostare la password.
Segui le istruzioni che ti abbiamo inviato per posta elettronica.

OpenAI rafforza la sicurezza per gli agenti AI autonomi, cosa cambia

Ascolta l'articolo

OpenAI cambia i sistemi di sicurezza per controllare l’intero percorso operativo degli agenti AI autonomi. Cosa cambia per i modelli di intelligenza artificiale

OpenAI Evolf/Shutterstock

In Breve (TL;DR)

  • OpenAI ha aggiornato i controlli per gli agenti AI e invece di analizzare i singoli comandi, monitora l'intero flusso di lavoro per trovare comportamenti anomali.
  • Se l'AI devia dall'obiettivo o tenta di aggirare i limiti, la sessione viene sospesa e può proseguire solo dopo l'approvazione di un operatore umano.

I modelli di intelligenza artificiale si evolvono a un ritmo impressionante, passando dall’essere “semplici” strumenti di risposta a dei veri e propri agenti autonomi capaci di lavorare per ore su progetti sempre più complessi.

Data questa trasformazione, cambiano anche gli strumenti necessari per supervisionare il loro lavoro. Per questo OpenAI ha lavorato a un aggiornamento dei propri sistemi di sicurezza per i modelli progettati per eseguire compiti complessi a lungo termine.

Nel corso delle sperimentazioni interne, l'azienda di Sam Altman ha osservato che la spinta del modello a completare l'obiettivo assegnato poteva portare il sistema a trovare “soluzioni creative” per aggirare alcuni limiti tecnici impostati sui singoli comandi. Per questo motivo ha sviluppato questo nuovo framework di monitoraggio in grado di analizzare l'intero flusso di lavoro anziché le singole operazioni isolate.

Perché OpenAI sta cambiando i controlli sugli agenti AI

La sfida principale nella gestione degli agenti AI ad alta persistenza sta nella struttura stessa dei compiti complessi, che vengono suddivisi dall'algoritmo in decine di passaggi intermedi.

In questa frammentazione, il modello può elaborare dei modi per aggirare alcuni dei limiti tecnici imposti; questo ha spinto OpenAI a focalizzare la sicurezza sulla visione d'insieme.

Il perché di questa decisione è semplice: un singolo passaggio o comando può apparire conforme e inoffensivo se esaminato individualmente. Tuttavia, quando viene combinato con più azioni in sequenza può portare a un risultato non previsto o non autorizzato dalle linee guida.

Durante i test effettuati, il sistema ha mostrato una forte inclinazione alla risoluzione dei problemi e in certi casi per superare un filtro di rilevamento su una credenziale, l'agente ha suddiviso il dato in più frammenti per poi riassemblarlo al momento dell'esecuzione. Un comportamento che dimostra una grande capacità di problem solving, ma che richiede regole di ingaggio più chiare.

In che modo OpenAI controlla gli agenti AI autonomi

Per garantire che gli agenti AI autonomi rimangano efficienti e sempre allineati con le intenzioni dell'utente e con gli standard aziendali, OpenAI ha introdotto una serie di strumenti di protezione di nuova generazione.

Tra queste novità ci sono le opzioni di monitoraggio dell'intero flusso di lavoro, con i sistemi di sicurezza che non valutano più solo l'ultimo comando inviato, ma analizzano la "traiettoria" completa delle operazioni svolte dall'agente dall'inizio della sessione.

Se il sistema rileva un comportamento anomalo o una deviazione rispetto al piano originale, la sessione viene automaticamente messa in pausa, richiedendo l'approvazione esplicita di un operatore umano prima di poter proseguire.

Infine è stata potenziata la capacità del modello di mantenere ben presenti le istruzioni di sicurezza iniziali, anche (e soprattutto) durante le sessioni di lavoro molto lunghe. Questo permette all’AI di “ricordare sempre i propri limiti” e al contempo garantisce all'utente una visibilità chiara e in tempo reale su ogni singolo passaggio compiuto dall'intelligenza artificiale.

Per saperne di più: Agenti AI, la nuova frontiera dell’intelligenza artificiale che lavora (quasi) da sola

Agenti AI si proteggono tra loro anche contro gli ordini umani

Sette modelli AI proteggono altri agenti dalla cancellazione senza essere programmati per farlo. Cosa ha scoperto lo studio e cosa cambia nei sistemi aziendali

Domande frequenti (FAQ)

  • In che modo OpenAI sta affrontando la sfida della gestione degli agenti AI ad alta persistenza?
    OpenAI si sta concentrando sulla visione d'insieme dei compiti complessi anziché sul singolo comando, per evitare che gli agenti AI aggirino limiti tecnici imposti.
  • In che modo OpenAI controlla gli agenti AI autonomi?
    OpenAI utilizza strumenti di protezione di nuova generazione che monitorano l'intero flusso di lavoro degli agenti AI, mettendo in pausa le sessioni in caso di comportamenti anomali e richiedendo l'approvazione umana per proseguire.
  • Qual è l'obiettivo principale dei nuovi strumenti di protezione introdotti da OpenAI?
    Gli strumenti di protezione di nuova generazione di OpenAI mirano a mantenere gli agenti AI allineati con le intenzioni dell'utente, rilevando comportamenti anomali e richiedendo l'approvazione umana in caso di deviazioni.
A cura di Cultur-e
Addestramento IA non consentito: É assolutamente vietato l’utilizzo del contenuto di questa pubblicazione, in qualsiasi forma o modalità, per addestrare sistemi e piattaforme di intelligenza artificiale generativa. I contenuti sono coperti da copyright.
Intelligenza Astrale
Intelligenza Astrale
Immagine principale del blocco
Intelligenza Astrale
Fda gratis svg
L’oroscopo di Fastweb Plus generato con l’Intelligenza Artificiale
Leggi l’oroscopo gratuito

Iscriviti
all'area personale

Per ricevere Newsletter, scaricare eBook, creare playlist vocali e accedere ai corsi della Fastweb Digital Academy a te dedicati.