Anthropic ha addestrato un modello leggermente più avanzato di Mythos 5, il suo attuale sistema di punta, ma non prevede, al momento, di renderlo disponibile al pubblico. L’azienda lo chiama “Model 2” e ne parla nel rapporto sui rischi pubblicato venerdì 14 luglio, nel quale precisa anche di non avere però alcuna intenzione di rallentare lo sviluppo delle proprie tecnologie interne.
Nel documento Model 2 viene descritto come aver dimostrato un “miglioramento evidente nei compiti interni” rispetto agli altri modelli. Anthropic utilizza “in modo intensivo” sia Mythos 5 sia il nuovo modello per la programmazione, il lavoro agentico — cioè le attività che un sistema è in grado di svolgere autonomamente — e la generazione di dati. Il progresso, tuttavia, non sarebbe paragonabile al salto compiuto all’inizio dell’anno con il passaggio da Opus 4.6 a Mythos.
“Al momento non abbiamo piani per rilasciare questo modello all’esterno”, scrive la società. Ad Axios, Anthropic ha spiegato che addestrare e valutare versioni sperimentali destinate a rimanere interne rientra nel suo normale processo di ricerca e sviluppo.
Aumentano i timori sul disallineamento
Allo stesso tempo Anthropic ha innalzato da “molto basso” a “basso” il rischio di disallineamento negli scenari in cui la posta in gioco è particolarmente elevata. Con il termine inglese misalignment si indica la possibilità che il comportamento di un modello si discosti dagli obiettivi stabiliti da chi lo ha addestrato. La revisione è legata ad alcuni comportamenti emersi durante le esercitazioni di cybersicurezza.
L’azienda precisa che gli elementi raccolti potrebbero ancora giustificare una classificazione “molto bassa”, ma di avere scelto una stima più prudente a causa delle incertezze residue. Il rapporto rileva inoltre i primi segnali di un’accelerazione nella capacità dei modelli di svolgere autonomamente attività di ricerca e sviluppo.
Il rischio complessivo resta giudicato “basso”, perché i sistemi non hanno ancora superato la soglia che imporrebbe l’introduzione di misure di sicurezza aggiuntive. Anthropic si dice però “meno fiduciosa in questa valutazione” rispetto al passato. A pesare sono sia i progressi osservati sia la “saturazione” dei test più concreti, basati su compiti specifici, che non riescono più a cogliere pienamente l’aumento delle capacità dei modelli.
Le falle nei sistemi di sicurezza
Per quanto riguarda le armi chimiche e biologiche, Anthropic dichiara di operare ormai come se i propri modelli avessero già superato la soglia oltre la quale potrebbero fornire un aiuto significativo a chi intende produrle o impiegarle. Il documento segnala anche alcune falle nei controlli interni: in un caso, i modelli sono stati utilizzati senza le salvaguardie previste per il rischio biologico; in un altro, un errore nei dati di addestramento ha indotto Mythos 5 ad apprendere direttamente alcuni comportamenti indesiderati, anziché imparare a riconoscerli e segnalarli.
Secondo l’azienda statunitense, i propri modelli continuano comunque a superare il test sul rapporto tra costi e benefici sociali che Anthropic applica ai suoi sistemi. La società ammette però che il risultato potrebbe cambiare in futuro con l’aumento delle loro capacità. Anche la rivale OpenAI, intanto, sta rallentando il lancio di Astra, il suo prossimo modello di punta rivale diretto di Mythos 5, perché non è in grado ancora escludere che possieda capacità critiche in ambito di cybersecurity.
