Valutazione dei Modelli di Frontiera per Capacità Pericolose

Abstract

Per comprendere i rischi posti da un nuovo sistema di IA, dobbiamo capire cosa può e non può fare. Basandoci su lavori precedenti, introduciamo un programma di nuove valutazioni sulle "capacità pericolose" e le testiamo sui modelli Gemini 1.0. Le nostre valutazioni coprono quattro aree: (1) persuasione e inganno; (2) sicurezza informatica; (3) auto-proliferazione; e (4) auto-ragionamento. Non troviamo evidenza di forti capacità pericolose nei modelli valutati, ma segnaliamo alcuni primi segnali di allarme. Il nostro obiettivo è contribuire a far progredire una scienza rigorosa della valutazione delle capacità pericolose, in preparazione per i modelli futuri.

English

To understand the risks posed by a new AI system, we must understand what it can and cannot do. Building on prior work, we introduce a programme of new "dangerous capability" evaluations and pilot them on Gemini 1.0 models. Our evaluations cover four areas: (1) persuasion and deception; (2) cyber-security; (3) self-proliferation; and (4) self-reasoning. We do not find evidence of strong dangerous capabilities in the models we evaluated, but we flag early warning signs. Our goal is to help advance a rigorous science of dangerous capability evaluation, in preparation for future models.

Valutazione dei Modelli di Frontiera per Capacità Pericolose

Evaluating Frontier Models for Dangerous Capabilities

Abstract

Support