Avaliação de Modelos de Fronteira para Capacidades Perigosas

Resumo

Para compreender os riscos apresentados por um novo sistema de IA, devemos entender o que ele pode e não pode fazer. Com base em trabalhos anteriores, introduzimos um programa de novas avaliações de "capacidades perigosas" e as testamos nos modelos Gemini 1.0. Nossas avaliações abrangem quatro áreas: (1) persuasão e engano; (2) segurança cibernética; (3) auto-proliferação; e (4) auto-raciocínio. Não encontramos evidências de capacidades perigosas robustas nos modelos avaliados, mas identificamos sinais de alerta precoces. Nosso objetivo é contribuir para o avanço de uma ciência rigorosa de avaliação de capacidades perigosas, em preparação para modelos futuros.

English

To understand the risks posed by a new AI system, we must understand what it can and cannot do. Building on prior work, we introduce a programme of new "dangerous capability" evaluations and pilot them on Gemini 1.0 models. Our evaluations cover four areas: (1) persuasion and deception; (2) cyber-security; (3) self-proliferation; and (4) self-reasoning. We do not find evidence of strong dangerous capabilities in the models we evaluated, but we flag early warning signs. Our goal is to help advance a rigorous science of dangerous capability evaluation, in preparation for future models.

Avaliação de Modelos de Fronteira para Capacidades Perigosas

Evaluating Frontier Models for Dangerous Capabilities

Resumo

Support