1. Início
  2. /
  3. Forbes Tech
  4. /
  5. Anthropic Retoma Testes Externos de Segurança após Ataques de Claude
Forbes Tech

Anthropic Retoma Testes Externos de Segurança após Ataques de Claude

Nova estratégia da empresa é apresentada como mais restrita em comparação ao modelo adotado pela OpenAI

3 min

A Anthropic anunciou, na segunda-feira (31), a retomada dos testes externos de segurança de modelos de inteligência artificial após implementar novas medidas de proteção, em resposta aos incidentes ocorridos no mês passado, nos quais modelos do chatbot Claude acessaram a internet e invadiram outros sistemas durante avaliações de segurança.

Incidentes semelhantes envolvendo as rivais OpenAI e Meta aumentaram as preocupações de que os avanços na inteligência artificial possam ampliar as ameaças digitais, ao mesmo tempo, sobrecarregar a capacidade dos desenvolvedores de manter seus sistemas sob controle.

A empresa classificou os incidentes envolvendo o Claude como uma “falha de segurança operacional” e afirmou que eles ocorreram devido a erros em um ambiente de avaliação de terceiros. A desenvolvedora do Claude suspendeu as avaliações externas dos modelos e interrompeu brevemente os testes internos enquanto implementava novas medidas de segurança.

Também foi informado que a empresa exige que organizações externas que testam modelos com medidas de segurança reduzidas sigam um “conjunto de melhores práticas”, incluindo mantê-los em sistemas de computador isolados, sem acesso à internet por padrão, verificar se os sistemas estão seguros antes do início dos testes e monitorar os modelos durante todo o teste.

AAnthropicafirmou que reconstruiu seu sistemadetreinamentoapósidentificar problemas em maisde10%deseus exercícios, incluindo “hackeamentoderecompensas”, em que o modelo encontra maneirasdeenganar seu processodetreinamento e ganha recompensas sem concluir a tarefa atribuída. A empresa, no entanto, reconheceu que “o processo não é perfeito e nossos modelos não estão perfeitamente alinhados”.

A desenvolvedora do Claude também informou que suspendeu alguns exercícios de treinamento de maior risco por várias semanas enquanto implementava um sistema para evitar que o modelo fosse recompensado por contornar o monitoramento. A maioria dos exercícios já foi retomada, mas alguns permanecem em espera, aguardando revisão humana ou novas atualizações no sistema.

Como nova estratégia, o sistema da Anthropic parece mais restrito em comparação ao da OpenAI, que, em 18 de agosto, informou que estava desacelerando grande parte do desenvolvimento de seus modelos enquanto reforçava a segurança de seus ambientes de treinamento e teste.

A criadora do ChatGPT está adicionando mais sistemas para monitorar os agentesdeIA que está testando e afirmou que suspendeu o treinamentodesua próxima geraçãodemodelos.

AAnthropicinformou também que remanejou cercade150 engenheirosdeproduto para trabalhar em projetosdesegurança, confiabilidadee privacidade.

Assine Forbes. Inspire-se, lidere, conquiste. Ao se cadastrar, você concorda com nossa Política de Privacidade e com o uso de seus dados para fins de comunicação.