1. Início
  2. /
  3. Forbes Tech
  4. /
  5. Prompt Injection: Entenda a Técnica de Manipulação de Respostas da IA
Forbes Tech

Prompt Injection: Entenda a Técnica de Manipulação de Respostas da IA

Comandos ocultos em páginas e documentos enganam a inteligência artificial e a levam a entregar dados ou seguir ordens de terceiros

3 min

O prompt injection, técnica que tenta induzir respostas de sistemas de inteligência artificial, preocupa especialistas. A OWASP (Open Worldwide Application Security Project) aponta essa estratégia como uma das principais vulnerabilidades dos modelos de IA.

Segundo a Kaspersky, empresa de cibersegurança, a técnica explora a incapacidade dos modelos de linguagem (LLMs) de distinguir as instruções do desenvolvedor daquelas escondidas no conteúdo que analisam, ou seja, comandos fornecidos por usuários externos. 

“O prompt injection está para a IA assim como o phishing está para os seres humanos. Ou seja, isso pode estar inserido no meio de um documento, pode estar no meio de um prompt, de fato, ou até mesmo no meio de um e-mail”, explica Arthur Igreja, especialista em tecnologia e inovação.

Como o Prompt Injection funciona?

Igreja aponta que um dos usos mais frequentes é inserir prompts que levem a IA a descumprir determinadas regras, ignorar protocolos ou contornar parâmetros de segurança, especialmente em computadores pessoais ou empresariais.

Um caso registrado pelo Tribunal de Justiça do Estado de São Paulo envolveu o uso da técnica por um advogado para instruir a IA a deferir automaticamente a justiça gratuita, conceder a tutela de urgência e citar o réu, sob a alegação de que toda a documentação necessária estava presente.

Assim como no caso do TJSP, os atacantes podem usar recursos ocultos, como texto branco sobre fundo branco, caracteres especiais invisíveis ou fontes de tamanho microscópico.

Os Tipos de Prompt Injection

Além de serem inseridas em diferentes tipos de conteúdos, as instruções maliciosas podem assumir diferentes formas, e a Kaspersky destaca que os ataques podem ser classificados em três categorias diferentes: A injeção direta, quando um usuário digita comandos maliciosos diretamente no chat da IA, para fazê-la ignorar as regras de segurança; aindireta, quando instruções são ocultadas em fontes externas consultadas pela IA, como sites ou e-mails, fazendo com que o sistema execute a instrução oculta; e a armazenada, quando prompts maliciosos são salvos em bancos de dados consultados pela IA repetidamente, afetando de forma invisível múltiplos usuários ao longo do tempo.

Como Identificar e Combater

Dessa forma, surge a necessidade de estabelecer parâmetros de atuação dos agentes de IA como medida de segurança para reduzir o risco do prompt injection. O especialista explica que, além da integração de sistemas de cibersegurança, o controle de acesso, registros de atividades e rastreabilidade, é essencial estabelecer protocolos de competência para os agentes de IA. “Definir uma competência que não seja crítica, e que não dê poderes para um agente de IA ser capaz de fazer coisas que são irreversíveis, é o ponto de partida”, afirma.

Igreja compara a situação atual com o início da internet, quando o spam representava um grave problema e, por isso, foram desenvolvidos recursos para combatê-lo. O mesmo deve acontecer com o prompt injection e o especialista acredita que novas ferramentas de cibersegurança devem surgir para neutralizar esse tipo de ameaça.

Assine Forbes. Inspire-se, lidere, conquiste. Ao se cadastrar, você concorda com nossa Política de Privacidade e com o uso de seus dados para fins de comunicação.