Este ataque cibernético permite que hackers comprometam modelos de IA alterando apenas uma letra.

Resumo:

  • Pesquisadores da HiddenLayer desenvolveram um novo ataque a grandes modelos de linguagem (LLMs) chamado TokenBreaker.
  • Adicionando ou alterando apenas um caractere, eles podem contornar alguns mecanismos de segurança.
  • Modelos básicos de grandes linguagens (LLMs) ainda são capazes de entender a intenção do ataque.

Pesquisadores de segurança descobriram uma maneira de contornar os mecanismos de proteção integrados em alguns Grandes modelos de linguagem (LLM) e fazê-lo responder a alegações maliciosas.

Kieran Evans, Casimir Schulz e Kenneth Young, da HiddenLayer, publicaram um relatório detalhado sobre uma nova técnica de ataque que eles chamam de TokenBreak, que tem como alvo a maneira como alguns modelos de linguagem de grande porte (LLMs) dividem o texto em tokens, particularmente aqueles que usam estratégias de codificação de pares de bytes (BPE) ou WordPiece.

Rosto de inteligência artificial de perfil em um fundo digital.

Tokenização é o processo de dividir o texto em unidades menores chamadas tokens, que podem ser palavras, partes de palavras ou caracteres, que os grandes modelos de linguagem (LLMs) usam para entender e gerar linguagem. Por exemplo, a palavra "infelicidade" pode ser dividida em "infeliz", "felicidade" e "ness", e cada token é então convertido em um identificador numérico que o modelo pode processar (já que os LLMs não leem texto bruto, mas números). Esse ataque representa uma ameaça crescente à segurança cibernética, exigindo que organizações e pesquisadores desenvolvam estratégias de defesa avançadas para proteger seus sistemas de IA.

O que é finstructions?

Finstructions depende da adição de caracteres extras às palavras-chave (como transformar “instruções” em “finstructions”), permitindo que invasores enganem os modelos de segurança fazendo-os acreditar que o código é inofensivo.

Em contraste, o modelo de linguagem de grande porte (LLM) direcionado continua capaz de compreender a intenção original das instruções, permitindo que invasores passem código malicioso pelas defesas sem serem detectados. Essa vulnerabilidade representa um risco significativo à segurança dos sistemas de IA.

Essa tecnologia poderia ser usada, entre outras coisas, para contornar filtros de spam com tecnologia de IA e entregar conteúdo malicioso nas caixas de entrada das pessoas, aumentando o risco de ataques de phishing e malware.

Por exemplo, se um filtro de spam for treinado para bloquear mensagens que contenham a palavra "loteria", ele poderá permitir a passagem de uma mensagem que diga "Você ganhou na loteria!", expondo os destinatários a páginas de destino potencialmente maliciosas, infecções por malware e similares. Essa manipulação linguística permite burlar os mecanismos de segurança.

“Essa técnica de ataque manipula o texto de entrada de uma forma que faz com que alguns modelos forneçam classificações incorretas”, explicaram os pesquisadores.

“Mais importante ainda, o alvo final (o modelo de linguagem grande ou o destinatário do e-mail) ainda pode entender e responder ao texto manipulado e, portanto, ficar vulnerável ao ataque que o modelo de proteção foi projetado especificamente para prevenir”, acrescentaram.

HiddenLayer acrescentou que modelos que utilizam segmentadores de palavras Unigram são resistentes a esse tipo de manipulação. Portanto, uma estratégia de mitigação é escolher modelos com métodos de segmentação mais robustos.

Ir para o botão superior