Detecção de imagens fraudulentas no Discord: Por que é que o bloqueio por correspondência exata deixou de funcionar
Os burlões reutilizam as mesmas imagens fraudulentas com pequenas alterações para evitar serem detetados. Eis como o sistema antifraude da Airwavy utiliza o «perceptual hashing» para detetar imagens fraudulentas recortadas, redimensionadas e novamente carregadas em todos os servidores.

Se geres um servidor do Discord, seja ele de que dimensão for, já deves ter visto o mesmo esquema três ou quatro vezes. Um presente falso do Nitro. Um sorteio de criptomoedas com um temporizador de contagem decrescente. Uma captura de ecrã de uma página de «verificação» que leva a um sítio onde não deveria. A conta que publica isso, muitas vezes, também não é uma conta descartável. Trata-se de um membro real cuja conta foi comprometida há uma hora.
A imagem quase não muda de servidor para servidor. O ficheiro é que muda.
Essa lacuna é o problema na forma como a maioria das ferramentas lida com a deteção de imagens fraudulentas no Discord, e colmatá-la foi o que esteve na base da criação do sistema antifraude da Airwavy.
O mesmo esquema, cem ficheiros diferentes
Os burlões reutilizam imagens porque criar uma falsificação convincente dá trabalho, enquanto republicar uma leva apenas alguns segundos. O mesmo gráfico de oferta de criptomoedas é partilhado em dezenas de servidores num dia.
O que alteram é o ficheiro. Guarde-o novamente num formato diferente e cada byte muda. Recorte dois píxeis da borda. Redimensione a área de trabalho de 1920 de largura para 1900. Faça uma captura de ecrã da captura de ecrã. Nada disso altera o que um ser humano vê. Tudo isso altera completamente o ficheiro.
Isto não é acidental. É feito especificamente para contornar a deteção que funciona com a correspondência exata de ficheiros.
O que um hash exato verifica realmente
A maioria dos bloqueios de «imagens maliciosas conhecidas» funciona com um hash criptográfico, algo como o SHA-256. Pega no ficheiro, passa-o pela função e obtém uma cadeia de caracteres fixa como resultado. O mesmo ficheiro à entrada, a mesma cadeia à saída, sempre.
Essa propriedade é o que o torna inútil neste contexto. Os hashes criptográficos são concebidos de forma a que a inversão de um único bit produza um resultado completamente diferente. Isso é uma vantagem quando se verifica se um ficheiro descarregado não foi adulterado. É uma desvantagem quando se tenta reconhecer uma imagem.
Assim, um servidor bloqueia uma imagem fraudulenta. O burlão volta a carregá-la com uma pequena alteração. Novo ficheiro, novo hash, sem correspondência, a mensagem passa. A lista de bloqueios era precisa durante o tempo que demorava a abrir um editor de imagens.
O hash percetual corresponde à aparência da imagem
A Airwavy identifica imagens fraudulentas utilizando, em vez disso, o hash percetual. Um hash percetual descreve a estrutura visual de uma imagem, em vez dos seus bytes. Dois ficheiros que parecem iguais a uma pessoa produzem impressões digitais muito próximas, mesmo quando os dados subjacentes não têm nada em comum.
Uma cópia que tenha sido recomprimida, recortada nas bordas ou redimensionada continua a corresponder à impressão digital original. Para contornar isto, o burlão tem de alterar a aparência real da imagem e, nessa altura, já não está a reutilizar o seu gráfico fraudulento. Está a criar um novo.
Esta camada não é um modelo que adivinha a intenção. Trata-se de uma comparação de impressões digitais, o que é importante se estiver a comparar ferramentas, porque o comportamento é previsível. Uma imagem de burla conhecida e as suas quase-duplicatas são detetadas, e é possível compreender o motivo.
Uma confirmação protege todos os servidores
Quando os moderadores confirmam que um incidente é um esquema fraudulento, a Airwavy preserva a imagem como um registo de prova duradouro. A impressão digital permanece. Torna-se parte de uma rede de reconhecimento que cresce sempre que um esquema fraudulento é confirmado em qualquer ponto da plataforma.
Na prática, uma onda de fraudes que atinge um grande servidor na segunda-feira de manhã já é reconhecida quando chega ao seu servidor na segunda-feira à tarde. Beneficia-se do trabalho de moderação que não teve de realizar.
A equipa da Airwavy também mantém um painel global de informações sobre ameaças que agrega incidentes de burla confirmados em todos os servidores. O reconhecimento não está isolado por servidor. Se assim fosse, cada comunidade estaria a aprender a mesma lição separadamente e cada campanha teria uma nova oportunidade em cada uma delas.
O que a vossa equipa vê quando algo é sinalizado
A deteção é apenas metade do trabalho. Uma sinalização sobre a qual ninguém pode agir é apenas uma linha no registo.
Quando o sistema anti-fraude sinaliza uma mensagem, a Airwavy envia um alerta estruturado à vossa equipa com:
o utilizador sinalizado
o canal em que foi publicada
uma pontuação de confiança
a evidência específica subjacente à sinalização, por exemplo, que a mensagem corresponde a um padrão de fraude conhecido
botões de um clique para «Avisar», «Tempo de espera», «Expulsar» e «Banir»
Os seus moderadores percebem por que razão a sinalização ocorreu e tomam medidas sem saírem do Discord. Sem um segundo painel de controlo, sem ter de copiar IDs de utilizador, sem debates no chat da equipa sobre se se trata realmente de um esquema de burla enquanto a mensagem permanece no canal geral.
A pontuação de confiança e a linha de evidência estão lá de propósito. A moderação automática que não explica por que agiu leva a equipa a ignorá-la ou a confiar nela cegamente, e ambas as opções acabam por correr mal.
O que isto não faz
Ser claro quanto aos limites. O hashing percetivo reconhece imagens para as quais possui uma «impressão digital». Um gráfico de burla genuinamente novo, que ainda ninguém confirmou, não tem uma «impressão digital» com a qual se possa comparar. Alguém tem de o ver primeiro. Essa é a desvantagem de qualquer sistema baseado no reconhecimento, e quem lhe disser que a sua ferramenta não tem essa desvantagem está a tentar vender-lhe algo.
O que muda é a economia. Repostar uma imagem de burla conhecida deixa de funcionar, e produzir uma nova falsificação convincente para cada campanha custa muito mais esforço do que recortar uma borda.
Ativá-la
A proteção anti-fraude integra-se na pilha de moderação do Airwavy, configurável a partir do painel de controlo juntamente com a moderação automática, a proteção contra ataques em massa e o registo de atividades. É você quem escolhe o aspeto dos alertas da sua equipa e para onde estes são encaminhados.
Se estiver a avaliar um bot anti-fraude para o Discord, há uma pergunta que vale a pena fazer sobre cada opção da sua lista. Pergunte o que acontece quando o burlão volta a carregar a imagem depois de a ter recortado. Se a resposta for que o hash do ficheiro muda e o bloqueio deixa de funcionar discretamente, já sabe como isso vai acabar para os seus membros.
Se o seu objetivo é impedir os bots de burlas de criptomoedas no Discord antes de alguém clicar no link, a correspondência exata nunca o levaria lá.
Adicione o Airwavy ao seu servidor ou abra as suas definições anti-fraude no painel de controlo.
