

Sejamos francos. Há três anos, a moderação era apenas uma 'trivialidade técnica' que podia ser delegada a estagiários a baixo custo. Atualmente, está entre os maiores riscos empresariais que se pode correr — ao nível de incumprimento. A sério, empresas que não conseguem proteger-se adequadamente de audiências massivas arriscam-se a perder até 30% dos seus utilizadores em apenas uma semana — e isto não é brincadeira. E enquanto os utilizadores saem, os milhões de dólares que podem ser perdidos em processos judiciais seguem-se de perto.
Em 2022, as simples pesquisas de palavras proibidas baseadas em dicionários estão agora obsoletas. Os utilizadores tornaram-se tão hábeis a contornar filtros que os moderadores já não conseguem acompanhar adicionando palavras a estas bases de dados — escrevem "k1ll" em vez de "kill" e usam memes para mascarar ameaças. A forma antiga de fazer as coisas terminou.
Um agente de IA que fornece moderação de comentários não é apenas um filtro. Elimina a necessidade de uma lista obsoleta de palavras proibidas, operando em tempo real no momento da publicação. O próprio agente determina se deve permitir, bloquear ou enviar uma publicação para revisão manual.
O agente fornece compreensão de contexto, ao contrário das primeiras versões de filtragem usadas em fóruns que todos detestávamos. O agente interpretará sarcasmo, detetará tensão subjacente e decifrará formas de comunicação culturalmente ditadas.

Os números contam a verdadeira história — um agente processará aproximadamente 10 mil mensagens em 1 minuto enquanto um humano só consegue processar fisicamente 150-200 por minuto; o tempo de resposta é aproximadamente 100 milissegundos para um agente vs. um humano de até vários minutos.
Se deseja começar sem ter de desenvolver o seu próprio código, a ASCN.AI desenvolveu modelos de automação de fluxos de trabalho que pode usar para implementar moderação em 2-3 semanas sem ter de contratar um programador externo. O objetivo principal de automatizar a moderação de conteúdo é prevenir danos à sua imagem e proteger contra processos judiciais. Tem 50 mil comentários por dia, pelo que contratar pessoas suficientes para rever manualmente cada publicação seria financeiramente inviável. No entanto, o custo de uma revisão errada aumenta significativamente. Se deixar passar uma ameaça de violência ou uma imagem de exploração infantil, o governo pode encerrar o seu site.
O agente realiza aproximadamente 90-95% das revisões normais em tempo real, e apenas os casos difíceis ficam para revisores humanos.
| Volume de Mensagens/Dia | Moderação Manual | Agente de IA | Poupança/Mês |
|---|---|---|---|
| 1.000 | $3.000 | $400 | $2.600 |
| 10.000 | $25.000 | $1.200 | $23.800 |
| 100.000 | $200.000 | $8.000 | $192.000 |
Uma API pode ser usada para mostrar como o seu Agente de IA compreende o conteúdo de cada ficheiro. Sem compreender a arquitetura e design por trás dessa API, não pode implementar eficazmente a API e paga demasiado (3×) ou obtém uma percentagem significativa de falsos positivos que afastarão utilizadores do seu produto. Não existe um botão "mágico" que moderará; no entanto, existe um pipeline de modelos que foram desenhados especificamente para uso em vários tipos de dados. Por exemplo, as metodologias usadas para analisar texto são muito diferentes de como fotos ou vídeos são analisados; especialmente, dado que o vídeo normalmente requer significativamente mais poder de processamento do que áudio.
Quando um agente de IA está a moderar comunicação textual de utilizadores, o agente de IA usa NLP. Estas tecnologias NLP utilizam transformers (BERT, RoBERTA, XLM-R) que são significativamente mais precisos do que gerações passadas de modelos quando se trata de compreender contexto (i.e., 40% melhor).
Como funciona isto? Os novos modelos são capazes de abordar texto no contexto de relações entre as palavras; portanto, compreendem que "great job, keep it up" pode ser interpretado como feedback construtivo, ou muito sarcasticamente, dependendo da relação de mensagens passadas no mesmo feed de chat. Os modelos são treinados em grandes conjuntos de dados de Reddit, Twitter e mensagens de fóruns e são usados para identificar a presença de bullying, discurso de ódio e debate neutro.
A principal evolução de modelos passados para modelos atuais é a mudança em como ambos os modelos e algoritmos usam análise de dados baseada em semântica. No passado, um filtro apanharia a palavra "kill" em todas as instâncias (mesmo quando se referia a uma referência social através do termo "killing time"). Hoje, a moderação de conteúdo usará diferentes algoritmos para determinar se o termo "kill" está a ser usado de uma forma que possa ser interpretada como fazer uma ameaça ou expressar uma referência social a uma expressão comum. Além de usar dados semânticos como guia, o agente de IA também olhará para o comportamento passado do utilizador, análise de sentimento e gramática ao fazer uma determinação sobre uma publicação específica.
Um desafio para todos os utilizadores e fornecedores de moderação por IA será que existe cada vez mais gíria ou palavras-código a serem criadas a uma taxa crescente do que os modelos atualmente disponíveis aos utilizadores conseguirão acompanhar. Muitos utilizadores também usam código para comunicar usando letras e emojis para substituir porções do texto que estão a escrever. Como resultado da adição de camadas de deteção de perturbações adversariais aos modelos clássicos, uma camada de deteção de perturbações adversariais foi adicionada aos modelos clássicos pelo menos uma vez por trimestre.
A visão computacional usa Redes Neurais Convolucionais (CNN) e/ou Transformers Híbridos (isto é, Video/Image Transformers ViTs e/ou CLIP) para interpretar imagens e/ou vídeos compreendendo os conteúdos físicos dentro dos pixels. O agente ou modelo pode identificar pessoas, coisas, caracteres, armas ou violência em imagens 2D.
O processamento de vídeo para detetar violência ou suicídio em vídeo ocorre temporalmente e aplicando timing ou ações dinamicamente, não apenas por imagens estáticas (naquele momento específico). Múltiplos modelos de processamento de vídeo incluindo SlowFast e/ou I3D são usados para detetar violência ou suicídio; no entanto, a única forma de saber se ocorreu violência no vídeo a partir da saída do modelo é esperar até que o vídeo seja completamente processado. A desvantagem do processamento de vídeo é que leva longos períodos de tempo para analisar conteúdo de vídeo. Uma (1) hora de vídeo em alta definição completa (FHD) pode requerer 10–50 minutos de tempo de processamento para processar através da GPU numa Tesla V100; assim, muitas plataformas de aplicação apenas aplicam filtragem por IA ao maior volume de vídeo e/ou o processamento de vídeo ocorre pós-evento.
Mensagens de voz e/ou mensagens de voz serão primeiro convertidas para formato de texto (transcritas) antes de passar por um filtro de texto; no entanto, existe outra camada de filtro de áudio: filtro acústico. Um filtro acústico analisará o som, tom e pausas dentro da mensagem de voz para gritos ou agressão independentemente da língua falada com base nas características de frequência.
Uma aplicação de moderação de comentários por IA para chat de voz ao vivo funciona quase em tempo real (2–3 segundos); sem esta capacidade, a pessoa que faz o comentário pode continuar a criar conflito requerendo resolução imediata em aplicações de Streaming/Gaming. O maior desafio com mensagens de voz é ruído de fundo e termos de gíria química de diferentes partes do mundo; a gíria usada na língua russa varia diariamente em diferentes partes do mundo.
Cada fórum de conteúdo tem as suas próprias práticas "aceitáveis"/"padrão", mas o que é considerado aceitável e padrão no Reddit normalmente seria considerado inaceitável e não padrão num fórum infantil. O desafio com usar uma API para moderar o conteúdo dos seus utilizadores é que são construídas usando dados médios — Não é feita exceção no que diz respeito a não permitir o termo "scammer" ao delinear a relação de um político.
Os sistemas RAG (Retrieval-Augmented Generation) podem resolver estes tipos de problemas, pois podem carregar dinamicamente as suas regras no contexto de pedidos iniciados pelo utilizador, significando que quaisquer alterações feitas às regras são aplicadas a pedidos iniciados pelo utilizador no mesmo dia e não requerem um longo retreino do modelo.
Para ilustrar como o RAG funciona, carregaria uma lista de conteúdo proibido juntamente com exceções apropriadas. O RAG pesquisará então através dos seus dados usando uma base de dados Vector (Pinecone) para localizar pontos de conteúdo que correspondam à mensagem do utilizador e depois retornará uma resposta de bloquear/permitir/revisão-humana ao utilizador juntamente com os pontos encontrados.
Os clientes de fornecedores de serviços dizem frequentemente que spam e profanidade são o seu desafio #1; no entanto, quando revê estatísticas de incidentes, ameaças de violência física e atos ilegais coordenados são muito mais comuns do que profanidade. Embora o spam cause um inconveniente ao fornecedor de serviços, a profanidade normalmente resultará num fornecedor de serviços perder o seu serviço como resultado de uma ordem judicial nas dezenas de milhares de dólares. No entanto, ameaças e pornografia infantil criarão a situação onde um fornecedor de serviços perderá o seu serviço em dias.
Um agente de IA usado para filtrar conteúdo tóxico não opera dentro do sistema "sim ou não" utilizado em serviços tradicionais; em vez disso, opera numa "escala". Uma plataforma de moderação por IA será capaz de diferenciar entre um comentário depreciativo leve (e.g., "stupid") versus fazer uma ameaça física real contra alguém (e.g., "We will find you, ass-whole.") Assim a resposta pode variar de um aviso a uma proibição permanente, e dados relevantes podem ser submetidos às autoridades. A incitação ao ódio motivado racial e religiosamente é conhecida como discurso de ódio. O discurso de ódio pode ser mascarado através de declarações desumanizantes (i.e., chamar outros de "não humanos") e através do uso de palavras-código. Existe uma linha ténue entre o que o discurso de ódio pode ser protegido sob a Primeira Emenda nos Estados Unidos e o que é um crime na Alemanha.
Com base nos dados da ASCN.AI, o número de mensagens de spam apanhadas pela automação é pelo menos 98%. O spam tradicional é caracterizado por links repetidos e envio em massa. No entanto, spammers mais modernos começaram a usar modelos Generative Pre-Trained Transformer (GPT) para criar o que parecem ser comentários gerados por humanos que contêm publicidade incorporada. Isto levará à análise comportamental para identificar um bot ou conta automatizada. Um exemplo comum de comportamento de bot seria criar uma nova conta e deixar 20 comentários num período de 10 minutos com um link para um domínio.
No espaço cripto, a ASCN.AI está especificamente focada em moderar sinais em canais Telegram/Discord identificando tokens de burla e airdrops falsos através de análise de padrões de links de contratos.
Notícias falsas são tratadas de forma diferente. Os agentes podem integrar dados de fontes de verificação de factos (e.g., Snopes, FactCheck.org) e denotar opiniões baseadas em evidências sobre se alegações foram factualmente validadas. O conteúdo não é eliminado (isto seria considerado censura) mas é rotulado "Esta Alegação foi Investigada e considerada Inválida". Atualmente, a percentagem de factos a serem verificados é aproximadamente 70% devido ao alto volume de conteúdo falsificado a ser criado.
A visão computacional pode identificar logótipos e marcas de água. Por exemplo, se um utilizador carregar uma imagem de uma marca (i.e., ténis contrafeitos), o agente bloqueará a imagem e enviará uma notificação ao proprietário da marca registada ou direitos de autor.
No caso de material de vídeo, foi desenvolvida tecnologia para identificar vídeos usando o que é referido como "Content ID", que resulta na geração de uma impressão digital do conteúdo de vídeo. A impressão digital gerada para novos vídeos será comparada com a impressão digital de vídeos existentes. Se houver uma similaridade de 80% ou superior, então o YouTube bloqueará conteúdo ou imporá restrições na capacidade de monetizar o material de vídeo. A desvantagem da moderação algorítmica é que os algoritmos normalmente não delineiam entre "uso justo" e outras formas de violação de direitos de autor ao usar excertos de citações para uso educacional pelo utilizador final. Isto coloca carga adicional nas pessoas para tomar decisões sobre o que é aceitável.
| Parâmetro de Comparação | Moderação Humana | Moderação por IA (Automática) | Modelo Híbrido (Humano + IA) |
|---|---|---|---|
| Velocidade de Reação | Minutos / Horas | Milissegundos (Tempo real) | Segundos (para itens disputados) |
| Escalabilidade | Linear (requer pessoas) | Exponencial (CPU/GPU) | Alta |
| Precisão (Contexto) | Alta (compreende cultura) | Média (depende do modelo) | Máxima (IA ordena) |
| Custo (OPEX) | Alto ($$$) | Baixo (com crescimento de volume) | Ótimo |
| Disponibilidade 24/7 | Difícil / Caro | Sim | Sim (IA) |
| Saúde Emocional | Risco de burnout / trauma | Não aplicável | Protegida (humanos veem itens complexos) |
O modelo híbrido é o padrão ouro. Um agente de IA para plataformas UGC (User Generated Content) filtrará 90%–95% do lixo óbvio (Spam, Grosseria). Humanos serão necessários para casos limítrofes como sátira política que pode parecer ódio ou intolerância ou para fotos relacionadas com medicina para fins educacionais.
| Critério | ASCN.AI | Google Perspective API | Solução Self-hosted |
|---|---|---|---|
| Tempo de Implementação | 2-3 semanas | 2-5 dias | 3-6 semanas |
| Equipa Necessária | Sem programadores (sem código) | 1-2 programadores | 3-5 engenheiros ML |
| Personalização de Regras | Total (RAG + fine-tuning) | Limitada | Total |
| Custo a 100K msg/dia | $8.000/mês | $15.000/mês | $10.000/mês + infraestrutura |
| Armazenamento de Dados | Escolha do cliente | Servidores Google | Seus servidores |
| Suporte de Gíria Cripto | Sim (modelos espec.) | Não | Requer retreino |

O método de execução seguirá uma abordagem lenta e constante. A fase inicial consistirá em testes históricos seguidos de um teste em "modo sombra" e depois finalmente mover-se para um aumento gradual na automação.
Para começar, audite os conjuntos de dados que já construiu. Se a sua aplicação está atualmente ao vivo, deve extrair um dump de seis meses de mensagens permitidas e bloqueadas. Rotule cada mensagem como spam, ter conteúdo tóxico ou não ser segura para trabalho. Este será o seu "material de treino" para afinar o seu modelo.
Enquanto faz isso, formalize as diretrizes. Não é suficiente dizer "não pode usar insultos". Deve especificar "o que é um insulto", "existem exceções". Por exemplo, a palavra "death" é normal num fórum médico mas seria uma bandeira para uma violação em qualquer outro tipo de fórum. Este documento tornar-se-á a base do seu programa RAG (Policy-as-Code).
Usar uma solução SaaS pré-configurada (e.g. Google Perspective API, Azure, OpenAI) seria uma boa forma de começar rapidamente, pois podem tipicamente ser integradas em alguns dias com um modelo de cobrança pay-per-use. Prós incluem: velocidade de entrega e sem custo de infraestrutura; no entanto, não tem flexibilidade, potencialmente deu os seus dados sensíveis a terceiros (um risco sob GDPR) e o custo global será exponencialmente mais alto em termos de volume de transações.
Uma solução personalizada envolverá tipicamente afinar um modelo de machine learning open-source (e.g. RoBERTa, BERT) com base nos seus dados proprietários usando o seu próprio servidor. Prós incluem: tem controlo completo dos seus dados; no entanto, precisará de uma equipa de engenharia ML com acesso a recursos de computação elevados (um custo de $500/mês pelo uso de uma GPU).
Uma solução híbrida, no entanto, está algures no meio. A solução SaaS filtrará apenas vulgaridade básica enquanto a solução personalizada pode filtrar as nuances e especificidades do seu negócio. Por exemplo, filtragem simples pode ser feita na nuvem enquanto filtragem de nuances mais complexas pode acontecer num ambiente local.
O fine-tuning será simplesmente o processo de calibrar as ponderações do algoritmo de machine learning para o objetivo empresarial específico que definiu. Carregue os dados de treino usados no Passo 1 para o seu modelo escolhido e execute-o por 3-5 épocas para reduzir falsos positivos (coisas normais que são sinalizadas como proibidas) e falsos negativos (coisas tóxicas que passam).
Um dos pontos mais críticos de interesse é definir um limiar de confiança. Se o modelo indica uma probabilidade de 0,85 de ser tóxico, pode definir o seu limiar de confiança para um valor de 0,90. Isso significa que a mensagem passa pelo sistema de segurança mas é registada para avaliação posterior. Definir o limiar para 0,70 significa que a mensagem será considerada um bloqueio duro. Encontrar um valor ótimo é um processo experimental, e deve começar com uma definição mais alta, como entre 0,90-0,95, para que os seus utilizadores não se queixem, e depois reduzir esse limiar conforme necessário.
# Definir o limiar de confiança do modelo
CONFIDENCE_THRESHOLD = 0.85 # Mensagens com probabilidade >85% são bloqueadas
REVIEW_THRESHOLD = 0.60 # Mensagens 60–85% são enviadas para revisão manual
if toxicity_score >= CONFIDENCE_THRESHOLD:
action = "BLOCK"
elif toxicity_score >= REVIEW_THRESHOLD:
action = "REVIEW"
else:
action = "ALLOW"
Também tem de considerar a sua área específica de foco. Por exemplo, em gaming, a palavra "kill" é usada como parte do gameplay. Na prática médica, a palavra "cut" está relacionada com realizar um procedimento cirúrgico. O modelo precisa de classificar apropriadamente o contexto situacional em torno de cada palavra, ou o sistema pode sinalizar incorretamente 30-40% do uso.
Ao implementar o seu sistema, comunicações REST API e SDK serão os métodos que usa para receber e enviar informação. O caminho através do qual a informação fluirá será assim: UTILIZADOR FINAL -> SERVIDOR BACK END -> AGENTE -> DECISÃO. Para evitar fornecer lag, a decisão precisará de ser completada em menos de 200ms. Caso contrário, os seus utilizadores finais notarão o lag.
O lançamento inicial do sistema será considerado Modo Sombra. O agente ainda estará a tomar decisões sobre mensagens; no entanto, ainda estará a publicar cada uma dessas mensagens. Agora simplesmente comparará a decisão do agente com os resultados contidos no registo, e avaliará quantas das decisões do agente corresponderam ao que o utilizador recebeu. Se correspondeu a mais de 90%, então pode começar a implementar para uma pequena percentagem (10%-20%) do seu tráfego total. Ao comparar humanos (Grupo A) versus agentes (Grupo B), conduza um teste A/B que recolhe queixas e analisa a velocidade de resolução de problemas, bem como o número de contas resolvidas (churn). Se o Grupo B tiver desempenho semelhante ou melhor que o Grupo A em termos de queixas, velocidade e churn, a quantidade de trabalho realizado pelo agente pode ser aumentada para 80%; no entanto, retenha 5-10% para humanos em casos complexos.
"O erro mais comum é tentar implementar IA a 100% logo de início. É melhor implementar IA a 90% e depois introduzir revisão manual gradualmente. Na ASCN.AI começámos com um processo híbrido durante os primeiros três meses; os agentes sinalizaram 95% das violações, e um humano reviu 5%. Como resultado, experimentámos uma redução de dez vezes no trabalho manual necessário sem impactar a qualidade."
A realidade é que qualquer pessoa que afirme fornecer "moderação sem erros ou perfeita" está a mentir. Todos os modelos são construídos a partir de dados de treino; portanto, cada modelo cometerá um erro. Como resultado, o objetivo deve ser diminuir o número de erros em vez de eliminá-los.
Ao treinar um agente, o agente herda vieses dos dados em que foi treinado. Um modelo treinado usando dados dos EUA não compreende contexto da Rússia ou Ásia. Um exemplo é a sinalização do Google de AAVE como mais tóxico porque é normalmente encontrado em contextos negativos.
Falsos positivos são o resultado de proibir algo que é normal. Por exemplo, um agente proíbe o uso de "that movie killed me" como uma ameaça ou bloqueia uma conversa sobre prevenir suicídio porque o filtro de bloqueio vê-o como uma declaração pró-suicídio.
Para corrigir isto, faça uma auditoria de equidade. A cada trimestre, verifique o modelo contra múltiplos grupos e se vir um desvio, faça um retreino numa amostra equilibrada.
O sarcasmo é um pesadelo para NLP. Pegue na frase "that's just great", é um elogio ou sarcasmo? Seria difícil para o modelo dizer a partir do contexto devido à falta de contexto. Isto é agravado por memes porque um meme terá uma imagem que parece neutra mas o texto é tóxico.
A gíria muda a um ritmo mais rápido do que o modelo. Em 2019, o gesto de mão "OK" (👌) foi cooptado por grupos de extrema-direita nos EUA como um símbolo de ódio e um modelo treinado pré-2019 não o teria sinalizado.
Atualizações constantes removerão a obsolescência. Faça retreino a cada 3 meses ou faça um sistema RAG com um documento de regras "vivo". Na ASCN.AI, atualizamos a base de dados para alterações críticas (novos memes, modas) dentro de 24 horas usando RAG.
Em condições ideais com contexto (i.e. dentro de um laboratório), os modelos de hoje alcançam uma precisão de 80-90%. No entanto, em situações reais onde o histórico completo de diálogo não está disponível, a IA alcança 70-75% de precisão. Para áreas sensíveis, usaremos uma abordagem híbrida onde o agente sinalizará conteúdo como sendo ofensivo (90%–80% de probabilidade de ser ofensivo) e depois um humano fará a determinação final.
Definitivamente! Isto é uma ocorrência normal. Usando Policy-as-Code, será capaz de carregar os seus Conjuntos de Regras Personalizados para RAG e ter essas regras usadas sem retreinar "do zero". Personalização adicional para linguagem de especialidade ocupacional exigiria afinar o modelo (RoBERTa). Este processo leva 1-3 semanas.
Levará a um programador 2-5 dias para integrar uma API SaaS pré-construída. Isto inclui configurar endpoints e conduzir testes em modo sombra. Uma solução construída à medida com um elemento de treino levará 3-6 semanas.
Não, a moderação atual de texto/foto sozinha não apanhará DeepFakes. Precisará de modelos especializados (e.g. FaceForensics++, Reality Defender). Atualmente, a precisão de apanhar DeepFake com esses modelos é 90-95%, no entanto, não será capaz de apanhar novos modelos de difusão com estes modelos existentes. Precisará de uma combinação de revisão automatizada e revisão manual para vídeos suspeitos.
Se está apenas a processar 100 mensagens/dia, é normalmente mais barato contratar um moderador humano a um custo de $1.000. No entanto, a matemática muda significativamente ao mover-se para 5.000-10.000 mensagens diárias; assim, a IA será 5-10× menos cara do que um agente humano nesse volume.
Se está a processar 10.000 mensagens/dia ou mais, dependendo do seu modelo de negócio, pode esperar um retorno do investimento em 2-4 meses. Num caso de estudo que a ASCN.AI conduziu com um cliente fintech, receberam um retorno do investimento em 3 semanas e pouparam $23.800/mês em salários num volume de 15.000 mensagens/dia.