

A primeira vez que criei o meu próprio script Selenium para extrair dados da bolsa demorei três dias — apenas para descobrir os seletores certos e escrever rotinas de verificação de erros. Depois, quando a bolsa fez alterações (mesmo que pequenas), todo o meu trabalho árduo foi em vão! Agora, um bot de IA pode completar o mesmo trabalho em vinte minutos. Além disso, o bot pode adaptar-se às mudanças no site, uma vez que compreende o contexto do que está a fazer, em vez de apenas procurar elementos na ordem fixa de um DOM. Isto não é apenas uma poupança de tempo — é uma forma inteiramente nova de pensar sobre como programar para a web!
“A pesquisa web tradicional e o desenvolvimento de scripts tradicionais estão obsoletos. Costumávamos passar dezenas de horas a escrever código que se tornava inutilizável sempre que os sites mudavam. Graças aos navegadores alimentados por GPTs, o próprio modelo sabe o que é a página, como encontrar os seus elementos e como realizar a operação desejada sem ter de alterar qualquer código. Em oito meses, analisámos 43 formas diferentes de fazer cripto-análise e determinámos que tanto o Selenium como o Puppeteer só funcionam com sucesso quando combinados com grandes modelos de linguagem; caso contrário, haveria um ciclo infinito de atualizações contínuas necessárias para manter o código.”
A automação de navegadores (por vezes referida como raspagem de navegadores) refere-se a quando um computador pode realizar ações em seu nome (clicar em botões, inserir informações em formulários, navegar para diferentes páginas e recolher dados) sem precisar de entrada ou assistência de um utilizador humano. Historicamente, para automatizar uma interface web, era necessário escrever scripts estáticos com seletores muito específicos para os elementos específicos de uma interface que se queria atingir — resultando frequentemente em código extremamente frágil (e, portanto, facilmente quebrado). Toda a estrutura ruiria imediatamente se houvesse uma ligeira modificação na interface. Hoje, existe a disponibilidade de GPT e IA. Isto permite-nos escrever cenários flexíveis que nem sempre seguem o modelo de desenvolvimento passo a passo, mas que, em vez disso, podem compreender o que está a acontecer na página. Isto permite que as alterações variáveis sejam tidas em conta e modificadas, mesmo que a marcação tenha mudado.

Os scripts tradicionais (que são quebrados com qualquer avanço no código) têm um desafio fundamental, que é o facto de serem tipicamente muito demorados de manter, uma vez que as modificações de código quebram a lógica do script e corrigir esta lógica geralmente requer muitas horas de trabalho. A automação usando a tecnologia GPT não tem este problema, pois analisa a semântica dos elementos, bem como os seus dados técnicos. Este é um fator vitalmente importante ao considerar que há momentos em que a manutenção do código pode ser inteiramente mais dispendiosa do que a utilização da automação. Ao utilizar os métodos GPT de desenvolvimento de scripts, o tempo gasto na manutenção dos scripts pode ser virtualmente eliminado, enquanto o tempo usado para desenvolver os scripts aumentaria em até dez vezes.
Automatizar ações do navegador é o uso de um programa automático para realizar ações que normalmente faria manualmente (ou seja, clicar, preencher formulários, pressionar botões). As principais ferramentas para realizar a automação do navegador incluem:
Existem duas categorias de métodos de automação: a automação imperativa exige que se escreva cada ação em código, enquanto a automação declarativa exige que se descreva o resultado desejado e se permita que o sistema defina os passos necessários para o alcançar. Um bom exemplo de automação declarativa é o GPT, que permite indicar uma tarefa usando linguagem natural e, em seguida, executar automaticamente todas as ações necessárias através da análise do DOM. Quando se trata de testar páginas web na indústria de criptomoedas, o Playwright frequentemente exibe um nível de desempenho muito superior ao Selenium, especialmente com dados atualizados a cada centésimo de segundo via WebSockets. O Selenium não terá tempo suficiente para recuperar atualizações de página em tempo real, enquanto o Playwright, com os seus tempos de espera automáticos, torna as execuções de teste mais gerenciáveis. No entanto, se uma página web tiver demasiadas regras de negócio, um agente de IA é a melhor opção.
GPT é um modelo de Processamento de Linguagem Natural (PLN) extremamente grande e treinado, baseado em arquitetura generativa e transformadora. O GPT permite identificar conceitos, responder a perguntas e escrever código em linguagens de programação. Ao trabalhar com automação de navegadores, o agente do navegador analisará o DOM (Document Object Model) utilizando uma análise dos seus tipos de elementos HTML e regras CSS para determinar o comando correto a executar para cada elemento específico (clicar no botão de envio, etc.)
Ao usar o GPT para emitir um comando para o navegador, normalmente passa-se um instantâneo do DOM ou parte de um instantâneo do DOM, e especifica-se: quando um elemento muda, em vez de encontrar um elemento que corresponda ao seletor original, o modelo procurará outro elemento. Ou seja, se um elemento for adicionado ou modificado.
Um ótimo exemplo disso é como a utilidade de listagem de tokens da ASCN.AI funciona através das doze diferentes bolsas. Esta funcionalidade exigia originalmente 8 horas de tempo de pessoal por semana para edição manual de seletores. Após a implementação do GPT-4, o agente GPT-4 obtém o HTML (e, por vezes, uma captura de ecrã) para a página de listagem, localiza a tabela a partir da estrutura e cabeçalho da tabela, extrai os dados necessários e insere esses dados na base de dados. Atualmente, o agente reduziu a manutenção a zero, uma vez que o agente pode auto-modificar-se.
Ao usar IA na automação de navegadores, referimo-nos ao uso de IA para executar a automação de navegadores através de aprendizagem de máquina, principalmente com grandes modelos de linguagem (LLMs), que desenvolvem e executam a automação de navegadores sem o uso de cenários ou seletores codificados. Em vez de criar uma lista de instruções para o utilizador usar para completar uma tarefa num website, o utilizador simplesmente fornece à IA uma descrição verbal de uma tarefa que deseja que a IA o ajude a realizar e a IA pode usar essa descrição para navegar pela interface do utilizador e determinar quais ações são necessárias. Um sistema de automação de navegadores baseado em IA é composto por:
O GPT e outros modelos de IA são capazes de otimizar fluxos de trabalho e fornecer um grande suporte na automação de quaisquer processos. Como exemplo, aqui estão as principais funções do GPT e LLM relacionados (Claude, Llama, Gemini):
Estas tarefas tornam-se ainda mais importantes ao considerar que a maioria das aplicações do tipo SPA são criadas com React ou Vue, porque estas frameworks renderizam os seus navegadores num DOM fluido/flexível. No caso de usar tecnologia de visão de máquina, um motor de IA como o Anthropic Claude também fornecerá processamento de imagem de instantâneos, proporcionando aos utilizadores capacidades adicionais para trabalhar com ferramentas de automação de navegadores. Além disso, a maioria dos modelos de agentes executará ciclos contínuos - observar / agir / verificar / ajustar.
Atualmente, existem três métodos diferentes para integrar o GPT no fluxo de trabalho de automação de processos:
Em resumo, a implementação da automação de processos tornou-se muito mais fácil graças à tecnologia de IA, de modo que, ao construir sobre a sua plataforma atual, desde que consiga descrever o objetivo do seu processo da mesma forma que discutimos uns com os outros, ser-lhe-á fornecida uma solução de fluxo de trabalho automatizado pré-construída - automação com uma construção de atribuição gráfica onde as soluções atribuídas abrangerão tudo, desde acionadores e integrações de API da aplicação e serviços processados, como Google Sheets, Telegram, etc. Em muitos casos em que o utilizador não tem conhecimento de programação da API Playwright ou OpenAI, eles não serão necessários ao construir essas soluções de fluxo de trabalho automatizado.
Navegar pelos menus da maioria dos websites hoje em dia envolve usar uma interface (uma barra de navegação) ou usar diretamente o modelo semântico para encontrar a secção desejada. Quando a página de um website é atualizada ou alterada de alguma forma, a forma como a página foi configurada poderá ter mudado a forma como se navega para lá chegar.
Preenchimento de Formulários - A definição de preencher o formulário é encontrar o mapeamento entre os campos do formulário (como nome ou morada) e o que está a colocar nesses campos.
Clicar em Itens - Os métodos para localizar os elementos na página e clicar neles dependem de ter sucesso ou não em clicar neles. Se não conseguir encontrar o elemento que deseja clicar, terá de aceder aos métodos para tentar novamente até o ter acedido.
Extração e Armazenamento de Dados - Para recolher informações de um script de automação anterior, precisará de extrair informações tabulares (como datas de compras anteriores), bem como extrair informações de um website que contenha o mesmo tipo de informação (como downloads) e armazenar essas informações numa área protegida no seu próprio computador. Em seguida, precisará de estruturar essas informações (como datas de compras e downloads) e guardá-las no formato apropriado.
Cenário 1 - Monitorização de Novas Listagens de Tokens
Isto foi bem-sucedido na identificação de uma listagem da Binance 12 minutos antes de outros traders conseguirem ver a listagem e, subsequentemente, aumentou 34% em valor minutos após a listagem.
Cenário 2 é a Automação de Formulários KYC Carregados para Bolsas
No geral, reduzimos o tempo necessário para preencher um Formulário KYC de 15-20 minutos para 3 minutos, representando um total de mais de 11 horas poupadas por mês.
O Cenário 3 relaciona-se com a Informação de # Whales (TX)
O fluxo de trabalho em todos os procedimentos acima permitiu-nos identificar Saídas de Capital de uma Bolsa 48 horas antes do Colapso do Mercado.
O agente começa por dividir um determinado objetivo em pequenas tarefas ou componentes de tarefa, completa essas tarefas e devolve o resultado das tarefas ao utilizador após a conclusão de todas as tarefas. Portanto, o utilizador irá conectar-se ao agente (1) definindo como aceder ao agente, (2) definindo a(s) tarefa(s) a ser(em) completada(s) pelo agente, e (3) o agente criará um plano para cumprir o pedido definido pelo utilizador e executará o Plano criado para satisfazer o pedido feito pelo utilizador, validando a conclusão do Plano para cumprir o pedido do utilizador. O padrão ChatGPT fornece ao utilizador uma função de assistente. Por exemplo, o utilizador pode usar um comando executado pelo agente através de um DOM e depois executar esse comando através de outro ambiente de execução. O ASCN.AI é construído sobre agentes personalizados e dados Web3 e a API GPT incorporada e fornece um método fiável e versátil para cumprir o pedido do utilizador.
Os scripts podem ser executados no lado do cliente através de uma extensão do navegador (Manifest V3) ou os mesmos scripts podem ser executados no lado do servidor (Node.js) usando as APIs OpenAI e Playwright. Cada script executado no cliente (usando uma extensão do navegador) executará o script dentro do separador atual e, em seguida, fornecerá o DOM ao agente através de um pedido para executar o comando do utilizador no navegador. A única limitação da execução do script no lado do cliente é que o pedido só pode ser executado no separador atual do navegador. A execução do script no lado do servidor permitirá ao utilizador executar todos os pedidos usando as APIs OpenAI e Playwright a partir de um local baseado em servidor, bem como fornecer um número aumentado de pedidos concorrentes e responder eficientemente a vários utilizadores.
Os utilizadores também podem usar soluções pré-determinadas para configurar o seu pedido. Alguns métodos existentes para configurar o pedido de um utilizador são LangChain, BrowserGPT (código aberto) ou o ASCN.AI NoCode (com editor visual).
APIs principais para automação:
Tudo o que foi explicado acima define a arquitetura de automação padrão:
Para obter dados dinâmicos, usará a interceção de WebSocket ou fará uma chamada de API. A própria API Blockchain da ASCN dar-lhe-á acesso a dados on-chain e permitir-lhe-á contornar problemas de análise da UI.
Principais Ameaças:
Medidas Práticas Recomendadas:
As limitações e problemas técnicos: Ao automatizar com LLM, é preciso lembrar que a latência do LLM (que está entre 0,5 e 3 segundos) não é adequada para pedidos de alto volume e que se está limitado pelo tamanho do contexto (até agora, o GPT-4 tem um máximo aproximado de 128k tokens de tamanho de contexto; no entanto, é muito menos na prática). O DOM é por vezes bastante complicado, o que pode afetar a precisão com que os LLMs o interpretam. O custo de escalabilidade pode tornar-se muito significativo.
Recomendações:
A recolha de dados sem permissão, ou em violação das diretrizes regulamentadas, é ilegal e pode resultar em multas. É importante verificar o "robots.txt" e os termos de uso, e cumprir quaisquer atrasos de tempo e limites de pedidos. Isto não se destina a ser um incentivo para violar quaisquer regras; a responsabilidade final recai sobre o executor. Tenha em atenção que as informações aqui contidas não constituem aconselhamento jurídico.
Claro, a Automação GPT é executada em navegadores e navegadores dependentes de ferramentas, como Selenium, Puppeteer e Playwright. O Playwright a ser executado no Chromium é geralmente a opção mais estável para 95% das suas tarefas, enquanto o Firefox e o Safari são comparáveis, precisará de usar uma alternativa ao Puppeteer para automação móvel, como o Appium.
JavaScript/TypeScript deve ser usado para projetos Puppeteer e Playwright; enquanto Python é tipicamente usado para integrar com a API GPT e Selenium. C# e Java são usados em ambientes empresariais. Opções sem código também estão disponíveis.
| Funcionalidade | Automação Tradicional | Controlo GPT |
|---|---|---|
| Dependência do Seletor | Rígida (CSS, XPath) | Flexível (Semântica) |
| Adaptabilidade à Mudança | Alterações Manuais de Código | Interpretação Automática do DOM |
| Barreira de Entrada | Requer Programação | Sem Código e Linguagem Natural |
| Velocidade de Execução | Alta Velocidade, Sem Latência | Velocidade Média, Devido a Chamadas LLM |
| Custo | Baixo Custo, Ferramentas Gratuitas | Custo Médio/Alto devido a Chamadas de API |
| Tratamento de Exceções | Explicitamente Definido, Complexo | Tentativas Automatizadas com Alternativas |
A Automação de Navegadores com GPT e IA é um avanço substancial de processos de scripting frágeis e trabalhosos para métodos adaptativos que oferecem respostas flexíveis a interações inconsistentes do utilizador. O longo processo de resolução de problemas no Selenium (e a sua correção) foi substituído por um desenvolvimento acelerado de fluxos de trabalho acabados, construídos em menos de 10 minutos usando plataformas sem código. Desde o advento do GPT, vemos agora o equivalente a centenas de linhas de código a serem simplificadas para um único comando; antecipamos que em breve o GPT será reconhecido como um padrão para a automação. Outras inovações que estão ao virar da esquina incluem agentes multimodais, assistentes autónomos baseados em navegador e a combinação de dados de blockchain com contratos inteligentes. Com a assistência do GPT, deverá ser capaz de poupar dezenas de horas ou mais por mês; em breve, todo o negócio poderá ser efetivamente automatizado.
Todas as informações neste artigo são informações gerais e não substituem sugestões, conselhos ou recomendações relativas a decisões de investimento, legais ou financeiras. Uma compreensão completa das funções de cada plataforma e dos seus assistentes de IA associados é um pré-requisito para a utilização de um assistente de IA.