

Em 2024, o investimento em redes neuronais generativas está no seu ponto mais alto, com mais de 29 mil milhões de dólares em 2024. Os pedidos para a API DALL·E e Midjourney excedem cinco vezes o número de pedidos feitos em 2021. Os bots no Telegram tornaram-se, portanto, uma das formas simples de automatizar tarefas repetitivas. De acordo com o Telegram Analytics, mais de 68 por cento das pequenas empresas em toda a ex-CEI usam bots para serviço de apoio ao cliente, vendas, marketing e criação de conteúdo.
E talvez a melhor parte seja que muitas pessoas pensam que criar um bot que transforma texto em imagens é um grande desafio, mas com as ferramentas modernas sem código, pode levar apenas 15 a 20 minutos para construir um bot que o ajude a fazer exatamente isso! Não é necessária programação.
"Desenvolvemos um bot de criação de imagens que usamos para os nossos próprios propósitos — os designers poupam até 15h/semana em rascunhos rápidos usando esta ferramenta. Criámos tudo isto no ASCN.AI durante algumas noites, combinando a nossa API DALL·E como um Pedido HTTP e acionando o bot com o Telegram Trigger e criando um Agente de IA usando apenas formatação de texto em russo. Este bot pode ler o contexto, dar sugestões para melhorias nos prompts e enviar imagens de volta no chat imediatamente — novamente, sem ter que escrever qualquer código. Com a ajuda do editor visual, os profissionais de marketing podem facilmente modificar a lógica para futuras tarefas por conta própria."
Neste artigo, explicamos, passo a passo, como selecionar uma rede neuronal, obter um token de API, configurar as ligações do Telegram e criar geração automatizada de imagens usando Agentes de IA. Descobrirá como navegar por erros típicos, aproveitar as poupanças de subscrição e escalar o seu bot para se adequar a qualquer carga.

Em termos simples, um bot de Telegram é uma conta automatizada que pode ser controlada através da API de bot do Telegram. Considere o bot como um assistente virtual que age com base nos pedidos do utilizador, executa pedidos e envia mensagens, ficheiros ou imagens de volta. Um bot de Telegram é diferente de um chat regular, pois o bot completa tarefas configuradas por um programador sem qualquer intervenção humana.
Lista das principais funções de um bot de Telegram:
Um exemplo real de uma agência de marketing que utiliza um bot de Telegram para gerar imagens em vez de ter que esperar por aprovações de design diminuiu o tempo para criar gráficos de capa de redes sociais em quase 80%. As equipas de design agora concentram-se em projetos mais complexos, enquanto a geração rápida de imagens é alcançada instantaneamente.
Simples e eficaz!

O processo de geração de uma imagem usando IA baseia-se num tipo específico de modelo de aprendizagem de máquina; especificamente, "modelos de difusão" e "transformadores". Estes tipos de modelos são treinados numa quantidade muito grande de pares de dados "imagem-texto". O utilizador submete um prompt de texto e o modelo gerará uma imagem única em questão de segundos.
DALL·E (o modelo comercial da OpenAI), um modelo que está disponível como API, é conhecido por gerar imagens fotorrealistas e composições complexas, até uma resolução máxima de 1024x1024 pixels. Stable Diffusion é uma ferramenta de código aberto, executada localmente na máquina do utilizador, permitindo a personalização através de ajuste fino, mas requer uma placa gráfica (GPU) com um mínimo de 8GB VRAM e algum conhecimento de técnicas de aprendizagem de máquina. Midjourney é mais popular para a criação de estilo artístico e produção de arte conceptual. Midjourney está disponível como API e opera dentro da plataforma Discord, onde os subscritores pagam uma taxa de subscrição para a usar.
Para criar uma imagem com estes sistemas, o utilizador insere um prompt, que é decomposto e analisado pela IA, que identifica os principais parâmetros (palavras-chave) dados no prompt. A IA então sintetiza a imagem a partir da informação fornecida pelo prompt, adicionando níveis crescentes de detalhe.
Embora estas três ferramentas produzam diferentes níveis de qualidade artística, existem algumas ressalvas. O texto nas imagens tende a aparecer mal representado devido às traduções de prompt para imagem; como resultado, o texto é frequentemente difícil de ler (ou seja, não faz sentido). Também existem frequentemente problemas na geração de partes do corpo humano, como mãos e rostos, que aparecem deformadas ou desfiguradas no produto final. Como evidenciado pelo facto de que a qualidade das imagens geradas a partir de prompts detalhados é tipicamente muito melhor do que as geradas usando prompts vagos, a qualidade da geração de imagens melhorou nos últimos dois anos.
De acordo com o Stanford AI Index, as melhorias na arquitetura e o aumento do tamanho do conjunto de dados levaram a uma melhoria de 34% na precisão da geração de prompts complexos de 2022 a 2024 (com uma correspondente diminuição de artefactos).
DALL·E, Stable Diffusion e Midjourney, para citar apenas alguns, são algumas das APIs e Redes Neuronais mais populares disponíveis hoje e cada uma tem os seus prós e contras.
| API | Vantagem(ns) | Desvantagem(ns) | Custo/Taxas |
|---|---|---|---|
| DALL·E | Produz imagens fotorrealistas de alta qualidade a partir de prompts complexos e possui filtros incorporados. | Permite apenas 50 pedidos por minuto; opera em servidores OpenAI, o que pode levar à censura de conteúdo. | Os primeiros 50 créditos são gratuitos (pode criar um máximo de aproximadamente 50 imagens a 1024×1024); depois, o custo é de $0.02/imagem. |
| Stable Diffusion | Código aberto com flexibilidade para configurar e usar localmente. | Precisa de pelo menos uma GPU de 8GB, não é fácil de instalar e não há garantias de que o conteúdo seja adequado. | Gratuito se trabalhar localmente; o custo na API (Replicate) começa em $0.0023/imagem (512×512). |
| Midjourney | Oferece múltiplos estilos de arte gerada que são muito fáceis de gerar no Discord. | Não tem API aberta, subscrição mensal paga e pode ser colocado em fila para ter a sua imagem gerada. | $10–$60 por mês com um máximo de 10 imagens geradas. |
| Leonardo.AI | Projetado para ser usado na criação de ativos de jogos com uma velocidade de renderização muito rápida e um editor incorporado. | Não tem tantos estilos artísticos e tem limitações no seu plano gratuito (o que significa que terá mais opções para usar na subscrição paga). | Gratuito com um número limitado de imagens geradas; a subscrição Pro custa $12/mês. |
| Adobe Firefly | Projetado para permitir o uso seguro de imagens geradas para fins comerciais, pode integrar na sua conta Creative Cloud. | Requer subscrição, oferece menos estilos artísticos e limitações sobre o tipo de prompts que podem ser usados. | Começa em $54.99/mês com um limite no número de gerações que pode fazer. |
Se quiser apenas lançar um projeto comercial rápido, DALL·E faz sentido. Para experimentar tudo e mais alguma coisa, use Stable Diffusion; para peças artísticas, use Midjourney.
As APIs de Geração de Imagens permitem enviar pedidos a uma rede neuronal usando HTTP e devolverão um URL contendo as imagens geradas. Aqui está um exemplo do pedido que faria à OpenAI DALL·E:
POST https://api.openai.com/v1/images/generations
Headers:
Authorization: Bearer {API_KEY}
Content-Type: application/json
Body:
{
"prompt": "A futuristic city at sunset, cyberpunk style",
"n": 1,
"size": "1024x1024"
}
A resposta devolverá uma resposta JSON contendo o URL da imagem gerada. Também pode especificar parâmetros adicionais, incluindo quantas variações gostaria, a resolução das imagens geradas e a descrição das imagens.
APIs de terceiros são usadas para Stable Diffusion ou para executar o modelo localmente usando uma API REST e requerem experiência prévia com DevOps.
Antes de criar um bot de Telegram para geração de imagens, precisa de registar o bot e obter o seu token. Ao criar um bot de Telegram, não são necessárias competências de programação e o processo de registo é muito rápido.
Para criar o seu Bot de Telegram, siga estes passos:
Em resumo, a arquitetura do seu bot incluirá:
Deve garantir que lida com o tratamento de mensagens de erro, garantindo que define tempos limite e implementa o cache. O cache não só lhe poupará dinheiro, mas também ajudará a melhorar a fiabilidade do seu bot.
Existem plataformas sem código (por exemplo, ASCN.AI, n8n, Zapier) que lhe fornecem uma forma visual de criar fluxos de ação (Workflows) sem a necessidade de programação. Para as soluções mais complexas e escaláveis, pode programar com uma variedade de linguagens (Python, Node.js ou Go).
Não é assim tão difícil, certo?
Aqui está um exemplo de um programa Python simples usando a API DALL·E e Telegram:
import os
from telegram import Update
from telegram.ext import Updater, CommandHandler, MessageHandler, Filters, CallbackContext
import openai
TELEGRAM_TOKEN = os.getenv("TELEGRAM_BOT_TOKEN")
OPENAI_API_KEY = os.getenv("OPENAI_API_KEY")
openai.api_key = OPENAI_API_KEY
def start(update: Update, context: CallbackContext):
update.message.reply_text("Hello! The purpose of this bot is to take the user's input and generate an image based off of their input.")
A forma como fará isso será através das APIs DALL·E ou Stable Diffusion da OpenAI. Este bot funcionará ouvindo a mensagem de um utilizador (que conterá uma descrição do que ele quer que seja uma imagem), e quando vir essa mensagem, responderá com uma mensagem dizendo que está a gerar uma imagem e o utilizador deverá esperar ver a imagem em breve.
Um problema com o uso destes tipos de APIs é que existem limites para quantas vezes por minuto ou por dia pode usá-las para gerar imagens. Por exemplo, a API DALL·E da OpenAI tem um máximo de 50 pedidos por minuto para clientes que estão no plano pago e custa $0.02 por cada imagem gerada com um tamanho de 1024 pixels de largura por 1024 pixels de altura.
Se exceder o limite de pedidos do seu fornecedor de API, receberá uma resposta de erro de 429 (demasiados pedidos). Existem outros fornecedores de imagens semelhantes, como Stable Diffusion, e tendem a ter preços baixos (por exemplo, a API Stable Diffusion tem um custo de aproximadamente $0.0023 para imagens com um tamanho de 512 pixels por 512 pixels) e requerem uma base de subscrição e lista de espera, ou ambos.
Pode reduzir o número de pedidos que faz a estas APIs de geração de imagens através de métodos como:
Armazenar Tokens em Segurança: O Armazenamento Seguro de Tokens é conseguido através do uso de Variáveis de Ambiente Seguras e Segredos.
Registo de Pedidos para Fins de Auditoria.
Existem muitas plataformas "sem código" como ASCN.AI; n8n; Zapier, que lhe permitem construir um bot de forma totalmente visual. Para a maioria das funções de negócio, estas ferramentas funcionarão perfeitamente.
@ImageAI_bot dentro do DALL·E oferece 3 gerações de imagens gratuitas diariamente e atualmente oferece uma subscrição por cerca de $9.99 por mês. @midjourney_bot opera no Discord, com preços que variam de $10 a $60 mensais. @StableDiffusion_bot é gratuito, mas tem um desempenho e fiabilidade muito baixos. Se desenvolver o seu próprio bot, manterá o controlo total, poupará dinheiro em subscrições e adicionará as suas próprias funcionalidades personalizadas.
Use prompts descritivos detalhados, incluindo estilo desejado, iluminação, etc. Use prompts negativos. Use o comando /upscale para aumentar a resolução das fotos. Use vários bots/modelos diferentes para criar novas imagens.
Sim, pode editar imagens criadas anteriormente através de inpainting, criando variações de imagens existentes ou criando imagens a partir de outras imagens usando ControlNet no @flux_ai_bot ou @leonardo_ai_bot. Se a funcionalidade não for suportada, pode contar com editores de terceiros para corrigir imagens geradas.
As versões gratuitas oferecem gerações de imagens limitadas (5–15 imagens diárias) com uma resolução máxima de 1024×1024 e não incluem direitos comerciais. As subscrições pagas custam de $8 a $30 por mês e incluem uma licença comercial, upscaling para 4K e acesso à API. Criar um Bot Personalizado via ASCN.AI custa um mínimo de $29/mês mais uma taxa de API Gemini (aproximadamente $0.002–$0.005 por imagem gerada).