

Os assistentes de voz estão a evoluir a um ritmo impressionante. Empresas que anteriormente passavam meses a procurar e a formar operadores estão agora a implementar bots num único fim de semana. Tais soluções poupam milhares de horas de trabalho rotineiro. Nós próprios passámos por isso — desde a indexação de nós de blockchain e a automação de arbitragem de criptomoedas até à construção de um ecossistema inteiro de produtos que operam quase sem programadores. Agora, estou pronto para partilhar como pode construir o seu próprio assistente de voz do zero: que tecnologias escolher, como evitar a falência e como poupar tempo de verdade.
“Passámos dois anos a indexar nós e a desenvolver modelos de sentimento para fornecer respostas baseadas em dados de blockchain em tempo real, em vez de simples pesquisas na web. GPT e outros modelos LLM não funcionam diretamente com a blockchain, o que torna a nossa abordagem única na análise de criptomoedas.”
Um assistente de voz é um programa que o ouve, o compreende via PNL, reconhece a fala através de RAA e responde com uma voz via TTS. Desempenha funções que vão desde lembretes simples até análises complexas.
Um bot de voz é uma versão especializada. É adaptado a uma tarefa específica: aceitar pedidos, suporte técnico ou reservas. Opera com base em scripts ou numa combinação de scripts e PNL.
A diferença é simples. Um assistente que atua como funcionário de banco é capaz, surpreendentemente, de responder a uma ampla variedade de pedidos: verificar saldos, transferir dinheiro ou fornecer consultas de empréstimos. Um bot para o mesmo banco pode apenas aceitar pedidos de empréstimos. E é só isso.

Na ASCN.AI, os nossos agentes de voz automatizam a análise de notícias, a análise de tokens e a geração de relatórios. Um cliente faz uma pergunta por voz no Telegram — o agente extrai dados de nós on-chain, agregadores de notícias e redes sociais, fornecendo uma resposta estruturada em 10 segundos. Isso poupa a um analista até 40 horas de trabalho manual por mês.
PNL (Processamento de Linguagem Natural) — são os algoritmos mais avançados que permitem ao sistema compreender a linguagem humana. Por exemplo, o GPT-4 é construído sobre transformadores: analisa todas as palavras simultaneamente, em vez de sequencialmente. Portanto, pode processar consultas de várias etapas e gerar respostas relevantes.
RAA (Reconhecimento Automático de Fala) — conversão de som em texto. Os sistemas populares incluem OpenAI Whisper, Google Cloud Speech-to-Text e Yandex SpeechKit. O Whisper foi treinado em 680.000 horas de áudio em 97 idiomas; a sua precisão de reconhecimento excede 90% mesmo em ambientes ruidosos (OpenAI, 2022).
TTS (Text-To-Speech) — conversão de texto em fala. Os modelos mais recentes (ElevenLabs, Google Cloud TTS, Amazon Polly) reproduzem vozes semelhantes às humanas com entonação e pausas adequadas. Uma das tendências atuais — clonagem de voz a partir de uma gravação de 10 minutos — permite a criação de assistentes personalizados.
Automação de Voz combina todos os componentes: RAA ouve, PNL toma decisões e TTS responde — tudo sem intervenção do operador. Em suma, tais bots existem em centros de atendimento; eles assumem o problema do cliente, encontram a resposta usando GPT, falam-na ao cliente e guardam os dados num CRM.
| Tecnologia | Tarefa | Sistemas de Exemplo | Precisão / Qualidade |
|---|---|---|---|
| RAA | Reconhecimento de Fala | Whisper, Google STT, Yandex SpeechKit | 90-95% de precisão |
| PNL | Compreensão de Texto | GPT-4, Claude, LLaMA | Contexto até 128k tokens |
| TTS | Síntese de Fala | ElevenLabs, Google TTS, Amazon Polly | Naturalidade 4.5/5 |
| Automação de Voz | Ciclo de Processamento Completo | ASCN.AI, n8n + GPT | Redução de tempo até 70% |
Como base tecnológica, a ASCN.AI utiliza várias ferramentas: Whisper para reconhecimento, GPT-4 para gerar respostas e ElevenLabs para dar voz aos resultados. Um utilizador do Telegram pergunta: “Por que o preço do token XYZ aumentou?” — o agente recolhe informações, extrai dados de nós on-chain, verifica canais do Telegram e forma uma resposta de voz com base num conjunto de consultas em apenas 30 segundos. Isso substitui 20–30 minutos de pesquisa manual.
Um assistente de voz consiste em três módulos, cada um executando a sua tarefa sequencial:
Todo o processo geralmente leva entre 5 e 15 segundos, dependendo da carga da API e da complexidade da consulta.
O fluxo de trabalho é o seguinte:
Uma consulta como “Dê-me o sentimento para o Bitcoin nas últimas 24 horas” é processada em 10 segundos, em vez de 30–40 minutos de trabalho manual de um analista.
GPT (Generative Pre-trained Transformer) é um modelo de linguagem treinado em milhares de milhões de textos. É capaz de criar texto coerente, compreendendo o contexto da consulta.
Nos bots de voz, o GPT desempenha várias funções:
Exemplos:
Os sistemas TTS modernos baseados em redes neuronais (WaveNet, Tacotron, VITS) produzem fala que é quase indistinguível da humana. O texto passa por uma decomposição fonémica, é analisado para parâmetros de entonação e a onda sonora é sintetizada.
| Plataforma | Qualidade | Velocidade de Síntese | Idiomas | Custo | Clonagem de Voz |
|---|---|---|---|---|---|
| ElevenLabs | 4.7/5 | 1-2 seg por frase | 29 idiomas | $5–99/mês | Sim, via gravação de 10 min |
| Google Cloud TTS | 4.3/5 | 1–3 seg | 40+ | $4 por 1M de caracteres | Não |
| Amazon Polly | 4.0/5 | 2–4 seg | 30+ | $4 por 1M de caracteres | Não |
| Yandex SpeechKit | 4.2/5 (Russo) | 1–2 seg | 3 | ₽80 por hora de áudio | Não |
A escolha depende do projeto. Para um projeto em russo, Yandex SpeechKit ou ElevenLabs é adequado. Para tarefas multilingues, Google Cloud TTS ou ElevenLabs é preferível. Se for necessária personalização de voz, ElevenLabs com a sua funcionalidade de clonagem é a única opção. Na ASCN.AI, usamos ElevenLabs para vocalizar relatórios analíticos com entonação natural.
Antes de criar um assistente, deve abordar três tarefas: reconhecimento de fala (RAA), geração de resposta (PNL) e síntese de fala (TTS). Pode usar ferramentas separadas ou stacks prontas.
Opções básicas:
As recomendações para estas tarefas são as seguintes:
No caso da ASCN.AI, o tempo médio de processamento de consultas é de 10 segundos, com um custo de aproximadamente $0.05 — $0.08 por pergunta.
O processo pode ser estruturado como um pipeline: Áudio → RAA → Texto → GPT → Resposta → TTS → Áudio → Utilizador.
Um exemplo simples em Python usando a API da OpenAI:
import openai
openai.api_key = "YOUR_API_KEY"
# Speech recognition
audio_file = open("user_voice.mp3", "rb")
transcript = openai.Audio.transcribe("whisper-1", audio_file)
user_text = transcript["text"]
# Response generation
response = openai.ChatCompletion.create(
model="gpt-4-turbo",
messages=[
{"role": "system", "content": "You are a voice assistant."},
{"role": "user", "content": user_text}
]
)
assistant_text = response["choices"][0]["message"]["content"]
# Speech synthesis
tts_response = openai.Audio.create_speech(
model="tts-1",
voice="alloy",
input=assistant_text
)
with open("assistant_voice.mp3", "wb") as f:
f.write(tts_response["audio"])
Para aqueles que não estão interessados em programação, existem serviços sem código como ASCN.AI ou n8n — onde um fluxo de trabalho pronto de blocos (Telegram, Whisper ASR, GPT-4, ElevenLabs TTS) pode ser montado em 20–30 minutos sem uma única linha de código. Então, tudo o que precisamos fazer é escrever um pouco de código para um bot do Telegram que utiliza as capacidades do GPT. Primeiro, precisamos criar o próprio bot usando @BotFather, e depois instalar as bibliotecas:
pip install python-telegram-bot openai elevenlabs
O meu código mínimo:
import openai
from telegram import Update
from telegram.ext import Updater, MessageHandler, Filters, CallbackContext
from elevenlabs import generate, set_api_key
openai.api_key = "YOUR_OPENAI_KEY"
set_api_key("YOUR_ELEVENLABS_KEY")
TELEGRAM_TOKEN = "YOUR_TELEGRAM_TOKEN"
def handle_voice(update: Update, context: CallbackContext):
voice = update.message.voice.get_file()
voice.download("user_voice.ogg")
with open("user_voice.ogg", "rb") as audio:
transcript = openai.Audio.transcribe("whisper-1", audio)
user_text = transcript["text"]
response = openai.ChatCompletion.create(
model="gpt-4-turbo",
messages=[
{"role": "system", "content": "You are a crypto market analyst. Respond briefly."},
{"role": "user", "content": user_text}
]
)
assistant_text = response["choices"][0]["message"]["content"]
audio_data = generate(text=assistant_text, voice="Antoni")
with open("assistant_voice.mp3", "wb") as f:
f.write(audio_data)
update.message.reply_voice(voice=open("assistant_voice.mp3", "rb"))
updater = Updater(TELEGRAM_TOKEN)
updater.dispatcher.add_handler(MessageHandler(Filters.voice, handle_voice))
updater.start_polling()
updater.idle()
Cada pedido é processado em 10–15 segundos — em vez de procurar por horas, os traders simplesmente perguntam e obtêm uma resposta.
A automação de voz já está a transformar tarefas rotineiras — automatizando até 70% das tarefas repetitivas.
Uma empresa de TI recebia até quinhentas chamadas por dia, 60% das quais eram perguntas repetitivas. Um bot de voz baseado em GPT, Whisper e ElevenLabs reduziu o tempo médio de atendimento de 5 minutos para 1 minuto, diminuiu a carga do operador em 65% e poupou 120 horas por mês.
Os traders passam 30-60 minutos por dia a analisar notícias e dados on-chain. O nosso agente de voz no Telegram recolhe e vocaliza resumos para tokens em 30 segundos. Isso poupa até 40 horas por mês em análises. Os valores médios relatados pelos clientes após a implementação indicam que a rentabilidade aumentou em 15-20%.
Mais sobre o caso ASCN.AI durante a queda da Falcon Finance
Uma cadeia de restaurantes tinha cerca de 200 chamadas por dia. A aplicação de um bot de voz implementado usando Yandex SpeechKit e GPT-4 não exigiu intervenção humana em 90% das chamadas, reduziu a perda de pedidos de 15% para 2% e aumentou a receita em 8%.
Os investimentos são recuperados em 2–6 meses — particularmente notável no suporte ao cliente, comércio, análise e RH.
Na ASCN.AI, uma sessão pode consistir em até 20 mensagens — mantendo um contexto coerente no diálogo.
Na ASCN.AI, o custo de um pedido é de cerca de $0.06; o processamento leva 10 segundos. A otimização do prompt permitiu-nos poupar um quarto do orçamento sem sacrificar a qualidade.
Leva apenas 2–4 horas para desenvolver um protótipo básico usando a API da OpenAI. Uma versão de produção com integração, registo e segurança leva 1–2 semanas. Em plataformas sem código (ASCN.AI, n8n), pode lançar em 1–2 dias sem qualquer programação.
Para soluções sem código — não. Para cenários complexos e integrações personalizadas, o conhecimento básico de Python é útil. No entanto, os construtores sem código permitem montar um assistente poderoso visualmente, sem código.
O RAA perde precisão em ambientes ruidosos — até 70–80%, enquanto em ambientes silenciosos atinge 95%. O GPT às vezes gera respostas imprecisas — as chamadas alucinações. O TTS nem sempre transmite perfeitamente a entonação complexa. Existem também limites de pedidos e potenciais atrasos durante alta carga da API.
Use HTTPS, elimine o áudio após o processamento, anonimize os registos, mantenha as chaves seguras, cumpra as leis de dados pessoais e use sistemas on-premise para informações altamente sensíveis.
As informações neste artigo são para fins informativos gerais e não substituem aconselhamento de investimento, legal ou de segurança. O uso de assistentes de IA requer uma abordagem consciente e uma compreensão das funções de plataformas específicas.