O que é
PolyAI é uma plataforma de voz AI corporativa que atende a própria ligação telefônica — reservar uma mesa, autenticar quem liga, processar um pagamento, remarcar uma consulta — em vez de empurrar o cliente para o chat. Fundada em Londres em 2017 por três pesquisadores de sistemas de diálogo de Cambridge, Nikola Mrkšić (CEO), Tsung-Hsien Wen e Pei-Hao Su, roda no próprio stack de voz em vez de costurar ASR e TTS de terceiros: o modelo de diálogo da casa, Raven, foi treinado com mais de um bilhão de conversas corporativas, com GPT-5, Claude e Gemini disponíveis como alternativas para a camada de raciocínio.
Levantou uma Série D de US$ 86 milhões em 15 de dezembro de 2025, co-liderada por Georgian, Hedosophia e Khosla Ventures, com participação da NVentures (da NVIDIA), Citi Ventures, Zendesk Ventures, Point72 Ventures, Sands Capital, Squarepoint Ventures e British Business Bank. O SiliconANGLE reportou a rodada a um valuation de US$ 750 milhões, contra US$ 500 milhões em maio de 2024, levando o total captado para além de US$ 200 milhões. A empresa reportou mais de 2.000 deploys em produção em mais de 100 empresas na época da rodada e, em maio de 2026, colocou seu alcance em 75 idiomas e 25 países. Entre os clientes citados estão Marriott, Caesars Entertainment, PG&E, UniCredit, Foot Locker, FedEx, Fogo de Chão, Howard Brown Health e Quicken.
Por que aparece nos stacks de CX e suporte
- Ele integra com os sistemas que a ligação é realmente sobre. Todo fornecedor de voz AI conecta no Salesforce e em alguma plataforma de CCaaS. O catálogo documentado da PolyAI vai além, até os sistemas operacionais pelos quais o cliente está ligando: Epic, athenaOne, ModMed, Cerner (Oracle Health) e Raintree em saúde; OpenTable, Tripleseat, HotSOS e Cendyn em hotelaria. Um agente que consegue ler um prontuário ou mover uma reserva faz um trabalho diferente de um que só consegue ler uma nota do CRM, e essa é a lista mais curta da categoria que cobre os dois casos.
- O modelo de serviço gerenciado não é mais a única porta de entrada. Ao longo de 2025 a crítica recorrente era que você não construía agentes PolyAI: o time da PolyAI construía. Isso mudou duas vezes em 2026. O Agent Development Kit, lançado em 22 de abril, é uma CLI e um pacote Python com desenvolvimento local apoiado em Git e um passo de deploy
poly push, então os agentes moram no seu repositório e passam pelo seu CI. Em 18 de maio a empresa abriu a plataforma para cadastro self-serve com os dois primeiros meses gratuitos, junto com o Poly Agent Builder, uma superfície de autoria em linguagem natural. - Ele controla o caminho do áudio, e lançou um modelo que mostra por quê. O Dialog-RSN-1, publicado em 30 de julho de 2026, é nativo de áudio: gestão de turnos, reconhecimento de fala, chamada de funções e geração de resposta rodam em um único modelo em vez de uma cadeia de quatro. A PolyAI reporta respostas abaixo de 300 ms em GPUs A100, corte de 37% na latência em um cliente de seguros e ganho relativo de 11% em contenção em um grupo nacional de restaurantes.
- Compliance vem no preço, não parafusado depois. SOC 2, HIPAA, GDPR e PCI DSS vêm de série segundo o fornecedor, com PCI Pal e Stripe disponíveis como rotas de pagamento gerenciadas — a razão pela qual os logos de saúde e utilities estão na lista.
- Os agentes podem chamar servidores MCP como ferramentas. A documentação de integrações cobre MCP para ferramentas próprias, então um serviço interno que você já expõe via MCP fica ao alcance do agente de voz sem um conector sob medida. Atenção à direção: isso permite que o agente use as suas ferramentas, não que você consulte a analytics da PolyAI a partir do Claude.
A realidade do preço
Nada publicado. A página de preços declara um único fato — o uso é cobrado por minuto — e encaminha qualquer outra pergunta para um demo. Não há tarifa publicada, nem mínimo, nem número de excedente, e não há camada gratuita além do trial self-serve de dois meses aberto em maio de 2026.
Análises de compra de terceiros colocam os contratos anuais a partir de cerca de US$ 150 mil, subindo com volume, concorrência, número de idiomas e profundidade de integração; trate isso como estimativa, não como cotação. As mesmas análises registram que telefonia, integração com CRM e trabalho de compliance normalmente chegam em uma fatura separada, então o número da plataforma não é o número do primeiro ano. O próprio estudo Total Economic Impact da Forrester encomendado pela PolyAI afirma ROI de 391% e economia média de US$ 10,3 milhões — pesquisa financiada pelo fornecedor, útil para um board deck e não para o seu modelo.
O que importa na operação é que um medidor por minuto acompanha o tempo médio de atendimento. Uma intenção que o agente resolve em 80 segundos custa um terço menos que a mesma intenção em 120 segundos com volume idêntico de ligações. Modele como minutos × taxa de contenção, e obtenha por escrito a tarifa por minuto, o mínimo anual, a tarifa de excedente e o rollover do saldo não usado antes de comparar com um medidor baseado em resultado.
Ideal para
Líderes corporativos de CX e de contact center em setores regulados e dominados pelo telefone — saúde, utilities, serviços financeiros, hotelaria e grupos multi-unidade de restaurantes e varejo — cujos clientes perguntam sobre um registro que vive no Epic, athenaOne, OpenTable ou HotSOS, e não no CRM. A faixa de melhor ROI fica acima de cerca de 500 mil minutos de voz por ano, onde alguns pontos de contenção pagam um compromisso de seis dígitos, e é a escolha mais forte da categoria quando a lista de integrações decide o projeto.
Descarte se o chat concentra a maior parte do seu volume de contatos, se o orçamento do primeiro ano não absorve um compromisso de seis dígitos, se você precisa de um preço publicado que dê para aprovar sem ciclo de compras, ou se nenhum dos seus sistemas de registro aparece no catálogo de integrações — nesse último caso você está comprando trabalho de API sob medida a tarifas de voz AI corporativa.
Contra as alternativas
Comece pelo que você já paga. Se você roda NICE CXone, Genesys ou Five9, a AI nativa deles é a incumbente e não adiciona fornecedor para fazer onboarding; fique com ela quando a contenção nas suas principais intenções passar do seu limite, o que costuma ser a resposta quando os motivos de ligação são roteamento e FAQ em vez de transações. Entre as plataformas de voz AI nativas, a Parloa é a mais comparável e a melhor capitalizada: Série D de US$ 350 milhões em janeiro de 2026 a um valuation de US$ 3 bilhões, mais de US$ 50 milhões de ARR e compliance DORA que a PolyAI não anuncia. Escolha Parloa se você é comprador de serviços financeiros na UE ou se seu contact center é terceirizado com Teleperformance, Concentrix ou Foundever, que já a implantam; escolha PolyAI quando o fator decisivo for um sistema de registro de saúde ou hotelaria.
O entrante que cresce mais rápido é a Sierra, com cerca de US$ 200 milhões de ARR em maio de 2026 — a escolha quando o agente precisa transacionar em chat e voz ao mesmo tempo e você aceita cobrança por resultado e um fornecedor maior para conseguir isso. A Decagon ganha quando o trabalho é desviar chat, a Ada quando você quer amplitude de canais e uma fatura desacoplada do desempenho do agente, e a Cresta quando você mantém agentes humanos e quer treiná-los em vez de substituí-los.
Se nenhuma encaixar, rode o trial self-serve contra suas três intenções de maior volume e mantenha humanos em todo o resto. Um agente de voz comprado antes de mapear essas intenções produz um caminho mais curto até a fila, não uma ligação resolvida.
Pontos de atenção
- O número de latência do anúncio pertence a um modelo que você talvez não receba. O Dialog-RSN-1 está em disponibilidade limitada e só em inglês; clientes existentes podem habilitá-lo e novos solicitam acesso antecipado. Tanto o dado de menos de 300 ms quanto o corte de 37% na latência vêm dele, enquanto um deploy multi-idioma roda na cadeia anterior. Proteção: nomeie no pedido de compra o modelo que vai servir, sua cobertura de idiomas e a data de disponibilidade, e faça o benchmark do piloto contra o modelo que realmente vai carregar seu tráfego, não contra o do post de lançamento.
- A cobrança por minuto te cobra a latência e um agente prolixo. O medidor que te protege de discutir o que conta como “resolução” te entrega a exposição oposta: respostas lentas e prompts longos aparecem ambos na fatura. Proteção: instrumente o tempo médio de atendimento por intenção desde a primeira semana contra sua linha de base humana, fixe a tarifa por minuto pela duração do contrato e escreva um trigger de revisão se esse tempo cruzar um limite nomeado, em vez de supor que o ajuste vai acontecer.
- O trial self-serve não é o produto corporativo, e o trabalho de integração é onde o dinheiro vai. Dois meses grátis com um e-mail exercita o Agent Builder, não um conector do Epic, uma rota SIP do Genesys ou um fluxo de pagamento em escopo PCI. Proteção: dimensione e cote o trabalho de integração e compliance como linha separada antes de assinar o contrato de plataforma, e obtenha confirmação escrita de quais conectores são produto e quais são desenvolvimento sob medida — as análises de terceiros concordam que essa é a fatura que surpreende os compradores.
- A receita declarada fica bem abaixo do valuation. As contas registradas no Reino Unido mostram US$ 15 milhões de receita no ano encerrado em 31 de janeiro de 2025, contra US$ 8,9 milhões, com prejuízo ampliando para US$ 26,6 milhões — diante de um valuation de US$ 750 milhões fixado naquele dezembro. A Deloitte a classificou como o negócio de AI de maior crescimento do Reino Unido em 2025, com 248% de crescimento em três anos, então a trajetória é real, mas uma empresa precificada para crescer empurra prazos multianuais e pisos de volume. Proteção: limite o primeiro prazo a um ano, peça o relatório SOC 2 Type II vigente e um BAA assinado antes de contratar quando houver PHI em escopo, e mantenha as definições dos seus agentes no seu próprio repositório Git via ADK — esse repositório é sua única saída barata, e vale confirmar no contrato que você o retém.