Qué es
PolyAI es una plataforma de voz AI empresarial que atiende la llamada telefónica en sí —reservar una mesa, autenticar a quien llama, cobrar un pago, reprogramar una cita— en lugar de derivar a quien llama hacia el chat. Fundada en Londres en 2017 por tres investigadores de sistemas de diálogo de Cambridge, Nikola Mrkšić (CEO), Tsung-Hsien Wen y Pei-Hao Su, funciona sobre su propio stack de voz en vez de unir ASR y TTS de terceros: el modelo de diálogo de la casa, Raven, está entrenado con más de mil millones de conversaciones empresariales, con GPT-5, Claude y Gemini disponibles como alternativas para la capa de razonamiento.
Levantó una Serie D de 86 millones de dólares el 15 de diciembre de 2025, co-liderada por Georgian, Hedosophia y Khosla Ventures, con participación de NVentures (de NVIDIA), Citi Ventures, Zendesk Ventures, Point72 Ventures, Sands Capital, Squarepoint Ventures y el British Business Bank. SiliconANGLE reportó la ronda a una valuación de 750 millones de dólares, desde 500 millones en mayo de 2024, llevando el financiamiento total por encima de los 200 millones. La compañía reportó más de 2.000 implementaciones en producción en más de 100 empresas al momento de la ronda, y para mayo de 2026 situó su alcance en 75 idiomas y 25 países. Entre los clientes nombrados están Marriott, Caesars Entertainment, PG&E, UniCredit, Foot Locker, FedEx, Fogo de Chão, Howard Brown Health y Quicken.
Por qué aparece en los stacks de CX y soporte
- Se integra con los sistemas sobre los que realmente trata la llamada. Todo proveedor de voz AI se conecta a Salesforce y a alguna plataforma de CCaaS. El catálogo documentado de PolyAI va más allá, hasta los sistemas operativos por los que llama el cliente: Epic, athenaOne, ModMed, Cerner (Oracle Health) y Raintree en salud; OpenTable, Tripleseat, HotSOS y Cendyn en hotelería. Un agente que puede leer una historia clínica o mover una reserva hace un trabajo distinto al de uno que solo puede leer una nota del CRM, y esta es la lista más corta de la categoría que cubre ambos casos.
- El modelo de servicio gestionado ya no es la única puerta de entrada. Durante 2025 la crítica constante era que los agentes de PolyAI no los construías tú: los construía el equipo de PolyAI. Eso cambió dos veces en 2026. El Agent Development Kit, lanzado el 22 de abril, es una CLI y un paquete de Python con desarrollo local respaldado por Git y un paso de despliegue
poly push, de modo que los agentes viven en tu repositorio y pasan por tu CI. El 18 de mayo la compañía abrió la plataforma a registro self-serve con los primeros dos meses gratis, junto con Poly Agent Builder, una superficie de autoría en lenguaje natural. - Controla la ruta del audio, y lanzó un modelo que demuestra por qué. Dialog-RSN-1, publicado el 30 de julio de 2026, es nativo de audio: el manejo de turnos, el reconocimiento de voz, las llamadas a funciones y la generación de respuestas corren en un solo modelo en vez de en una cadena de cuatro. PolyAI reporta respuestas por debajo de 300 ms en GPU A100, una reducción de latencia del 37% en un cliente de seguros y una mejora relativa del 11% en contención en un grupo restaurantero nacional.
- El cumplimiento viene incluido en el precio, no atornillado después. SOC 2, HIPAA, GDPR y PCI DSS vienen de serie según el proveedor, con PCI Pal y Stripe disponibles como rutas de pago gestionadas — la razón por la que los logos de salud y servicios públicos están en la lista.
- Los agentes pueden llamar servidores MCP como herramientas. La documentación de integraciones cubre MCP para herramientas propias, así que un servicio interno que ya expones vía MCP queda al alcance del agente de voz sin un conector a medida. Ojo con la dirección: esto permite que el agente use tus herramientas, no que tú consultes la analítica de PolyAI desde Claude.
La realidad del precio
Nada publicado. La página de precios declara un solo hecho —el uso se factura por minuto— y deriva cualquier otra pregunta a un demo. No hay tarifa publicada, ni mínimo, ni cifra de excedente, y no hay capa gratuita más allá de la prueba self-serve de dos meses abierta en mayo de 2026.
Análisis de compradores de terceros sitúan los contratos anuales a partir de unos 150.000 dólares, subiendo con el volumen, la concurrencia, la cantidad de idiomas y la profundidad de integración; tómalo como estimación, no como cotización. Los mismos análisis señalan que la telefonía, la integración con el CRM y el trabajo de cumplimiento suelen llegar en una factura aparte, así que el número de la plataforma no es el número del primer año. El propio estudio Total Economic Impact de Forrester encargado por PolyAI afirma un ROI del 391% y un ahorro promedio de 10,3 millones de dólares — investigación financiada por el proveedor, útil para una presentación al consejo y no para tu modelo.
Lo que importa en la operación es que un medidor por minuto sigue el tiempo medio de gestión. Una intención que el agente resuelve en 80 segundos cuesta un tercio menos que la misma intención en 120 segundos con idéntico volumen de llamadas. Modélalo como minutos × tasa de contención, y consigue por escrito la tarifa por minuto, el mínimo anual, la tarifa de excedente y el arrastre del faltante antes de compararlo con un medidor basado en resultados.
Ideal para
Líderes empresariales de CX y de contact center en industrias reguladas y dominadas por el teléfono —salud, servicios públicos, servicios financieros, hotelería y grupos multisitio de restaurantes y retail— cuyos clientes preguntan por un registro que vive en Epic, athenaOne, OpenTable o HotSOS y no en el CRM. La banda de mejor ROI está por encima de unos 500.000 minutos de voz anuales, donde unos pocos puntos de contención pagan un compromiso de seis cifras, y es la opción más fuerte de la categoría cuando la lista de integraciones decide el proyecto.
Descártalo si el chat concentra la mayor parte de tu volumen de contactos, si tu presupuesto del primer año no puede absorber un compromiso de seis cifras, si necesitas un precio publicado que puedas aprobar sin un ciclo de compras, o si ninguno de tus sistemas de registro aparece en el catálogo de integraciones — en ese último caso estás comprando trabajo de API a medida a tarifas de voz AI empresarial.
Frente a las alternativas
Empieza por lo que ya pagas. Si operas NICE CXone, Genesys o Five9, su AI nativa es el titular y no agrega un proveedor que onboardear; tómala cuando su contención en tus intenciones principales alcance tu umbral, que suele ser la respuesta cuando tus motivos de llamada son enrutamiento y FAQ más que transacciones. Entre las plataformas de voz AI nativas, Parloa es la más comparable y la mejor capitalizada: una Serie D de 350 millones de dólares en enero de 2026 a una valuación de 3.000 millones, más de 50 millones de ARR y cumplimiento DORA que PolyAI no anuncia. Elige Parloa si eres un comprador de servicios financieros de la UE o si tu contact center está tercerizado con Teleperformance, Concentrix o Foundever, que ya lo despliegan; elige PolyAI cuando el factor decisivo sea un sistema de registro de salud u hotelería.
El entrante de mayor crecimiento es Sierra, con cerca de 200 millones de ARR para mayo de 2026 — la opción cuando el agente debe transaccionar en chat y voz a la vez y aceptas facturación por resultados y un proveedor más grande para conseguirlo. Decagon gana cuando el trabajo es desviar chat, Ada cuando quieres amplitud de canales y una factura desacoplada del desempeño del agente, y Cresta cuando conservas agentes humanos y quieres entrenarlos en vez de reemplazarlos.
Si ninguno encaja, corre la prueba self-serve contra tus tres intenciones de mayor volumen y deja humanos en todo lo demás. Un agente de voz comprado antes de mapear esas intenciones produce un camino más corto a la cola, no una llamada resuelta.
Puntos de cuidado
- La cifra estrella de latencia pertenece a un modelo que quizá no recibas. Dialog-RSN-1 está en disponibilidad limitada y solo en inglés; los clientes existentes pueden activarlo y los nuevos solicitan acceso temprano. Tanto el dato de menos de 300 ms como la reducción de latencia del 37% provienen de él, mientras una implementación multiidioma corre sobre la cadena anterior. Guarda: nombra en la orden de compra el modelo que servirá, su cobertura de idiomas y su fecha de disponibilidad, y haz el benchmark del piloto contra el modelo que realmente cargará tu tráfico, no contra el del anuncio.
- La facturación por minuto te cobra la latencia y un agente verborrágico. El medidor que te protege de discutir qué cuenta como “resolución” te entrega la exposición opuesta: las respuestas lentas y los prompts largos aparecen ambos en la factura. Guarda: instrumenta el tiempo medio de gestión por intención desde la primera semana contra tu línea base humana, fija la tarifa por minuto por la duración del contrato y escribe un disparador de revisión si ese tiempo cruza un umbral nombrado, en vez de suponer que el ajuste ocurrirá.
- La prueba self-serve no es el producto empresarial, y el trabajo de integración es donde se va el dinero. Dos meses gratis con un correo ejercita Agent Builder, no un conector de Epic, una ruta SIP de Genesys ni un flujo de pago en alcance PCI. Guarda: dimensiona y cotiza el trabajo de integración y cumplimiento como una línea aparte antes de firmar el contrato de plataforma, y consigue confirmación escrita de qué conectores son producto y cuáles son desarrollo a medida — los análisis de terceros coinciden en que esa es la factura que sorprende a los compradores.
- Los ingresos declarados quedan muy por debajo de la valuación. Las cuentas presentadas en el Reino Unido muestran 15 millones de dólares de ingresos para el año cerrado el 31 de enero de 2025, desde 8,9 millones, con pérdidas que se amplían a 26,6 millones — frente a una valuación de 750 millones fijada ese diciembre. Deloitte la ubicó como el negocio de AI de mayor crecimiento del Reino Unido en 2025 con un 248% de crecimiento a tres años, así que la trayectoria es real, pero una compañía valuada para crecer empuja plazos multianuales y pisos de volumen. Guarda: limita el primer plazo a un año, pide el informe SOC 2 Type II vigente y un BAA firmado antes de contratar cuando haya PHI en alcance, y conserva las definiciones de tus agentes en tu propio repositorio Git vía el ADK — ese repositorio es tu única salida barata, y vale confirmar en el acuerdo que lo retienes.