Conversation intelligence es el software que graba llamadas y reuniones de ventas, las transcribe y ejecuta análisis sobre todo el corpus de grabaciones, no solo sobre la llamada en la que estuviste. Ese análisis produce tres cosas que una grabación por sí sola no puede: detección de temas que puedes buscar en cada llamada que tu equipo haya tenido, señales de riesgo de negocio consolidadas en el pipeline y scorecards de coaching ligados a comportamientos concretos del rep. La grabación es el insumo. El análisis entre llamadas es el producto, y es la única parte por la que vale la pena pagar precios enterprise.
No es un tomador de notas con IA. Fathom, Granola y Otter capturan y resumen una reunión para quienes estuvieron en ella, y el artefacto termina en el límite de esa reunión. Conversation intelligence responde preguntas que solo existen a lo largo de cientos de llamadas: cuántas veces los reps mencionaron el nuevo pricing del competidor el trimestre pasado y qué pasó con esos negocios. Tampoco es revenue intelligence — los datos de conversación son un insumo del forecast, no el forecast — ni es speech analytics de contact center, que puntúa interacciones de soporte contra una rúbrica de QA y cumplimiento en lugar de contra el avance del negocio.
Las cuatro capas
Captura y transcripción. Un bot entra desde la invitación de calendario, o el proveedor captura a través de la API de la plataforma de videoconferencia sin bot. La diarización separa la transcripción por participante. Esta capa es casi commodity: todos los proveedores de la categoría la resuelven, y no es donde está la diferencia de precio.
Detección de temas y trackers. Aquí es donde una grabadora se convierte en conversation intelligence. Gong lo divide en dos mecanismos: los keyword trackers hacen match con el término literal, mientras que los smart trackers son modelos que detectan el concepto sin importar las palabras, de modo que «¿es lo mejor que puedes hacer?» se registra como una petición de descuento sin que aparezca la palabra descuento (Gong Help Center). La distinción importa al comprar, porque una implementación de solo keywords se ve idéntica en una demo y se pierde la mayor parte de lo que debería captar.
Riesgo de negocio. La plataforma lee señales de comportamiento en la conversación y en el registro de actividad — sin próximo paso acordado, engagement con un solo contacto, un comprador que se quedó en silencio, un competidor mencionado tarde en el ciclo, una etapa estancada — y las expone contra el pipeline abierto, no contra llamadas individuales.
Scorecards de coaching. Un manager puntúa una llamada contra una rúbrica y las puntuaciones se agregan por rep, equipo y pregunta. La IA ya las completa: los scorecards de revisión automática de Gong revisan cada llamada que cumple un filtro, con un techo de 90 días hacia atrás, disponibles para equipos en sus planes Enable Essentials o Enable (Gong Help Center).
Cuánto cuesta
Dos formas de pricing, y confundirlas es como se desvía un presupuesto.
Los proveedores mid-market publican un precio por asiento que excluye el análisis. Avoma lista Startup a 19 USD por usuario al mes en anual, Organization a 24 USD y Enterprise a 39 USD con mínimo de 10 asientos, y luego vende Conversation Intelligence como add-on de 29 USD por asiento (35 USD facturado mensual), con Revenue Intelligence otros 29 USD (pricing de Avoma, verificado el 19 de agosto de 2026). Un rep que necesita las capas de coaching y de negocio cuesta entre 48 y 77 USD por asiento, no 19. Revisa cada cotización de esta categoría buscando la misma división.
La conversation intelligence enterprise se cotiza a puerta cerrada. Los datos de benchmark de Vendr sitúan el contrato mediano de Gong en 54.900 USD al año sobre 593 compras registradas, con un rango observado de 11.184 a 204.033 USD (marketplace de Vendr, última actualización marzo de 2026). Pide la cotización desglosada en platform fee y licencias por asiento antes de compararla con nada, y pide por escrito cuál es el incremento en la renovación.
Qué tan precisa es, de verdad
Hay dos preguntas de precisión y los compradores suelen hacer solo la primera.
La precisión de transcripción es medible y está mayormente resuelta. Una comparación revisada por pares de 11 servicios de ASR sobre audio de clases en inglés midió tasas de error de palabra entre 2,9 por ciento (Whisper large-v2) y 20,1 por ciento (Google), con un promedio de 7,0 por ciento, y de 10,2 por ciento para hablantes no nativos de inglés frente a 7,0 por ciento para nativos (Measuring the Accuracy of Automatic Speech Recognition Solutions). El audio de una clase es un solo hablante con un micrófono decente. Una llamada de cuatro personas con interrupciones y micrófono de laptop es más difícil, así que trata cualquier cifra de precisión del proveedor como una afirmación sobre el caso fácil y pruébalo con tus propias grabaciones, ponderando los acentos y el vocabulario de producto que tu equipo realmente usa.
La precisión del análisis es la que cuesta dinero, y la documentación del proveedor lo dice en voz alta. La propia página de Gong sobre revisión automática de scorecards afirma que «a veces, la IA produce resultados distintos ante entradas idénticas», y lo describe como comportamiento esperado. Una puntuación de rúbrica que cambia entre ejecuciones sobre la misma llamada no puede ser el insumo de una conversación de desempeño sin que un humano la confirme. Pide a cada proveedor que puntúe las mismas 20 llamadas dos veces y te muestre la dispersión.
El bloqueo del despliegue es el consentimiento, no el presupuesto
Grabar una llamada en un estado de EE. UU. con consentimiento de todas las partes, sin el consentimiento de cada participante, es una cuestión de wiretap, no una preferencia de política interna. Alrededor de una docena de estados exigen consentimiento de todas las partes, y las reglas no son uniformes dentro de ellos: Connecticut trata las llamadas telefónicas distinto de las conversaciones presenciales, y Oregon trata las comunicaciones orales distinto de las electrónicas. Para un equipo de ventas distribuido, el supuesto seguro es que cada semana alguna llamada tiene un participante en uno de esos estados.
El caso de prueba vivo es In re Otter.AI Privacy Litigation, No. 5:25-cv-06911 (N.D. Cal.), consolidado a partir de demandas presentadas desde agosto de 2025, que alega que el tomador de notas OtterPilot grabó reuniones solo con el consentimiento del anfitrión, bajo la Wiretap Act federal y la California Invasion of Privacy Act. La jueza Eumi K. Lee escuchó la moción de desestimación el 20 de mayo de 2026 y no había resuelto al 19 de agosto de 2026, así que ningún tribunal ha declarado todavía estas prácticas lícitas ni ilícitas. Tres guardas no dependen del resultado: activa el aviso de grabación previo a la reunión del proveedor, da a los participantes una vía de rechazo que realmente detenga la captura y no solo silencie el resumen, y lee la cláusula que gobierna si tus datos de llamadas entrenan los modelos del proveedor.
Qué cambió en 2026
Gong anunció Gong Enable el 25 de febrero de 2026 y el Gong Revenue Harness el 24 de junio de 2026: una capa de ejecución agéntica construida sobre su Agent Studio y su soporte de MCP, con Custom Agents que RevOps puede configurar sin ingeniería (nota de prensa de Gong). ZoomInfo expone los datos de llamadas de Chorus mediante una herramienta conversation_intelligence en su MCP server, de modo que un agente puede razonar sobre llamadas, emails y transcripciones indexadas.
La dirección es la misma en todos los proveedores: el corpus de llamadas se está convirtiendo en una fuente de datos consultable por agentes en lugar de una biblioteca que los managers visitan para ver clips. Eso mueve la pregunta de compra desde quién tiene la transcripción más limpia hacia quién dejará que tus agentes lean el corpus, y bajo qué scopes: el gemelo de lectura de la decisión en Acceso de escritura MCP al CRM.
Errores comunes
- Comprarlo como grabadora y nunca configurar trackers. La plataforma graba, nadie busca y la renovación llega con datos de uso que justifican bajar de plan. Guarda: lanza cinco trackers en la primera semana atados a negocios vivos — competidor principal, objeción de precio, revisión de seguridad, salida del champion, procurement — y revísalos en la reunión semanal de pipeline.
- Trackers configurados una vez y nunca ajustados. Guarda: revisa las tasas de disparo cada trimestre. Un tracker que se dispara en menos del 1 por ciento de las llamadas no está midiendo nada; uno que se dispara en más del 60 por ciento mide el lenguaje que todos usan igual.
- Scorecards conectados a la gestión del desempeño antes de calibrarlos. Guarda: puntúa la misma muestra de 20 llamadas con dos managers y con la IA, y publica la tasa de coincidencia antes de que ninguna puntuación llegue a una evaluación. Donde no coinciden, el problema es la rúbrica, no el rep.
- Medir la adopción por tasa de grabación. Todas las llamadas se graban desde el día uno; ese número prueba que el bot funciona, no que alguien aprendió algo. Guarda: mide búsquedas ejecutadas y clips compartidos por manager por semana.
- Sin política de retención ni de exclusión. Las grabaciones de negociaciones de precio, desvinculaciones y discusiones legales quedan en el corpus indefinidamente y se vuelven exhibibles en litigio. Guarda: fija una ventana de retención y excluye tipos de reunión por palabra clave del calendario en el momento de la captura.
Relacionado
- Venta basada en señales — las plays que los datos de conversación deberían disparar
- Categorías de forecast explicadas — dónde aterrizan las señales de riesgo en el forecast
- Interview intelligence — la misma tecnología aplicada a contratación, con otra rúbrica y otro regulador
- GTM context layer — en qué están convirtiendo los proveedores el corpus de llamadas
- AE rep coaching skill — un Claude Skill para convertir el análisis de llamadas en un plan de coaching