ooligo
STACK

Support quality assurance stack — avaliando as resoluções que você paga

Uma organização de suporte cobrada por verified resolution que precisa que a nota, a amostra e o dossiê de disputa venham de outro lugar que não o fornecedor que emite a fatura.

Dificuldade
intermediário
Ferramentas
5
Customer Success

A stack

Em 26 de março de 2026, a Zendesk fechou a aquisição da Forethought. Dois meses antes ela já havia dividido os resultados automatizados em três níveis — assisted escalation, contained resolution e verified resolution, o único que consome sua cota — com o veredito produzido por um LLM depois de uma janela de 72 horas sem retorno do cliente. Junte os dois fatos e uma única empresa vende o agente de AI, define o que conta como resolução, roda o modelo que decide se a definição foi cumprida, emite a fatura e vende o produto de quality assurance que avalia o arranjo inteiro.

Isso não é acusação de má-fé. É a descrição de um problema de medição. Este stack é a camada de auditoria: pontua cada conversa, amostra as que têm mais chance de estarem erradas, mantém um livro de reconciliação que o fornecedor do agente não escreveu e transforma a diferença entre a nota da máquina e a nota do humano em uma decisão de calibração em vez de uma discussão.

O formato

  • Zendesk é o sistema de registro e o medidor. Suite Team custa $55 e Suite Professional $115 por agente por mês pago anualmente. As automated resolutions vêm incluídas a 5, 10 ou 15 por agente por mês conforme o plano, com teto de 10.000 por ano, e depois são cobradas a $1,50 comprometido ou $2,00 pay-as-you-go. Todo número da sua disputa precisa estar amarrado a um conversation ID que mora aqui.
  • Decagon ou Fin (Intercom) é a parte avaliada. Seja qual for o agente que resolve, este stack trata a saída dele como evidência, não como relatório. O confronto entre os agentes está em Decagon vs Fin; as decisões de deploy ficam no AI support agent stack.
  • Zendesk QA ou Solidroad é o avaliador, e qual você escolhe é o argumento inteiro. O Zendesk QA roda AutoQA em cada interação, incluindo agentes de AI e voz, sinaliza risco de churn e loops travados pelo Spotlight, pontua conversas ao vivo e coloca notas de bot e de humano lado a lado no AI Agent QA. Ele é vendido dentro do Workforce Engagement Bundle a $50 por agente por mês pago anualmente, que também cobre workforce management. A Solidroad vende duas linhas separadas — QA automation, coaching e simulações de treinamento para humanos; QA and benchmarking, melhorias de processo e scorecards de AI customizadas para agentes — e conecta direto em Decagon, Sierra e Fin para avaliá-los, importando políticas e macros do Guru e do Notion para que a scorecard reflita as suas regras de verdade. Ela levantou uma Série A de $25M em 16 de abril de 2026 liderada pela Hedosophia com First Round Capital, Y Combinator e Sony Innovation Fund, e cita Ryanair, ŌURA, Crypto.com e ActiveCampaign como clientes. Não publica preço; o único caminho até um número é uma demo.
  • Assembled é a camada de capacidade, e ela publica os preços. Workforce management sai por $25 (Core), $45 (Pro) e $75 (Enterprise) por agente por mês mais uma taxa de plataforma, o AI Copilot começa em $35 por agente por mês e os agentes de AI da própria Assembled começam em $0,65 por conversa. Ela se vende como a plataforma que gerencia agentes internos, fornecedores BPO e AI em um lugar só, o que aqui importa por um motivo específico: quando o agente absorve 60% do volume, os humanos ficam com o resíduo, e o resíduo é mais difícil por conversa do que a média era.
  • n8n monta a amostra e mantém o livro. É o componente mais barato e o único registro do stack que nenhum fornecedor auditado consegue reescrever.
  • Slack é onde a calibração acontece. Não um dashboard: uma thread semanal com as conversas em que a nota da máquina e a do humano divergiram, e uma decisão no fim dela.

Handoffs nomeados

  1. A conversa fecha no Zendesk → o webhook dispara → o n8n estratifica a amostra. Primeiro os buckets de risco: reabertas em sete dias, escaladas depois de passar pelo agente, CSAT 1 ou 2, contas acima de um limite de receita. O sorteio aleatório preenche a cota que sobrar.
  2. Cada conversa → para o avaliador, automaticamente → o subconjunto amostrado → para um revisor humano. A máquina cobre 100%; o humano cobre a parte em que errar custa caro.
  3. A janela de 72 horas fecha → a Zendesk atribui um nível → o n8n escreve a linha. Conversation ID, nível, nota de QA, flag de reabertura em sete dias, flag de escalação, no seu próprio armazenamento.
  4. Fim do mês → reconcilie o livro contra a fatura. Uma conversa cobrada como verified resolution que também gerou uma reabertura em sete dias é uma linha para contestar, não um arredondamento para absorver.
  5. A nota da máquina diverge da nota do humano acima do limite combinado → o par vai para a thread de calibração no Slack. A saída é um humano corrigido, uma scorecard corrigida ou um prompt corrigido.
  6. QA sinaliza uma lacuna de conhecimento → atribuição de coaching para humanos, revisão de scorecard para o agente. O mesmo achado, duas rotas de correção diferentes, porque um humano sem contexto e um bot sem contexto falham de formas distintas.

Linha de base de custo

Uma operação de suporte com 12 agentes e 6.000 conversas por mês, com o agente pegando 3.600 delas e 2.400 virando verified resolutions:

  • Zendesk QA via Workforce Engagement Bundle: $50 × 12 assentos × 12 meses = $7.200 por ano, e workforce management vem junto.
  • Assembled Pro no lugar, se você comprar a camada de capacidade separada: $45 × 12 × 12 = $6.480 por ano mais uma taxa de plataforma não publicada. Peça essa taxa como linha separada antes de comparar com o bundle.
  • Solidroad: só sob cotação. Orce contra o bundle da Zendesk como referência e exija que o fornecedor ganhe em algo que não seja preço — a razão para comprá-lo é que ele não presta contas à empresa que manda a sua fatura de resoluções.
  • n8n Pro: €60 por mês para 10.000 execuções, cerca de €720 por ano.
  • Tempo de revisão humana: amostrar 2% de 6.000 conversas dá 120 revisões por mês; a oito revisões por hora são 15 horas, algo como um décimo de um FTE. É a linha que todo mundo esquece e a única que faz as notas significarem alguma coisa.

Agora a aritmética desconfortável. Essas 2.400 verified resolutions custam $3.600 por mês na tarifa comprometida, $43.200 por ano. Se 5% delas estiverem classificadas errado a favor do fornecedor, recuperar tudo devolve cerca de $2.160 por ano contra uma camada de auditoria que custa $8.000 ou mais. A disputa de faturamento não paga este stack. Quem paga é a reabertura: uma conversa cobrada como resolvida que volta é cobrada duas vezes, uma pelo medidor e outra pelo humano que depois atende. Avalie o stack contra volume de reaberturas e recuperação de CSAT, e trate a exatidão da fatura como o subproduto que ela é.

Variações e quando trocar

  • Zendesk QA quando você já é todo-Zendesk e o agente é de outra empresa. Se Decagon ou Fin é quem resolve, o Zendesk QA está avaliando o bot de um concorrente e não o do próprio empregador, e o problema de independência praticamente some. Os $50 do bundle ainda absorvem workforce management, o que elimina a linha da Assembled por completo.
  • Solidroad quando o agente e o helpdesk são do mesmo fornecedor. Rodar os agentes de AI da Zendesk com o Zendesk QA significa que a mesma empresa é dona da definição do resultado, do veredito, da fatura e do boletim. Esse é o caso em que pagar um segundo fornecedor pela scorecard justifica o segundo contrato.
  • Tire a Assembled abaixo de uns 15 agentes. Um forecast que cabe numa planilha não precisa de plataforma. Traga de volta assim que fornecedores BPO entrarem, porque headcount gerenciado por terceiros é onde o erro de forecast vira o SLA de outra pessoa.
  • Troque o n8n por triggers nativos do helpdesk só enquanto a regra de amostragem ler de um sistema só. Assim que a amostra depender da receita da conta no CRM ou de dados de reabertura de uma segunda ferramenta, fique com o n8n.

O que este stack não substitui

  • Ele não decide o que o agente pode resolver. O escopo de intents é o ticket deflection agent template.
  • Ele não faz o deploy do agente nem é dono do caminho de escalação. Isso é o AI support agent stack, que este aqui audita.
  • Ele não retém clientes. Um ticket resolvido não é um contrato renovado — veja o customer retention stack.
  • Ele não escreve a scorecard. Toda camada aqui pressupõe que alguém decidiu o que é bom e colocou por escrito.
  • Ele não substitui um gestor lendo conversas. Ele substitui um gestor lendo uma amostra de conveniência e chamando aquilo de programa de QA.

Pontos de atenção, cada um com sua guarda

  • O avaliador e o avaliado podem ser a mesma empresa. A Zendesk é dona da Forethought desde 26 de março de 2026 e vende o produto de QA que pontua agentes de AI. Guarda: mantenha o livro de reconciliação em um armazenamento onde o fornecedor do agente não consiga escrever, ou compre o avaliador de uma empresa diferente da do agente.
  • As notas do AutoQA são julgamentos de modelo, e se movem quando o modelo ou o prompt se move. Uma revisão de scorecard pode deslocar sua média sem que um único agente se comporte diferente. Guarda: congele um gold set de 50 conversas pontuadas à mão e rode de novo depois de cada mudança de scorecard ou de modelo; um deslocamento no set congelado é mudança de medição, não de desempenho.
  • Cobertura de 100% elimina a desculpa da amostragem, mas não o viés dela. A revisão humana continua puxando para conversas curtas e legíveis. Guarda: faça dos estratos de risco cotas obrigatórias no amostrador do n8n — reaberturas, escalações, CSAT baixo, contas de alto valor — e deixe o sorteio aleatório preencher só o restante.
  • O nível de cobrança e a nota de QA chegam em relógios diferentes. O nível cai 72 horas depois da última mensagem; a nota cai na hora. Guarda: amarre cada linha ao conversation ID e reconcilie mensalmente. Reconciliar toda semana faz latência parecer divergência.
  • QA cobrada por assento humano fica mais cara por unidade de trabalho conforme o agente absorve volume. A $50 por agente por mês, com 12 assentos e uma fatia de bot crescente, você paga o mesmo por uma carga humana que encolhe. Guarda: verifique se o seu contrato de QA mede assentos ou conversas antes de a fatia de AI passar de 50%, e renegocie nesse cruzamento e não na renovação.
  • Fazer coaching contra uma rubrica que ninguém leu é avaliação de desempenho disfarçada. Guarda: publique a scorecard para o time antes que ela avalie alguém, e trate o primeiro mês de notas como dado de calibração e não de desempenho. Quando uma escalação específica der errado, rode o escalation RCA.

Regras de encaixe

É a escolha certa quando: você roda 2.000 conversas por mês ou mais, pelo menos parte do seu volume de resolução é cobrada por resultado, humanos e AI encostam na mesma fila, e alguém — um CFO, um board, um comitê de renovação — vai acabar perguntando como você sabe que o número de deflection é real. Encaixa melhor entre 10 e 50 assentos de suporte, onde o medidor pesa o suficiente e não existe função de analytics para construir um pipeline de scoring internamente.

É a escolha errada quando: você atende algumas centenas de conversas por mês e um gestor consegue ler todas as difíceis, ou seu suporte é inteiramente humano com preço fixo por assento, onde a camada de auditoria custa mais do que a exatidão que ela compra. Também é errada se ninguém vai ser dono da scorecard — uma rubrica sem dono produz notas que todo mundo ignora em silêncio, e você terá comprado um segundo dashboard para ignorar ao lado do dashboard do fornecedor.

Se você só puder fazer uma coisa: pontue 50 conversas à mão contra uma rubrica escrita e guarde-as. Esse gold set custa um dia, não precisa de contrato e é o único jeito de descobrir se qualquer avaliador que você comprar depois — de propriedade de um fornecedor ou não — concorda com você sobre o que é uma resolução. Combine com CSAT nas conversas atendidas pelo agente e você tem os dois números que sobrevivem a um fornecedor mudando as próprias definições.