Satisfação & Feedback23/08/2026Equipe Editorial da Biomi11 min de leitura

Como analisar respostas abertas de pesquisas: codebook, temas, validação e uso responsável de IA

Um método prático para transformar comentários em temas úteis, criar um codebook consistente, validar a codificação e usar IA sem terceirizar a interpretação.

Analista organiza comentários de pesquisa em um painel de codebook e temas, com um assistente de IA ao lado e etapas de validação no fluxo.

Respostas abertas ficam difíceis de analisar justamente quando começam a ser úteis. Algumas dezenas de comentários ainda cabem numa leitura informal; centenas ou milhares já exigem um método que preserve contexto, permita comparar padrões e deixe claro como cada resposta foi classificada. O erro comum é pular dessa massa de texto direto para uma contagem de temas ou para um resumo produzido por IA. Entre uma coisa e outra falta o trabalho analítico: definir o que será codificado, construir regras, testar ambiguidades e verificar se as categorias realmente representam os comentários.

Para pesquisas de satisfação e feedback em escala, um caminho prático é usar uma abordagem de codebook: ler uma amostra exploratória, criar e refinar códigos, permitir múltiplas marcações quando necessário, testar o esquema em uma nova amostra, codificar o conjunto e só então contar e interpretar. A IA pode acelerar partes desse fluxo, sobretudo agrupamento inicial, busca de semelhantes e aplicação de regras já estabilizadas. A decisão sobre o significado dos temas e sobre o que uma resposta realmente quer dizer continua precisando de supervisão humana.

Comece pela pergunta que a análise precisa responder

Antes de criar categorias, escreva a pergunta analítica em uma frase. “Do que os clientes reclamam?” é amplo demais. “Quais obstáculos aparecem nas respostas de quem avaliou o atendimento com nota baixa?” já delimita o corpus, a finalidade e o tipo de conclusão esperado. Essa definição evita um codebook que tenta capturar tudo o que aparece no texto e termina grande demais para ser útil.

Também defina a unidade de codificação. Em respostas curtas, a unidade pode ser o comentário inteiro. Em respostas longas, pode fazer mais sentido marcar trechos, porque a mesma pessoa pode elogiar a equipe, reclamar do tempo de espera e sugerir uma melhoria na mesma resposta. A regra precisa ser estável: se às vezes você codifica frases e em outras vezes o comentário inteiro, a contagem posterior perde comparabilidade.

Perguntas abertas preservam nuances que perguntas fechadas não antecipam, mas isso não transforma o conjunto em uma amostra estatisticamente representativa. Um relatório de 2026 do Office for National Statistics, no Reino Unido, analisou respostas abertas de uma pesquisa de saúde com codebook thematic analysis e explicitou que as frequências dos temas não deveriam ser tratadas como proporções exatas da população nem como medida automática de importância. Essa distinção é central também em pesquisas de clientes: frequência no corpus analisado é uma evidência descritiva, não uma estimativa populacional por si só.

Faça uma amostra exploratória antes de congelar o codebook

O primeiro codebook não deve nascer de uma tela em branco nem de uma lista pronta criada apenas com base no questionário. Separe uma amostra suficientemente variada para expor o vocabulário, os assuntos recorrentes, as exceções e as respostas difíceis. Se a pesquisa contém grupos que você pretende comparar, como promotores e detratores, canais diferentes ou períodos distintos, inclua exemplos desses grupos na exploração em vez de ler apenas as primeiras respostas da planilha.

Nessa leitura, procure unidades de sentido, não apenas palavras repetidas. “Demorou para responder”, “ninguém retornou” e “esperei dois dias pelo suporte” podem apontar para um

mesmo código de demora no retorno, ainda que quase não compartilhem termos. Ao mesmo tempo, duas respostas com a palavra “rápido” podem ter sentidos opostos se uma disser “foi rápido” e outra “resolveram rápido demais e não ouviram meu caso”.

O CDC recomenda leitura e releitura antes da subdivisão do texto em códigos, justamente para preservar o fluxo e o contexto. Essa etapa também reduz um problema comum em análises automatizadas: classificar frases isoladas corretamente e, mesmo assim, interpretar a resposta inteira de maneira errada.

Transforme observações em um codebook operacional

Um codebook útil não é apenas uma lista de nomes de temas. Cada código precisa dizer o que entra, o que não entra e como lidar com fronteiras. Na prática, registre um rótulo curto, uma definição operacional, critérios de inclusão, critérios de exclusão, exemplos reais ou anonimizados e observações sobre códigos que podem aparecer juntos.

Imagine o código “dificuldade para agendar”. Ele deve incluir impossibilidade de encontrar horário, indisponibilidade de agenda e falhas no processo de marcação. Pode excluir demora no atendimento depois que o horário já foi obtido, se isso estiver representado por outro código. Essa separação parece excessiva quando há vinte comentários, mas evita que a categoria se transforme em um recipiente genérico quando houver dois mil.

O codebook é iterativo. Estudos metodológicos e guias de análise qualitativa descrevem revisões sucessivas das definições, inclusão e exclusão de casos e discussão de discrepâncias antes da aplicação em escala. Portanto, não trate a primeira versão como contrato imutável. O que precisa ficar estável é a versão usada na codificação final, com registro das mudanças feitas antes de congelá-la.

Decida explicitamente quando uma resposta pode receber vários temas

Respostas abertas frequentemente são compostas. “Gostei do atendimento, mas o aplicativo travou e o retorno demorou” contém pelo menos três ideias distintas. Forçar um único rótulo faz a análise perder informação; permitir múltiplos códigos sem regra também pode inflar contagens e produzir categorias sobrepostas.

A solução é definir a política de múltipla marcação no próprio codebook. Uma resposta pode receber mais de um código quando há unidades de sentido independentes e relevantes para a pergunta analítica. Não deve receber vários códigos apenas porque existem sinônimos ou porque duas categorias têm fronteiras mal definidas. Quando dois códigos aparecem juntos com frequência, revise se eles representam dimensões realmente diferentes ou se deveriam ser fundidos.

Essa decisão muda a leitura dos resultados. Se múltiplos códigos são permitidos, a soma das frequências pode ultrapassar o número de respostas. Por isso, qualquer percentual precisa declarar o denominador: porcentagem de respostas que receberam o código, porcentagem de todas as marcações ou outra base claramente definida.

Crie regras para “outros”, casos ambíguos e comentários fora de escopo

A categoria “outros” é útil como válvula de segurança, mas perigosa como destino permanente. Se ela cresce rápido, o codebook está deixando de representar partes relevantes do corpus. Em vez de aceitar “outros” como caixa residual, revise periodicamente os comentários ali agrupados e verifique se existe um novo padrão que merece código próprio.

Casos ambíguos precisam de outro tratamento. Marque-os como pendentes durante o piloto, registre por que são difíceis e discuta a regra que resolveria casos semelhantes no futuro. Uma boa decisão não resolve apenas um comentário; ela melhora a definição para dezenas de comentários que poderiam causar a mesma dúvida.

Também separe “não se aplica” de “outros”. Uma resposta vazia, um comentário sobre assunto totalmente diferente ou um texto sem informação suficiente não representa necessariamente um novo tema. Misturar esses casos com conteúdo raro cria uma falsa categoria analítica.

Valide o esquema antes de codificar tudo

Depois de montar o codebook, aplique-o a uma amostra nova, diferente daquela usada para criá-lo. O objetivo não é provar que existe uma única leitura correta, mas descobrir onde as regras ainda são vagas. Se houver mais de um analista, ambos podem codificar o mesmo subconjunto e comparar divergências código a código. Em projetos operacionais de codebook, esse exercício ajuda a calibrar fronteiras, reduzir “drift” ao longo do tempo e identificar definições que precisam ser reescritas.

A divergência mais informativa não é simplesmente “dois analistas discordaram”. Pergunte por quê. Um código estava amplo demais? Faltou exemplo negativo? A resposta continha dois temas e um analista escolheu apenas um? A unidade de codificação estava indefinida? Esse diagnóstico produz uma versão melhor do codebook.

É importante não importar essa lógica para qualquer método qualitativo como se fosse uma regra universal. Braun e Clarke distinguem abordagens de codebook e de confiabilidade de codificação da análise temática reflexiva. Na análise reflexiva, múltiplos codificadores independentes e métricas de concordância podem ser incompatíveis com a própria concepção de análise. Para grandes conjuntos de respostas de satisfação, porém, quando a meta é aplicar categorias operacionais de forma consistente, a validação de uma amostra é uma escolha coerente.

Só conte depois de estabilizar as regras

Contar códigos antes do piloto costuma produzir uma precisão enganosa. Uma diferença de alguns pontos percentuais pode parecer importante, mas desaparecer quando duas categorias são fundidas ou quando uma regra de múltipla marcação muda. Primeiro estabilize o esquema; depois faça a codificação completa e derive as contagens.

Na interpretação, combine frequência com contexto. Um tema raro pode ser crítico se revelar um risco, uma falha grave ou uma necessidade muito específica. Um tema frequente pode ser banal ou consequência direta da pergunta formulada. O próprio ONS, ao relatar respostas abertas em 2026, separou frequência de importância qualitativa. A leitura responsável pergunta não só

“quantas vezes apareceu?”, mas “o que as pessoas estão dizendo, em que contexto e com quais consequências?”.

Também volte aos comentários originais antes de escrever conclusões. Um gráfico pode mostrar que “demora” aparece em 28% das respostas codificadas, mas a ação depende de saber se a demora está no primeiro contato, no agendamento, na entrega ou na resolução. Código é um índice para recuperar significado; não é substituto do texto.

Onde a IA ajuda de verdade

A IA é especialmente útil quando a tarefa já tem alguma estrutura. Pode sugerir agrupamentos durante a exploração, propor rótulos provisórios, localizar comentários semanticamente semelhantes, aplicar um codebook estabilizado e separar casos com baixa clareza para revisão. Em milhares de respostas curtas, essas funções podem reduzir trabalho mecânico sem obrigar a equipe a delegar a interpretação final.

A evidência recente recomenda cautela. Um estudo publicado em 2026 na PLOS Digital Health encontrou desempenho competitivo de modelos de linguagem em uma tarefa dedutiva com codebook predefinido, mas desempenho mais variável na análise indutiva e necessidade de verificação humana. Os autores também encontraram erros que não eram simples “alucinações”: havia correspondências parciais e classificações inadequadas capazes de afetar a análise. Outro trabalho de 2026 sobre geração de codebooks com IA em grande escala apresentou resultados promissores, mas usou dados sintéticos e apontou a necessidade de avaliação humana e testes em conjuntos reais mais complexos.

Isso sugere uma divisão de trabalho prática: use IA para ampliar capacidade de processamento e para levantar hipóteses; use analistas para definir propósito, interpretar contexto, arbitrar fronteiras e decidir o que uma categoria significa para o negócio.

Um fluxo de IA com rastreabilidade

Se a IA participar da codificação, peça que cada marcação retorne o código aplicado e o trecho da resposta que sustenta a decisão. Isso torna a revisão mais rápida e reduz o risco de aceitar uma classificação que não está ancorada no texto. Para respostas curtas, preservar o comentário original ao lado da marcação é simples e valioso.

Congele a versão do codebook usada em cada rodada e registre qual ferramenta, modelo ou configuração foi empregada. Modelos mudam, prompts mudam e pequenas alterações podem mudar resultados. Sem esse registro, fica difícil reproduzir por que um comentário recebeu determinado código ou comparar análises feitas em momentos diferentes.

A validação humana pode combinar amostragem aleatória com revisão dirigida por risco. Além de sortear respostas, revise casos com múltiplos códigos, categorias raras, comentários muito longos, linguagem ambígua, ironia, gírias e qualquer classificação que afete uma decisão sensível. Não confie apenas em um número de “confiança” gerado pelo próprio modelo; a evidência útil é a correspondência entre código, regra do codebook e texto original.

Antes de enviar comentários para qualquer sistema de IA, trate os dados como potencialmente sensíveis. Remova identificadores diretos quando eles não forem necessários para a análise e use

apenas ferramentas e ambientes aprovados pela sua organização para esse tipo de informação. Orientações de gestão de risco para IA generativa, como as do NIST, destacam governança, supervisão humana e cuidados específicos com dados pessoais, proprietários ou sensíveis.

Exemplo: de 1.500 comentários a um conjunto de temas acionáveis

Suponha uma pesquisa pós-atendimento com 1.500 respostas abertas. A equipe quer entender por que clientes satisfeitos recomendam o serviço e por que clientes insatisfeitos abandonam o processo. Em vez de pedir um resumo geral à IA, começa por uma amostra variada e identifica padrões como rapidez no retorno, clareza da equipe, dificuldade de agendamento, problema técnico e resolução no primeiro contato.

Depois de testar as definições, percebe que “rapidez” e “tempo de espera” não podem ser um único código: uma resposta pode elogiar a velocidade do primeiro contato e reclamar da demora para resolver. O codebook passa a separar etapas da jornada. Também fica definido que uma mesma resposta pode receber vários códigos e que “outros” será revisado após cada lote inicial.

Na validação, a IA e dois analistas divergem repetidamente em comentários como “foi resolvido, mas precisei cobrar três vezes”. A divergência revela que o codebook não distingue resultado final de esforço exigido do cliente. Um novo código de esforço ou retrabalho melhora a análise. Esse é o valor do piloto: ele não serve apenas para medir desempenho; serve para descobrir dimensões que o primeiro esquema não enxergava.

Ao final, a equipe consegue contar quantas respostas mencionam cada problema, recuperar rapidamente exemplos representativos e comparar segmentos sem perder o texto de origem. Mais importante: consegue explicar de onde vieram as categorias e quais regras produziram os números.

O resultado não é uma nuvem de temas, mas uma análise auditável

Uma boa análise de respostas abertas precisa deixar um caminho de volta do resultado ao comentário. Tema, contagem e interpretação devem ser rastreáveis ao codebook e ao texto original. Esse princípio evita que categorias se tornem rótulos soltos e também limita o papel da IA: qualquer sugestão precisa sobreviver à leitura humana e às regras definidas para o projeto.

O método pode ser resumido como um ciclo, não como uma automação única: explorar uma amostra, criar o codebook, definir múltiplos temas e exceções, testar em nova amostra, revisar, codificar, validar e interpretar. Quando novas evidências exigirem mudança relevante nas regras, registre a versão e refaça o necessário. A eficiência vem da estrutura; a qualidade vem da capacidade de preservar contexto e revisar decisões.

Para centenas ou milhares de comentários, a IA pode ser um excelente assistente de triagem e codificação. O ganho aparece quando ela trabalha dentro de um processo verificável. Quando passa a decidir sozinha quais temas importam, o que é ambíguo ou que conclusão deve ser publicada, a análise pode ficar mais rápida, mas também menos defensável.

Topicos deste artigoanálise qualitativaanálise temáticacodebookfeedbackinteligência artificialrespostas abertascomo analisar respostas abertas de pesquisascategorização de comentáriosanálise de feedbackIA em pesquisacodificação qualitativa