sobre o termo “cientificamente comprovado”
artigo analisado
Ioannidis (2005), “Why most published research findings are false”, publicado na PLOS Medicine. Acessar o artigo.
contexto
A expressão “cientificamente comprovado” transmite a ideia de que uma afirmação passou por um teste definitivo e deixou de estar sujeita a dúvidas ou revisões. Esse modo de falar não representa bem como o conhecimento científico é construído.
Uma pesquisa pode encontrar uma associação estatisticamente significativa e, ainda assim, essa associação resultar do acaso, de vieses, de uma amostra pequena ou de escolhas realizadas durante a análise. A publicação do resultado também não informa quantas outras hipóteses foram testadas e descartadas antes que aquela relação aparecesse.
O artigo de John Ioannidis discute justamente por que um resultado positivo não deve ser confundido com uma verdade definitivamente comprovada.
o que o estudo investigou
Este é um ensaio teórico apoiado em um modelo matemático. O autor não examinou todos os artigos publicados para contar quantos estavam certos ou errados.
O modelo estima o chamado valor preditivo positivo: a probabilidade de uma relação ser verdadeira depois que um estudo apresenta um resultado estatisticamente significativo. Essa probabilidade dependeria de diferentes fatores:
- a plausibilidade da hipótese antes da realização do estudo;
- o poder estatístico, relacionado à capacidade de detectar um efeito real;
- a possibilidade de resultados positivos produzidos pelo acaso;
- a presença de vieses no desenho, na análise ou na publicação;
- a quantidade de hipóteses e análises testadas;
- o número de equipes procurando resultados significativos sobre o mesmo tema.
A partir dessas variáveis, o autor simula diferentes cenários de pesquisa e deriva algumas consequências para a interpretação dos resultados publicados.
principais resultados
A primeira conclusão do modelo é que significância estatística, isoladamente, não informa a probabilidade de uma hipótese ser verdadeira. Um resultado com valor de p inferior a 0,05 não significa que exista 95% de probabilidade de a conclusão estar correta.
O modelo também sugere que a credibilidade de um resultado tende a diminuir quando os estudos são pequenos. Amostras reduzidas produzem estimativas mais instáveis e possuem menor capacidade de distinguir efeitos reais das variações produzidas pelo acaso.
Outro fator é o tamanho do efeito investigado. Relações muito pequenas são mais difíceis de detectar com precisão e podem ser facilmente confundidas com vieses ou ruídos presentes nos dados.
A quantidade de hipóteses testadas também importa. Quando milhares de relações possíveis são examinadas, algumas podem alcançar significância estatística apenas por acaso. Se somente os resultados positivos forem apresentados, o público não consegue perceber quantas tentativas foram realizadas antes daquela descoberta.
O autor ainda destaca a flexibilidade na condução da pesquisa. Alterações em critérios de inclusão, desfechos, subgrupos ou métodos estatísticos podem transformar um resultado inicialmente negativo em positivo. Quanto maior a liberdade para escolher a análise depois de observar os dados, maior o risco de selecionar apenas a combinação que produz o resultado desejado.
Conflitos financeiros não são a única fonte possível de viés. Pesquisadores também podem estar comprometidos com uma teoria, uma linha de pesquisa ou com a necessidade de publicar resultados relevantes para avançar profissionalmente. Esses interesses não significam necessariamente fraude, mas podem influenciar decisões metodológicas e interpretações.
Nos cenários simulados pelo artigo, um ensaio clínico com poder adequado, pouco viés e uma hipótese considerada plausível apresentou valor preditivo positivo de 85%. Já pesquisas exploratórias que testavam muitas relações com baixa plausibilidade inicial apresentaram valores muito menores. Esses números resultam das condições assumidas pelo modelo e não representam porcentagens observadas em toda a literatura científica.
o que os resultados permitem concluir
O artigo mostra por que uma evidência científica deve ser interpretada em graus de confiança, e não apenas como “comprovada” ou “não comprovada”.
Um resultado se torna mais confiável quando parte de uma hipótese plausível, utiliza um método adequado, possui amostra suficiente, apresenta estimativas precisas e é confirmado por outras investigações independentes. A coerência com o conjunto das evidências importa mais do que a presença de significância estatística em um artigo isolado.
Isso não significa que a ciência seja incapaz de produzir conhecimentos sólidos. Algumas conclusões podem alcançar um grau muito elevado de confiança quando sustentadas por resultados consistentes, diferentes métodos e sucessivas tentativas de refutação. Ainda assim, essa confiança não corresponde a uma garantia absoluta e imutável.
O artigo também chama atenção para a totalidade das evidências. Quando diferentes equipes investigam a mesma pergunta, não é adequado selecionar somente o estudo que encontrou o resultado desejado. É necessário considerar também pesquisas negativas, contraditórias ou que não conseguiram reproduzir o achado inicial.
limitações e o que não podemos concluir
O título “por que a maioria dos resultados publicados é falsa” é mais abrangente do que aquilo que o artigo demonstrou empiricamente. O trabalho apresenta um modelo com cenários hipotéticos; ele não estabelece uma porcentagem universal de pesquisas falsas.
As estimativas dependem de parâmetros difíceis de conhecer, especialmente a probabilidade de uma hipótese ser verdadeira antes do estudo e a intensidade dos vieses presentes em cada área. Alterar essas suposições modifica os resultados do modelo.
O trabalho também se concentra principalmente em exemplos da pesquisa biomédica. Áreas científicas com objetos, métodos e padrões de evidência diferentes podem apresentar outras proporções de resultados confiáveis.
Além disso, dividir as conclusões apenas entre “verdadeiras” e “falsas” simplifica situações nas quais o efeito existe, mas sua intensidade foi superestimada, aparece somente em determinadas condições ou depende da população investigada.
Portanto, o artigo não permite concluir que todos os estudos sejam pouco confiáveis, que resultados estatisticamente significativos não tenham valor ou que seja impossível conhecer algo por meio da ciência. Sua contribuição é mostrar que o resultado de um teste estatístico precisa ser interpretado dentro de um contexto metodológico e de um conjunto maior de evidências.
aplicação no cotidiano
Quando uma alegação for apresentada como “cientificamente comprovada”, algumas perguntas ajudam a traduzi-la para uma linguagem mais precisa:
O que exatamente foi demonstrado? O estudo encontrou uma associação, testou uma intervenção ou apenas levantou uma hipótese?
Quantas possibilidades foram testadas? Um resultado isolado pode parecer mais convincente quando as demais análises não são apresentadas.
Qual é a precisão do resultado? Além do valor de p, é necessário observar o tamanho do efeito e a incerteza da estimativa.
Existem outras pesquisas compatíveis? Replicações e diferentes métodos aumentam a confiança na conclusão.
Quais vieses podem estar presentes? O desenho, a análise, a publicação seletiva e os conflitos de interesse podem influenciar o resultado.
Em vez de “cientificamente comprovado”, formulações como “o estudo observou”, “as evidências disponíveis sustentam” ou “há um elevado grau de confiança” descrevem melhor o que a ciência realmente permite afirmar.
referência completa
IOANNIDIS, John P. A. Why most published research findings are false. PLOS Medicine, v. 2, n. 8, e124, 2005. DOI: 10.1371/journal.pmed.0020124.
Esta análise foi desenvolvida com auxílio de inteligência artificial. O texto final foi revisado e editado por mim.