Este es el complemento de cómo calificamos la evidencia. Esa página explica los niveles que ponemos a cada afirmación; esta te entrega las herramientas para revisar cualquier estudio, incluidos los nuestros.
No necesitas saber estadística para hacerlo bien. La mayoría de los errores que importan provienen de un puñado de maniobras que son fáciles de detectar una vez que alguien te las señala.
Un estudio describe lo que le sucedió a un grupo particular de personas, medido de una manera particular, por investigadores con preguntas particulares y financiadores particulares. Leer uno bien se reduce a cuatro preguntas: quién estaba en él, qué se midió realmente, cuán seguros son los números, y si la conclusión declarada coincide con el hallazgo subyacente. Las mismas cuatro funcionan en casi todo, desde un comunicado de prensa de dos líneas hasta un artículo de 30 páginas.
Calificamos cada afirmación en este sitio con una de cuatro etiquetas: Fuerte, Moderada, Emergente, o Preliminar, expuestas en cómo calificamos la evidencia. Las herramientas a continuación son cómo revisa el estudio detrás de cualquier etiqueta, incluida la nuestra.
La Escalera de la Evidencia
El diseño de un estudio le indica más o menos cuánto confiar en él antes de leer un solo número. Cinco diseños amplios se sitúan en una escalera, desde el más débil abajo hasta el más fuerte arriba.
Al fondo está el reporte de caso, o una serie de casos de un puñado de pacientes: una persona que recibió un tratamiento y le fue bien o mal. Esto es una anécdota. Puede plantear una pregunta que valga la pena estudiar. No puede resolver una, porque no hay nadie con quien comparar al paciente.
Después vienen los estudios observacionales, donde los investigadores observan a personas que ya hacen o no hacen algo. Una encuesta transversal es una instantánea de un momento. Un estudio de casos y controles comienza a partir de personas que tienen un resultado y mira hacia atrás. Un estudio de cohorte sigue a un grupo hacia adelante, a veces durante 10 o 20 años. Estos pueden mostrar que dos medidas suben y bajan juntas, medir cuán fuertemente, y revelar una dosis-respuesta. No pueden mostrar que uno causó el otro, porque las personas que hacen la cosa difieren de las que no la hacen en otras cien maneras.
El ensayo controlado aleatorizado es la herramienta construida para arreglar la confusión. Asignar a las personas a tratamiento o control por azar hace que los dos grupos sean iguales en promedio, tanto en factores conocidos como desconocidos, así que una diferencia después puede razonablemente atribuirse al tratamiento. El cegamiento, donde ni el paciente ni el evaluador saben quién recibió qué, evita que la expectativa moldee el resultado.
En la cima, una revisión sistemática reúne todos los estudios sobre una pregunta y los evalúa juntos; un metaanálisis combina sus números en una sola estimación. Hecho bien, esto es lo más fiable que tenemos. Hecho sobre un montón de estudios débiles, es un promedio ordenado de estudios débiles, no más fuerte que lo que entró.
La escalera le da un prior inicial y nada más. Una cohorte grande y limpia puede pesar más que un pequeño y descuidado ensayo aleatorizado de 30 personas. El diseño fija su expectativa; los métodos le dicen si un estudio la cumple.
La Correlación No Es Causa
Durante años, tomar café pareció vinculado al cáncer de pulmón, hasta que los investigadores notaron que los bebedores de café de esa época también fumaban mucho más. Ese es el error detrás de la mayoría de los malos titulares de salud, y toma dos formas.
La primera es la confusión, donde un tercer factor impulsa ambas cosas a la vez. Las ventas de helado y los ahogamientos suben juntos solo porque ambos aumentan en verano. La terapia hormonal es la versión costosa: durante años pareció protectora del corazón en datos observacionales, porque las mujeres que la tomaban eran más sanas y adineradas de entrada, un patrón llamado sesgo del usuario sano. Los ensayos aleatorizados que siguieron no encontraron ninguna protección en absoluto.
La segunda forma es la causalidad inversa, donde la flecha apunta en la otra dirección. Las personas en las primeras etapas de una enfermedad a menudo se mueven menos, así que "estar sentado se vincula con la enfermedad" puede ser la enfermedad causando el sedentarismo, con la flecha verdadera invertida.
La aleatorización rompe ambas trampas, por eso la escalera pone a los ensayos por encima de las cohortes. Pero para muchas preguntas importantes, los datos observacionales son todo lo que habrá jamás, porque aleatorizar a las personas sería cruel o imposible. Cuatro señales entonces hacen que una lectura causal sea más creíble: una dosis-respuesta clara, la causa llegando antes que el efecto, un mecanismo biológico plausible, y el mismo resultado apareciendo en diferentes poblaciones. Ninguna es decisiva por sí sola. Juntas son cómo las personas cuidadosas razonan sobre causas que no pueden aleatorizar.
Riesgo Relativo Versus Absoluto
Un número engaña a más lectores que cualquier otro en una página de salud: una reducción de riesgo reportada sin su base. Tome un fármaco que baja su riesgo de algún evento de 2 en 1,000 a 1 en 1,000 en un año. El mismo resultado se puede escribir de dos maneras:
- Como una reducción de riesgo relativo: el fármaco reduce su riesgo a la mitad, una reducción del 50%.
- Como una reducción de riesgo absoluto: su riesgo cae en 1 de cada 1,000, o 0.1 de un punto porcentual.
Una tercera forma dice lo mismo con más claridad: el número necesario a tratar, aquí 1,000. Mil personas toman el fármaco durante un año para que una de ellas evite el evento; las otras 999 solo reciben los efectos secundarios y la factura. Su espejo es el número necesario para dañar.
Las cifras relativas son incompletas porque ocultan el riesgo inicial. Un recorte del 50% de una base diminuta es un cambio diminuto; un recorte del 50% de una base grande es uno grande.
Cuando vea una reducción porcentual, hágase dos preguntas siempre: ¿reducción desde qué base?, y ¿cuál es el cambio en cifras claras?
Significancia Estadística Versus Real
El valor p responde a una pregunta estrecha, y los lectores rutinariamente la confunden con una más grande. Si el tratamiento realmente no hiciera nada, ¿con qué frecuencia aparecería por azar un resultado al menos tan extremo? Eso es todo lo que reporta. Un p por debajo de 0.05 es una convención, una línea que alguien trazó, no un umbral de verdad. No da la probabilidad de que el hallazgo sea real o de que la hipótesis se sostenga. Un estudio puede superar 0.05 y aun así ser una casualidad, especialmente uno pequeño que midió muchas cosas y reportó el único resultado que cruzó la línea.
El intervalo de confianza es más útil, porque muestra todo el rango de efectos con los que los datos son compatibles. Un intervalo estrecho significa una estimación precisa; un intervalo amplio significa que el estudio le puede decir poco. Si el intervalo incluye "sin efecto", el resultado sigue siendo incierto sin importar lo que diga el valor p. Prefiera el intervalo a un p desnudo siempre.
La significancia estadística y la importancia en el mundo real se separan más a menudo de lo que admiten los titulares. Un ensayo de 50,000 personas puede fijar una caída de presión arterial de medio punto, hermética e inútil al mismo tiempo, porque ningún paciente sentiría medio punto. Un efecto genuinamente útil puede escaparse en la otra dirección, sin alcanzar significancia en un estudio demasiado pequeño para detectarlo. Ese fallo refleja el tamaño del estudio; no prueba que el efecto no exista. Pregúntese qué tamaño de efecto realmente importaría a una persona, y luego revise si el estudio encontró un efecto de ese tamaño antes de revisar su valor p.
Sustitutos Versus Resultados
Se esperaba que los fármacos que suprimían los latidos cardiacos irregulares después de un infarto salvaran vidas. Probados finalmente contra la muerte misma, la elevaron. El latido que arreglaban era un sustituto, un marcador de laboratorio que representaba el resultado que a cualquiera realmente le importa.
Los sustitutos están en todas partes; cinco comunes son el colesterol LDL para los infartos, la presión arterial para los accidentes cerebrovasculares, la reducción del tumor para la supervivencia, la densidad ósea para las fracturas, y la HbA1c para las complicaciones de la diabetes. Son atractivos porque se mueven en semanas y cuestan poco, mientras que los resultados reales tardan años.
Mover el marcador no siempre mueve el resultado, y puede moverlo en la dirección equivocada. Algunos fármacos contra el cáncer reducen un tumor en un escáner sin nunca dejar que la gente viva más tiempo o se sienta mejor. Así que cuando un estudio reporta un sustituto, trátelo como una pista prometedora, y luego haga la pregunta real: ¿alguien midió cómo les fue a los pacientes, cuánto tiempo vivieron, cómo se sintieron, si la fractura o el infarto llegaron alguna vez?
Quién Fue Estudiado, y Quién Pagó
Un resultado medido en 2,315 hombres finlandeses es sólido para hombres finlandeses y una pregunta abierta para todos los demás. Dos estudios pueden reportar números idénticos y aun así merecer una confianza muy distinta, dependiendo por completo de la letra pequeña.
Los estudios pequeños son ruidosos. Un resultado dramático en 12 personas es una razón para hacer un estudio más grande, no una razón para cambiar lo que hace.
Quién estuvo en el estudio decide para quién es el estudio. Un hallazgo medido en hombres jóvenes sanos, o en un país, o en un rango estrecho de edades, puede no aplicarse a usted. Buena parte de la investigación sobre ejercicio y fisiología se inclina fuertemente hacia lo masculino, y esa inclinación se vuelve invisible una vez que un solo número se cita y se vuelve a citar. Por eso nuestras propias afirmaciones señalan el sexo en el que se midieron. La generalizabilidad es una pregunta que tiene que hacer; un estudio rara vez ofrece voluntariamente sus propios límites.
Un estudio que declaró su resultado principal y su plan de análisis por adelantado, y luego reportó exactamente eso, es mucho más difícil de manipular que uno que midió 10 cosas y le contó sobre las dos que funcionaron. Busque un protocolo preregistrado.
Los estudios publicados son una muestra sesgada de los estudios realmente realizados. Los ensayos que no encuentran nada a menudo quedan sin publicar, así que el registro publicado se inclina hacia lo positivo antes de que lea una sola palabra. Una revisión sistemática que buscó en registros de ensayos más allá de las revistas es la cura parcial.
El financiamiento de la industria no es descalificante, y mucha investigación excelente es pagada por las empresas que fabrican el producto. Es una razón para leer los métodos con más atención, para revisar quién eligió los resultados y el grupo de comparación, y para sopesar el resultado junto a trabajo independiente.
Un resultado en ratones, o en células en una placa, es una razón para hacer un ensayo en humanos y nada más. La mayoría de los hallazgos que parecen sorprendentes en un ratón nunca se reproducen en una persona.
Generalmente se puede rastrear cómo un artículo modesto se convierte en un titular ruidoso. El titular viene de un comunicado de prensa, el comunicado de prensa del resumen, y el resumen suele ser la parte más halagadora de todo el documento.
The Research & Studies
Everything here is based on the research we have collected and checked, sorted into groups and ordered with the strongest evidence first. Click any claim to open the studies behind it.
Evidence And Methods
Los resúmenes de alrededor del 58% de los ensayos no significativos aún se leen como positivos
Los investigadores reunieron 72 ensayos en los que el resultado principal no alcanzó significación estadística, es decir, el tratamiento no había superado claramente a la comparación. En la mayoría de ellos, el resumen, la parte que casi todo el mundo lee, seguía redactado para dar la impresión de que el tratamiento había funcionado.
Boutron y colaboradores examinaron los ensayos indexados en diciembre de 2006 e identificaron 72 ensayos aleatorizados de grupos paralelos con un resultado principal estadísticamente no significativo. Los evaluadores clasificaron el sesgo de presentación (spin), definido como una redacción que resalta el beneficio del tratamiento pese al resultado no significativo. Este sesgo apareció en la sección de resultados del resumen en el 37.5% de los informes y en la sección de conclusiones del resumen en el 58.3%, con las conclusiones del texto principal afectadas en tasas similares o superiores. El resumen es la parte que ven la mayoría de los lectores, y a menudo la única, por lo que redactarlo de forma optimista condiciona cómo se recuerda un ensayo nulo.
Who this may not transfer to:This is a finding about how trials get written up, not a health effect, so it applies whenever you read a study, not to any one group of people.
Lea el resultado principal y su cifra antes de leer la conclusión. Si el criterio de valoración principal preespecificado no mostró cambios pero la conclusión suena optimista, esa frase suele apoyarse en un hallazgo secundario o en un subgrupo. Confíe en el número, no en los adjetivos.
The study · 1
Boutron et al., reporting and interpretation of randomized trials with statistically nonsignificant results for primary outcomes · JAMA 2010;303(20):2058-64
Las revistas mostraron un 94% de ensayos de antidepresivos positivos; los datos de la FDA mostraban un 51%
Los reguladores tenían en su poder los resultados de 74 ensayos de antidepresivos. Casi todos los ensayos con un resultado favorable se publicaron, mientras que la mayoría de los ensayos con un resultado desfavorable nunca se publicaron, o se redactaron para parecer mejores de lo que eran. Alguien que solo leyera las revistas pensaría que casi todos los ensayos tuvieron éxito; el registro completo mostró que tuvo éxito alrededor de la mitad.
Turner y colaboradores compararon 74 ensayos de antidepresivos registrados ante la Administración de Alimentos y Medicamentos de EE. UU. (FDA) entre 1987 y 2004 con lo que llegó a la literatura publicada. De los 38 estudios que la FDA consideró positivos, 37 se publicaron. De los 36 estudios con resultados negativos o cuestionables, 22 no se publicaron en absoluto y 11 se publicaron de una forma que transmitía un resultado positivo. Por lo tanto, el registro publicado mostró un 94% de ensayos positivos frente al 51% de la FDA, y los tamaños del efecto en la literatura de revistas fueron aproximadamente un 32% mayores que los del conjunto completo de datos de la FDA, con fármacos individuales inflados entre un 11% y un 69%.
Who this may not transfer to:This is a finding about which trials reach the published record, not a health effect, so it applies whenever you rely on the literature, not to any one group of people.
Un solo ensayo positivo publicado por sí solo resuelve poco, porque los ensayos que fracasaron simplemente pueden faltar. Prefiera una revisión sistemática que haya buscado en los registros de ensayos, no solo en revistas, y compruebe si el resultado se preregistró antes de que comenzara el estudio.
The study · 1
Turner et al., selective publication of antidepressant trials and its influence on apparent efficacy · N Engl J Med 2008;358(3):252-60
El encuadre en riesgo relativo hace que el mismo beneficio parezca mayor que en riesgo absoluto
Dígale a la gente que una pastilla reduce su riesgo a la mitad y estarán más dispuestos a tomarla que si les dice que reduce su riesgo de 2 de cada 1000 a 1 de cada 1000, aunque sea el mismo hecho. El número relativo, que suena más grande, influye con más fuerza en la decisión.
Covey combinó estudios experimentales que presentaron el mismo beneficio de un tratamiento a los participantes en distintos formatos numéricos. La reducción del riesgo relativo produjo de forma consistente calificaciones más altas de eficacia y una mayor disposición a tomar o recomendar un tratamiento que la reducción del riesgo absoluto o el número necesario a tratar, tanto en participantes legos como en estudiantes y clínicos. El hallazgo trata de cómo un formato dirige la percepción, no de cuál formato es correcto: la cifra absoluta y el número necesario a tratar incluyen el riesgo de referencia que la cifra relativa omite.
Who this may not transfer to:This is a finding about how risk numbers steer perception, not a health effect, so it applies whenever you meet a percentage reduction, not to any one group of people.
Cuando encuentre una reducción porcentual, pregúntese siempre dos cosas: reducción a partir de qué riesgo inicial, y cuál es el cambio en cifras sencillas. Si el riesgo de referencia es pequeño, una gran reducción relativa puede ser una reducción absoluta trivial.
The study · 1
Covey, a meta-analysis of the effects of presenting treatment benefits in different formats · Med Decis Making 2007;27(5):638-54
Preguntas para Hacerle a Cualquier Estudio
Someta cualquier estudio, titular o comunicado de prensa a las mismas siete preguntas. Noventa segundos bastan para examinarlo, y las respuestas le dicen si el hallazgo merece una mirada más cercana.
Preguntas Frecuentes
¿Cuál es la pregunta individual más útil para hacer sobre un estudio?
Si el grupo estudiado se parece a usted, y si lo que midieron es lo que le importa. Un gran efecto en un marcador sustituto en personas que no se parecen en nada a usted guía menos su decisión que un efecto modesto en un resultado real en personas que comparten su situación. La relevancia va antes que el diseño y las estadísticas.
¿Por qué es engañoso "reduce su riesgo a la mitad"?
Porque oculta el riesgo inicial. Reducir a la mitad un riesgo de 2 en 1,000 salva a una persona por cada 1,000 tratadas; reducir a la mitad un riesgo de 1 en 3 es enorme. La cifra relativa se lee igual en ambos casos y por sí sola le dice casi nada. Conviértala al cambio absoluto, y donde pueda, al número necesario a tratar.
¿Alguna vez resuelve algo un solo estudio?
Rara vez. Un hallazgo se gana la confianza cuando se replica en diferentes grupos y diferentes equipos de investigación. Una buena revisión sistemática revisa exactamente eso. Un solo ensayo, por grande que sea, es un punto de datos. Sea más cauteloso con un único estudio pequeño que revierte un gran cuerpo de trabajo previo; eso es más a menudo ruido que revolución.
¿No vale nada un estudio en ratones o células?
No, pero responde a una pregunta diferente. El trabajo animal y de laboratorio es cómo los investigadores encuentran mecanismos y deciden qué vale la pena probar en personas. Apunta hacia un ensayo en humanos que vale la pena hacer. La mayoría de los resultados sorprendentes en ratones no se reproducen en humanos, así que lea "en ratones" en un titular como una señal de que la evidencia humana todavía no ha llegado.
¿Cómo puedo distinguir un hallazgo real de un titular exagerado?
Busque las señales de una afirmación que va más allá de su evidencia. "Vinculado a" o "asociado con" generalmente marca datos observacionales que no pueden establecer causalidad. Una cifra relativa llega sin una absoluta al lado. Un marcador sustituto se reporta como si fuera un resultado. La muestra es pequeña. Y "puede" carga toda la primera oración. Cuando varias señales se acumulan en un titular, vaya a buscar el estudio y lea usted mismo el resultado primario.
Explore Related
Other pages this one connects to, by the evidence they share, the outcomes they touch, and the ground they cover.
All 3 registered claim citations independently checked and cross-referenced.
Thomas Dehli, Founder & Editor, Sacred Lotus
Sacred Lotus has published Chinese medicine reference material since 2001. Integrative pages are held to the same standard as the herb and formula library: cite the source, grade the claim at its real strength, and say where the research has not looked. This page is educational and it is not medical advice. Last updated 10 de agosto de 2026.