Estadística inferencial · Gratis · Sin registro

Calculadora t de muestras independientes

Compara dos medias independientes mediante la prueba t de Welch usando estadísticos resumen.

Introduce tamaño, media y desviación estándar muestral de dos grupos independientes. La herramienta calcula diferencia M₁ − M₂, error estándar, t de Welch, grados de libertad aproximados, valor p bilateral, intervalo de confianza del 95% y g de Hedges. No decide si los grupos son independientes, no detecta valores atípicos y no convierte significación estadística en importancia práctica.

🔒 El tratamiento se realiza en este navegador; tus datos no se envían a FunnyTools.

Usar la herramienta

Grupo 1
Grupo 2

Qué puedes hacer aquí

  • Aceptar N, media y desviación estándar muestral de dos grupos.
  • Aplicar la prueba t de Welch sin imponer varianzas iguales.
  • Calcular diferencia de medias y error estándar.
  • Estimar grados de libertad Welch–Satterthwaite y p bilateral.
  • Construir un intervalo de confianza bilateral del 95%.
  • Estimar g de Hedges con corrección para muestras pequeñas.
  • Bloquear tamaños no enteros, DE no positivas y campos vacíos.
  • Invalidar resultados previos al editar una entrada.

Respuesta rápida: comparar dos medias con Welch

Introduce para cada grupo el tamaño N, la media M y la desviación estándar muestral DE. Los grupos deben estar formados por unidades distintas y las observaciones de uno no deben emparejarse con las del otro. Con N₁ = 30, M₁ = 78,4, DE₁ = 8,2 y N₂ = 32, M₂ = 73,1, DE₂ = 9,5, la calculadora obtiene la diferencia 5,3 y divide esa diferencia por √(DE₁²/N₁ + DE₂²/N₂).

La salida reúne t, grados de libertad aproximados y p bilateral, además de error estándar, IC del 95% y g de Hedges. Interprétalos juntos. El signo depende del orden: si intercambias los grupos, t, diferencia y g cambian de signo, pero el p bilateral y la evidencia sobre desigualdad no. Define Grupo 1 y Grupo 2 antes de calcular para que una diferencia positiva tenga un significado estable.

Por qué la calculadora utiliza la prueba de Welch

La versión de Welch no supone que las dos poblaciones tengan la misma varianza. NIST documenta el estadístico t = (M₁ − M₂)/√(s₁²/n₁ + s₂²/n₂) y los grados de libertad de Welch–Satterthwaite, especialmente útiles cuando tamaños o varianzas difieren. La variante agrupada usa una varianza común y gl = n₁ + n₂ − 2, pero esa igualdad necesita justificación; no debe seleccionarse solo porque una prueba preliminar no fue significativa.

Welch también funciona cuando los tamaños y desviaciones son parecidos, por lo que resulta una opción general razonable. Eso no elimina los demás supuestos. Los grupos siguen necesitando independencia, la media debe ser una medida pertinente y la distribución no debe estar dominada por errores o valores extremos. Con muestras pequeñas, una asimetría grave puede alterar la inferencia; examina gráficos y datos originales en lugar de decidir únicamente desde seis resúmenes.

  • Welch: varianzas no forzadas a ser iguales.
  • Agrupada: varianza común que debe ser defendible.
  • Relacionada: otra prueba para antes/después o pares emparejados.
  • Mann–Whitney: responde a otra formulación y tampoco elimina toda condición.

Independientes no significa simplemente dos columnas

Dos columnas pueden representar medidas repetidas de las mismas personas. En un diseño antes/después, gemelos emparejados, aulas comparadas por pareja o mediciones del mismo objeto, las observaciones tienen correspondencia y la prueba independiente desperdicia esa estructura. NIST distingue datos emparejados calculando diferencias dentro de cada par. Si cada fila del Grupo 1 se corresponde con una del Grupo 2, busca una prueba para muestras relacionadas.

También puede existir dependencia por conglomerados: estudiantes dentro de una misma clase, pacientes de un mismo centro o varias observaciones de la misma persona. Aumentar N contando registros correlacionados como independientes produce errores estándar demasiado pequeños. Esta calculadora solo ve N, M y DE; no puede detectar diseño, muestreo ni asignación. Describe quién es la unidad independiente y consulta un modelo multinivel o de medidas repetidas cuando corresponda.

Valor p, intervalo de confianza y decisión

El p bilateral cuantifica qué tan compatible es un |t| igual o más extremo con la hipótesis de diferencia poblacional cero bajo el modelo. No es la probabilidad de que la hipótesis nula sea verdadera y no mide la posibilidad de replicación. FunnyTools muestra `< .001` en lugar de `.000`. El umbral α debe fijarse antes del análisis; no conviertas .049 y .051 en conclusiones opuestas sin mirar incertidumbre, diseño y relevancia.

El intervalo del 95% se calcula como diferencia ± t crítico × error estándar. Si excluye cero, coincide con una prueba bilateral al 5% salvo redondeo. Sus extremos expresan un rango de valores compatibles con los datos y el modelo, no una garantía de que el 95% de las diferencias futuras caerá dentro. Conserva unidad y dirección: un IC [0,79, 9,81] puntos no implica lo mismo que ese rango en segundos o en una escala de 1 a 5.

g de Hedges y magnitud de la diferencia

g de Hedges estandariza M₁ − M₂ mediante una desviación agrupada y aplica una corrección por sesgo de muestra pequeña. Su signo conserva la dirección; su valor absoluto permite describir la diferencia en unidades de desviación estándar. Las etiquetas pequeño, medio y grande son referencias históricas, no leyes universales. Una diferencia pequeña puede ser importante en salud pública y una grande puede ser irrelevante si la medida no es válida.

El efecto estandarizado tampoco reemplaza la diferencia en unidades originales ni su intervalo. Esta página no calcula un intervalo para g y usa la desviación agrupada solo para el efecto, mientras la inferencia principal sigue siendo Welch. Si las dispersiones representan poblaciones muy distintas, un único denominador estandarizado puede ser difícil de interpretar. Informa las medias y DE de cada grupo, la diferencia, IC, t, gl, p y el efecto elegido.

Cómo redactar y verificar el resultado

Una redacción posible es: «El Grupo 1 (M = 78,40, DE = 8,20) obtuvo una media mayor que el Grupo 2 (M = 73,10, DE = 9,50); la prueba de Welch estimó una diferencia de 5,30 puntos, t(aprox. 59,7) = 2,35, p = .022, IC 95% [0,79, 9,81], g = 0,59». Sustituye las cifras por la salida real y no digas «demostró» si el diseño solo permite asociación.

Repite el cálculo en R, jamovi, JASP, SPSS u otro software para el informe definitivo. Compara orden de grupos, uso de DE muestral, alternativa bilateral, método de varianzas y redondeo. Si el software ofrece un resultado distinto, no el promedies: localiza la opción que cambió. FunnyTools no recibe datos individuales, así que no puede comprobar normalidad, atípicos, homogeneidad, ponderaciones, imputación ni observaciones excluidas.

Fórmula y criterio de cálculo

t = (M₁ − M₂) / √(s₁²/n₁ + s₂²/n₂)

Los grados de libertad usan Welch–Satterthwaite. El p es bilateral. El IC 95% usa el cuantil t con esos gl; g de Hedges usa una DE agrupada corregida para describir magnitud.

Cómo utilizarla paso a paso

  1. Confirma que los grupos y observaciones son independientes.
  2. Define el orden y la unidad de la variable.
  3. Introduce N entero, media y DE muestral de cada grupo.
  4. Pulsa Ejecutar prueba t de Welch.
  5. Lee diferencia, t, gl, p, error estándar, IC y g en conjunto.
  6. Contrasta supuestos y datos individuales en software estadístico.
  7. Informa método, dirección, unidades, incertidumbre y efecto.

Situaciones en las que resulta útil

  • Comparar dos métodos de enseñanza aplicados a estudiantes distintos.
  • Verificar un resultado de Welch publicado desde estadísticos resumen.
  • Mostrar cómo cambia el signo al invertir el orden de grupos.
  • Distinguir una diferencia estadística de una diferencia importante.
  • Detectar que un antes/después requiere muestras relacionadas.

Ejemplos completos

Dos aulas distintas

Cada estudiante aparece una vez. Welch compara las medias y el informe conserva la diferencia en puntos y su IC.

Pretest y postest

Son las mismas personas. El equipo no usa esta página y cambia a una prueba relacionada.

p pequeño, efecto modesto

Una muestra grande da p < .001, pero g y la diferencia original son pequeños. La conclusión separa evidencia y relevancia.

Revisión editorial y de funcionamiento:

Revisión antes de informar la prueba t

Una fórmula correcta no puede reparar dependencia, atípicos o una variable mal definida.

Diseño

Los grupos son independientes y la unidad no se repite.

Entradas

N, media, DE, unidad y orden coinciden con el análisis.

Conclusión

Diferencia, IC, p y efecto se interpretan juntos.

Lista de comprobación

  • La alternativa es bilateral.
  • Las DE son muestrales y positivas.
  • El signo se explica por el orden de grupos.
  • Se revisaron distribución y valores atípicos.
  • La redacción identifica Welch y no afirma causalidad sin diseño.

Límites y comprobaciones importantes

  • La entrada usa desviaciones estándar muestrales.
  • La prueba es bilateral y no pareada.
  • Welch no corrige dependencia ni valores atípicos.
  • El orden de grupos determina el signo.
  • p no mide magnitud ni probabilidad de la hipótesis.
  • El informe formal debe verificarse con datos y software adecuados.

Fuentes y documentación para comprobar

Preguntas frecuentes

¿Cuándo son independientes dos muestras?

Cuando una observación de un grupo no corresponde ni está vinculada a una del otro y la unidad no se repite.

¿Por qué se usa Welch y no varianzas iguales?

Welch permite varianzas y tamaños diferentes y suele ser una opción general más robusta.

¿Puedo usar DE poblacional?

La fórmula y el efecto de esta página esperan desviaciones estándar muestrales.

¿El valor p es unilateral o bilateral?

Bilateral. Contrasta diferencias en ambas direcciones.

¿Qué significa que el IC incluya cero?

Que una diferencia cero permanece compatible con el intervalo bilateral al 95% bajo el modelo y el redondeo usados.

¿g de Hedges es igual a Cohen d?

Son cercanos, pero g aplica una corrección para reducir sesgo en muestras pequeñas.

¿p < .05 significa un efecto grande?

No. Revisa diferencia, unidad, intervalo y tamaño del efecto.

¿Sirve para antes y después?

No si son las mismas personas o pares vinculados; utiliza una prueba para muestras relacionadas.

Privacidad y tratamiento local

Solo se procesan seis cifras en el navegador. No introduzcas nombres ni datos individuales.

Uso responsable del resultado

Ayuda educativa basada en estadísticos resumen. No sustituye el examen del diseño, los datos, los supuestos ni un análisis estadístico profesional.

Última revisión editorial: