La decisión se toma con tres datos: cuántos grupos comparas, si son independientes o pareados, y si tus datos cumplen normalidad. Esta tabla resuelve el 90 % de los casos de una tesis de Psicología de pregrado. Después vienen los criterios, los supuestos y qué hacer cuando algo falla.
Tabla de decisión rápida
| Lo que quieres hacer | Condición de los datos | Prueba paramétrica | Alternativa no paramétrica |
|---|---|---|---|
| Comparar 2 grupos independientes | VD continua, normalidad por grupo | t de Student para muestras independientes | U de Mann-Whitney |
| Comparar el mismo grupo antes y después | VD continua, diferencias normales | t de Student para muestras relacionadas | Wilcoxon de rangos con signo |
| Comparar 3 o más grupos independientes | VD continua, normalidad y homocedasticidad | ANOVA de un factor | Kruskal-Wallis |
| Comparar 3 o más medidas del mismo grupo | VD continua, esfericidad | ANOVA de medidas repetidas | Friedman |
| Relacionar dos variables continuas | Relación lineal, normalidad bivariada | r de Pearson | rho de Spearman |
| Asociar dos variables categóricas | Frecuencias esperadas ≥ 5 | χ² de independencia | Exacta de Fisher (tablas 2×2 pequeñas) |
| Predecir una VD continua desde varias VI | Linealidad, residuos normales, sin multicolinealidad | Regresión lineal múltiple | Regresión robusta o transformación |
| Predecir una VD dicotómica | Al menos 10 casos por predictor en la categoría menos frecuente | Regresión logística binaria | — |
| Verificar la estructura de una escala | KMO > ,70 y Bartlett significativo | Análisis factorial exploratorio o confirmatorio | — |
Cómo se lee la tabla: los tres criterios en orden
Criterio 1: el nivel de medición de tu variable dependiente
Esta es la primera bifurcación y la que más gente salta. Si tu variable dependiente es continua (puntaje total de una escala de ansiedad, tiempo de reacción, promedio de notas), estás en la mitad superior de la tabla. Si es categórica (aprueba o reprueba, presencia o ausencia de sintomatología, tipo de apego), estás en las filas de χ² y regresión logística.
Un punto que genera discusión permanente en las defensas de título: un ítem Likert individual es ordinal, pero el puntaje total de una escala Likert sumada se trata convencionalmente como continuo en la literatura psicológica. Puedes usar pruebas paramétricas sobre el puntaje total; sobre un ítem suelto, no.
Criterio 2: independientes o pareados
Grupos independientes: personas distintas en cada grupo (hombres frente a mujeres, grupo control frente a grupo experimental). Medidas relacionadas: las mismas personas medidas dos o más veces (pretest y postest, o antes y después de una intervención).
Aplicar una prueba de muestras independientes a un diseño pretest-postest es un error grave y frecuente: pierdes potencia estadística y violas el supuesto de independencia de las observaciones. Si tu diseño es cuasiexperimental con dos grupos y dos momentos, lo correcto no es hacer cuatro pruebas t sueltas, sino un ANOVA mixto de 2×2.
Criterio 3: normalidad
Se evalúa sobre la variable dependiente dentro de cada grupo, no sobre la muestra completa. Usa Shapiro-Wilk cuando n < 50 y Kolmogórov-Smirnov con corrección de Lilliefors cuando n es mayor. Un valor p menor a ,05 indica que se rechaza la normalidad.
Matiz importante que conviene tener listo para la defensa: con muestras grandes, la prueba de normalidad rechaza casi cualquier distribución por desviaciones triviales, y el teorema del límite central vuelve robusta a la t a partir de unos 30 casos por grupo. Por eso se recomienda mirar además la asimetría y la curtosis, y considerar aceptables valores entre −2 y +2. Declara ambos criterios en el método y tienes la decisión blindada.
Los supuestos que se olvidan y sí se preguntan
- Homocedasticidad: se verifica con la prueba de Levene. Si resulta significativa en una prueba t, no cambies de prueba: usa la corrección de Welch, que SPSS entrega en la segunda fila de la misma tabla. Muchos tesistas reportan la fila equivocada.
- Esfericidad: aplica solo a ANOVA de medidas repetidas con tres o más momentos. Se prueba con Mauchly y, si se incumple, se corrige con Greenhouse-Geisser.
- Independencia de las observaciones: no tiene prueba estadística, se sostiene por diseño. Si encuestaste cursos completos, tus datos están anidados y estrictamente requerirían modelos multinivel; a nivel de pregrado basta con declararlo como limitación.
- Multicolinealidad en regresión: revisa el factor de inflación de varianza. Un VIF sobre 10 es problema serio; sobre 5 conviene revisar.
- Frecuencias esperadas en χ²: si más del 20 % de las casillas tiene frecuencia esperada menor a 5, el χ² no es válido y corresponde la prueba exacta de Fisher.
Tamaño del efecto: la corrección más pedida por las comisiones
Reportar solo el valor p ya no se acepta. APA 7 exige tamaño del efecto y las comisiones chilenas lo revisan. Cada prueba tiene el suyo:
- t de Student: d de Cohen. Interpretación convencional: 0,20 pequeño, 0,50 mediano, 0,80 grande.
- ANOVA: eta cuadrado parcial (η²ₚ). Referencia: ,01 pequeño, ,06 mediano, ,14 grande.
- Correlación: el propio r es el tamaño del efecto. ,10 pequeño, ,30 mediano, ,50 grande.
- χ²: V de Cramér o phi en tablas 2×2.
- Mann-Whitney: r = Z / √N.
- Regresión: R² y R² ajustado, además de los coeficientes beta estandarizados.
Un resultado con p = ,048 y d = 0,15 es estadísticamente significativo y prácticamente irrelevante. Decirlo tú en el capítulo de discusión, antes de que lo diga la comisión, es lo que separa una tesis aprobada de una tesis aprobada con distinción.
Qué software conviene según tu caso
- SPSS: el estándar en las escuelas de Psicología chilenas. Menús claros, salida directa. La licencia institucional suele estar disponible para estudiantes de la Universidad de Chile, la Pontificia Universidad Católica y la USACH mientras mantengas matrícula vigente. Verifica hasta qué fecha, porque muchas licencias caen al egresar y te dejan sin acceso justo en la etapa de análisis.
- Jamovi: gratuito, de código abierto y con interfaz muy parecida a SPSS. Entrega tamaños del efecto por defecto y salidas ya con formato APA. Para una tesis de pregrado cubre todo lo de la tabla salvo modelos avanzados.
- JASP: gratuito, fuerte en análisis bayesiano si tu profesor guía trabaja en esa línea.
- R: sin límites y reproducible, con curva de aprendizaje real. Vale la pena si piensas seguir a magíster o doctorado.
- Excel: sirve para depurar y describir. Para pruebas inferenciales queda corto y no entrega tamaños del efecto.
Ninguno de estos programas decide por ti: interpretar la salida sigue siendo tu trabajo, igual que ocurre con los asistentes de escritura revisados en la comparativa de herramientas de IA para tesis por tarea.
Recomendación: si tu licencia de SPSS está vigente y tu escuela enseña con SPSS, usa SPSS. Si no la tienes, jamovi es la opción sin costo que menos fricción genera con lo que ya sabes hacer. Para el trabajo cualitativo o mixto, la elección es otra y está cubierta en la comparativa de software de análisis de datos por tipo de análisis.
Cómo se reporta cada resultado en APA 7
Formato exacto, con coma decimal y sin cero a la izquierda en los valores p:
- t(58) = 2,41, p = ,019, d = 0,63
- F(2, 87) = 5,72, p = ,005, η²ₚ = ,116
- r(83) = ,34, p = ,002
- χ²(2, N = 120) = 3,17, p = ,205, V = ,16
- U = 312,50, Z = −2,08, p = ,038, r = ,23
Cuando el valor p es menor a ,001, se escribe p < ,001 y nunca p = ,000. Ese “000” que copia y pega SPSS es una de las observaciones más repetidas en las actas de defensa de título. La redacción del resto de la sección se ordena con el procedimiento paso a paso para el capítulo de resultados.
Antes de la prueba: el instrumento y el tamaño muestral
Ninguna prueba salva un instrumento mal elegido. Antes de correr análisis, verifica que la escala esté validada, que reportes su alfa de Cronbach en tu propia muestra y que los puntos de corte correspondan a la población que estudiaste. El criterio completo de selección de instrumentos está en la guía sobre cómo elegir una escala validada y verificar su licencia, y aplica igual en Psicología.
Sobre el tamaño muestral: calcúlalo antes de recolectar, no después. Con G*Power 3.1, detectar una correlación de ,30 con potencia de ,80 y alfa de ,05 requiere unos 85 casos; comparar dos grupos con efecto mediano, unos 64 por grupo; un ANOVA de tres grupos con efecto mediano, alrededor de 159 en total. Declara los parámetros exactos en el método y esa pregunta queda respondida por escrito.
Errores que cuestan puntos en la defensa
- Elegir la prueba después de mirar cuál da significativo. Es la práctica que la literatura llama p-hacking y se detecta al comparar el método con los resultados.
- Hacer múltiples pruebas t en vez de un ANOVA y no corregir el error tipo I. Con seis comparaciones, la probabilidad de un falso positivo supera el 25 %.
- Interpretar una correlación como causalidad. Basta un verbo mal elegido: “influye”, “provoca”, “genera”.
- Eliminar casos atípicos sin criterio declarado ni reporte de cuántos se eliminaron.
- Concluir que “no hay diferencia” a partir de un resultado no significativo. Lo correcto es que no se encontró evidencia suficiente de diferencia, que no es lo mismo.
Los cinco aparecen con frecuencia en la lista de preguntas que hace la comisión evaluadora. Anticípalos revisando qué preguntan realmente en la defensa de tesis y prepara una respuesta de dos frases para cada decisión estadística que tomaste.
Deja el capítulo de análisis escrito, no solo calculado
Correr la prueba en SPSS toma diez minutos. Redactar el capítulo de análisis, justificar cada decisión metodológica y dejar todas las citas en APA 7 es lo que consume las semanas. Tesify parte de tu diseño y tus objetivos y te devuelve la sección de análisis redactada con la justificación de las pruebas escogidas y las referencias formateadas, para que tú revises y ajustes con tu criterio. Redacta tu capítulo de análisis con Tesify y llega a la reunión con tu profesor guía con el texto listo para comentar.
Preguntas frecuentes
¿Puedo usar pruebas paramétricas si mi muestra es menor a 30?
Sí, siempre que se cumpla normalidad, que con muestras chicas hay que verificar con Shapiro-Wilk. Bajo 30 casos por grupo y sin normalidad, la alternativa no paramétrica es la decisión segura.
¿Qué hago si mis datos no cumplen normalidad?
Tienes tres caminos: usar la prueba no paramétrica equivalente, transformar la variable (logaritmo o raíz cuadrada) o aplicar métodos robustos con bootstrap. El primero es el más simple de defender en pregrado.
¿Las pruebas no paramétricas son de peor calidad?
No. Tienen algo menos de potencia cuando la normalidad sí se cumple, pero son la opción correcta cuando no se cumple. Usar una prueba paramétrica sobre datos que violan sus supuestos es mucho peor que perder algo de potencia.
¿Cuándo uso Pearson y cuándo Spearman?
Pearson con dos variables continuas, relación lineal y normalidad bivariada. Spearman cuando alguna variable es ordinal, cuando hay valores atípicos marcados o cuando la relación es monótona pero no lineal.
¿Necesito hipótesis estadísticas formales en una tesis descriptiva?
No. Un estudio descriptivo no formula hipótesis contrastables y solo reporta estadística descriptiva. Las hipótesis corresponden a diseños correlacionales, comparativos o explicativos.
¿Es válido usar jamovi si en mi escuela enseñaron SPSS?
Totalmente. Ambos entregan los mismos estadísticos y jamovi corre sobre el mismo motor de R. Solo declara en el método el software y su versión, como corresponde en cualquier caso.
¿Cómo trato los datos perdidos?
Declara cuántos hubo y qué hiciste. Con menos del 5 % de pérdida aleatoria, eliminar el caso es aceptable. Con más, conviene imputar por media de la dimensión o por método de máxima verosimilitud, siempre explicándolo en el método.
